TensorX-Matrix: erste vollstaendig besetzte Matrix, 918 Anforderungen

Sechs Zellen - z-ai/glm-5.3-flash und qwen/qwen3.8-flash-next je solo,
builtin und custom - alle mit dem kompletten Artefaktsatz von sieben
Dateien. 47,1 Mio. Tokens in 6,4 Stunden, hochgerechnet rund $3,25.

Das Matrixskript heisst jetzt _matrix.ps1 und nimmt -Provider und
-Effort; die LM-Studio-Ladeparameter werden nur noch lokal uebergeben.
Vor dem Start bestaetigte ein Smoke-Test den TensorX-Pfad unter den
seither geaenderten Bedingungen (Denylist, Spiegel, Freigabemuster):
Anmeldung, Modellkontrolle, wirksame Effort-Variante und Dateiuebernahme.

Befund: Die Anforderungsanzahl haette in die Irre gefuehrt. Qwens
custom-Lauf liegt mit 157 Anforderungen im Mittelfeld, ist aber
qualitativ zusammengebrochen - 61 Prozent ohne jeden Beleg, 17 Prozent
mit Primaerbeleg, 40 Prozent Hypothesen, gegenueber 0 Prozent ohne Beleg
und 79 bis 98 Prozent Primaerbelegen in den uebrigen fuenf Laeufen. Er
lieferte zugleich weniger als builtin bei 37 Prozent mehr Tokens.

Der Moduseffekt ist modellabhaengig: Bei GLM steigt der Ertrag monoton
von 126 ueber 139 auf 216 bei durchgaengig hoher Belegqualitaet, bei Qwen
ist builtin das Optimum. Die Annahme, rollenspezialisierte Agenten seien
generell ueberlegen, traegt damit nicht.

Qwens custom-Lauf meldet exit_code 1 bei finish_reason stop und ohne
Timeout, nachdem alle 24 Subagenten zurueckkamen und sieben Dateien
entstanden. Er ist als gueltig mit Vorbehalt gefuehrt, die Ursache offen.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
Christoph Schwörer
2026-09-02 16:21:31 +02:00
co-authored by Claude Opus 5
parent 6c5c26a2e4
commit e2c3a0e8f8
135 changed files with 102006 additions and 17 deletions
+50
View File
@@ -1403,6 +1403,56 @@ adapterbedingte Fehlmessungen gekennzeichnet.
---
### TensorX-Matrix mit den beiden guenstigsten Modellen (02.09.2026)
Erste vollstaendig besetzte Matrix der Reihe: zwei Modelle x drei Agentenmodi, alle sechs Zellen
mit dem kompletten Artefaktsatz von sieben Dateien. Bedingung: Skill 13.1.0, Adapter 2.5.2,
Denylist, Spiegel-Arbeitsverzeichnis, Effort `high`, Standard-Ausgabeblock.
Vor dem Start wurde der TensorX-Pfad mit einem Smoke-Test geprueft - seit dem letzten Lauf hatten
sich Denylist, Arbeitsverzeichnis und Freigabemuster geaendert, ohne dass er seither einmal lief.
Der Test bestaetigte Anmeldung, Modellkontrolle, wirksame Effort-Variante (`effort_applied: true`,
anders als lokal) und den Spiegel auch im Remotebetrieb.
| Modell | Modus | Min | Turns | Tools | Sub | Anforderungen | Primaerbeleg | ohne Beleg | Hypothesen | Tokens |
|---|---|---:|---:|---:|---:|---:|---:|---:|---:|---:|
| `glm-5.3-flash` | solo | 22,7 | 71 | 111 | 0 | 126 | 97 % | 0 % | 3 % | 6.336.907 |
| `glm-5.3-flash` | builtin | 45,8 | 32 | 76 | 7 | 139 | 95 % | 0 % | 3 % | 4.316.088 |
| `glm-5.3-flash` | custom | 129,1 | 45 | 81 | 30 | **216** | 91 % | 0 % | 1 % | 11.467.996 |
| `qwen3.8-flash-next` | solo | 19,1 | 93 | 135 | 0 | 81 | 79 % | 0 % | 17 % | 6.432.032 |
| `qwen3.8-flash-next` | builtin | 52,5 | 71 | 116 | 13 | **199** | 98 % | 0 % | 11 % | 7.830.882 |
| `qwen3.8-flash-next` | custom | 112,5 | 85 | 99 | 24 | 157 | **17 %** | **61 %** | **40 %** | 10.715.498 |
**918 Anforderungen, 47,1 Mio. Tokens, 6,4 Stunden.** Hochgerechnet aus der Preisliste vom
02.09.2026 ($0,20 Input / $0,50 Output je 1 Mio.) rund **$3,25** - TensorX liefert keine
Kostenangabe, `cost` bleibt `0`.
**Die Anzahl allein haette in die Irre gefuehrt.** Qwens custom-Lauf steht mit 157 Anforderungen
im Mittelfeld, ist aber qualitativ zusammengebrochen: **61 % ohne jeden Beleg**, nur 17 % mit
Primaerbeleg, 40 % als Hypothese gekennzeichnet. Alle uebrigen fuenf Laeufe kommen auf 0 % ohne
Beleg und 79 bis 98 % Primaerbelege. Dieselbe Zelle lieferte zugleich weniger als `builtin`
(157 gegen 199) bei 37 % mehr Tokens. Der Modus `custom` war fuer dieses Modell also teurer,
ertragsaermer **und** schlechter belegt - ein Befund, der ohne die Belegpruefung unsichtbar
geblieben waere und Befund 6.1 (Anforderungsanzahl ist kein Qualitaetsmass) erneut bestaetigt.
**Der Moduseffekt ist modellabhaengig.** Bei GLM steigt der Ertrag monoton (126 -> 139 -> 216)
bei durchgaengig hoher Belegqualitaet. Bei Qwen ist `builtin` das Optimum, `custom` faellt ab.
Die Annahme, rollenspezialisierte Agenten seien generell ueberlegen, traegt damit nicht; sie
scheint an das Modell gebunden zu sein. Mit einem Lauf je Zelle ist das ein Hinweis, keine
belastbare Aussage - die Streuung ist in dieser Reihe durchweg die dominierende Groesse.
**Ebenenverteilung.** Alle Laeufe legen den Schwerpunkt auf SwRS; am ausgewogensten ist Qwens
custom-Lauf (41/60/56), am schiefsten Qwens builtin-Lauf (16/49/134). Die StRS-Ebene bleibt
durchgaengig duenn - dasselbe Muster wie in den Claude-Laeufen.
**Ein Lauf mit Vorbehalt.** Qwens custom-Lauf meldet `exit_code: 1` bei `finish_reason: stop` und
ohne Timeout: OpenCode beendete sich mit Fehlercode, nachdem alle 24 Subagenten zurueckgekehrt
waren und sieben Dateien geschrieben hatte. Nach Pflichtpruefung ist er formal eine Fehlmessung,
inhaltlich vollstaendig. Er wird als *gueltig mit Vorbehalt* gefuehrt; die Ursache des Exitcodes
ist offen.
---
## 6. Befunde
### 6.1 Die Anforderungsanzahl ist kein Qualitätsmaß