Lokale Matrix liefert Ergebnisse: 119 Anforderungen aus Gemma und Qwen

Skill 13.0.0/13.1.0, Adapter 2.5.2.

Spiegel-Arbeitsverzeichnis: OpenCode laeuft nicht mehr direkt im
Codebasis-Root, sondern in einem Verzeichnis aus Junctions auf die
Top-Level-Eintraege, mit einem echten Ergebnisverzeichnis, dessen Inhalt
nach dem Lauf uebernommen wird. Damit landen relative wie absolute
Ausgabepfade am richtigen Ort, ohne dass der Prompt vom Wortlaut der
Claude-Laeufe abweichen muss. Der Spiegel liegt in _meta des Laufs; die
Codebasis bleibt unberuehrt.

Der Spiegel allein genuegte nicht. Sechs Laeufe schrieben mit korrektem
absolutem Pfad und wurden dennoch abgewiesen, weil OpenCode Ziele im
Repository gegen den worktree-relativen Pfad abgleicht - ein Befund, der
seit Skill 10.0.2 dokumentiert war und erst sichtbar wurde, als der
Spiegel vom Temp-Verzeichnis ins Projekt wanderte.

analyse-anforderungen.py erkennt Kennungen als Markdown-Ueberschrift, auch
ohne Feldnamen, sofern die Pflichtfelder folgen. Regressionsprobe an fuenf
Claude-Laeufen unveraendert.

Ergebnisse der gueltigen Laeufe: Qwen 3.5-9B liefert 107 der 119
Anforderungen, davon 75 im Modus custom mit nur drei Subagenten. Gemma
kommt auf 12. Der Modus builtin fiel bei beiden Modellen aus - drei von
drei Laeufen endeten nach einem Turn ohne einen Werkzeugaufruf. Die 13
Laeufe mit Adapter 2.3.0 bis 2.5.1 sind Artefakte der Fehlersuche und
als adapterbedingte Fehlmessungen gekennzeichnet.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
Christoph Schwörer
2026-09-01 22:49:53 +02:00
co-authored by Claude Opus 5
parent 28e927013b
commit 6c5c26a2e4
416 changed files with 85993 additions and 13 deletions
+53
View File
@@ -1350,6 +1350,59 @@ eigenstaendige Aussage ueber lokal betriebene kleine Modelle zu lesen, nicht als
---
### Die lokale Matrix liefert Ergebnisse: Gemma gegen Qwen (01.09.2026)
Nach der Behebung des Ausgabepfad-Problems (Skill 13.0.0/13.1.0) liegen erstmals verwertbare
lokale Messpunkte vor. Bedingung: Spiegel-Arbeitsverzeichnis, Denylist, **131.072 Kontexttokens
fuer beide Modelle**, alleiniges Modell auf der GPU, Standard-Ausgabeblock im Wortlaut der
Claude-Laeufe.
| Modell | Modus | Dateien | Anforderungen | Turns | Werkzeuge | Subagenten | Tokens |
|---|---|---:|---:|---:|---:|---:|---:|
| `gemma-4-e4b` | solo | 6 | **12** | 20 | 21 | 0 | 700.054 |
| `gemma-4-e4b` | solo | 6 | 0 | 11 | 10 | 0 | 398.082 |
| `gemma-4-e4b` | builtin | 0 | 0 | 1-5 | 0-4 | 0-3 | 10.808 / 65.999 |
| `gemma-4-e4b` | custom | 0 | 0 | 7 | 6-11 | 4-11 | 118.523 / 228.231 |
| `qwen3.5-9b` | solo | 7 | **32** | 35 | 43 | 0 | 1.398.994 |
| `qwen3.5-9b` | builtin | 0 | 0 | 1 | 0 | 0 | 10.573 |
| `qwen3.5-9b` | custom | 6 | **75** | 15 | 15 | 3 | 620.080 |
**Qwen 3.5-9B ist Gemma deutlich ueberlegen.** 107 der 119 Anforderungen entfallen auf Qwen, das
zudem in beiden nicht-delegierenden Zellen lieferte. Der Groessenunterschied ist mit 9B gegen 7,5B
gering; hinzu kommt allerdings ein Quantisierungsunterschied (Q8_0 gegen Q4_K_M), der die beiden
nicht sauber trennbar macht - er ist als Einschraenkung mitzufuehren.
**`builtin` fiel bei beiden Modellen aus.** Drei von drei Laeufen endeten nach einem einzigen Turn
**ohne einen einzigen Werkzeugaufruf**; der Agent kuendigte die Arbeit an und beendete den Zug:
*"Ich erstelle das Modulinventar - dazu lese ich zunaechst die gesamte Codebasis."* Das ist kein
Abbruch durch den Aufbau, sondern Modellverhalten: Die blosse Verfuegbarkeit werkzeugeigener
Subagenten scheint die Modelle zu veranlassen, den eigenen Zug fuer beendet zu halten.
**Der beste lokale Messpunkt entsteht im Modus `custom`.** Qwens custom-Lauf lieferte in 76
Minuten 75 Anforderungen ueber sechs Dateien - eine Groessenordnung, die mit den TensorX-Laeufen
vergleichbar ist. Bemerkenswert: Er brauchte dafuer nur **drei** Subagenten und 15 Werkzeugaufrufe,
waehrend der solo-Lauf mit 43 Aufrufen und 1,4 Mio. Tokens auf 32 Anforderungen kam. Die
Rollenspezialisierung war hier also nicht nur ertragreicher, sondern auch sparsamer.
**Formattreue ist die zweite Huerde nach dem Ausgabepfad.** Von den vier Laeufen mit Artefakten
lieferten drei formkonforme Bloecke; einer schrieb sechs korrekt benannte Dateien mit
Aufzaehlungslisten statt Anforderungsbloecken - ohne Kennungen, ohne Ebenen, ohne Pruefideen. Dort
sind die 0 Anforderungen eine korrekte Messung, keine Parserschwaeche. Die Unterscheidung zwischen
*anders formatiert* (Markdown statt Klartext, wird erkannt) und *anders strukturiert* (eigenes
Schema, wird nicht gezaehlt) ist fuer die Auswertung wesentlich.
**Einschraenkung: ein Durchgang ist keine Matrix.** Je Zelle liegen ein bis zwei Laeufe vor. Die
Streuung war in dieser Reihe durchweg die dominierende Groesse - Gemmas beide solo-Laeufe
unterscheiden sich bei identischer Bedingung um 12 gegen 0 Anforderungen. Fuer belastbare
Aussagen sind Wiederholungen noetig.
**Nicht in die Auswertung eingehen** die 13 Laeufe der Iterationen 15 und 8 mit Adapter-Versionen
2.3.0 bis 2.5.1. Sie entstanden waehrend der Fehlersuche am Ausgabepfad und sind Artefakte
defekter Adapterstaende, keine Modellergebnisse. Sie bleiben mit Protokoll erhalten, sind aber als
adapterbedingte Fehlmessungen gekennzeichnet.
---
## 6. Befunde
### 6.1 Die Anforderungsanzahl ist kein Qualitätsmaß