Lokale Matrix liefert Ergebnisse: 119 Anforderungen aus Gemma und Qwen
Skill 13.0.0/13.1.0, Adapter 2.5.2. Spiegel-Arbeitsverzeichnis: OpenCode laeuft nicht mehr direkt im Codebasis-Root, sondern in einem Verzeichnis aus Junctions auf die Top-Level-Eintraege, mit einem echten Ergebnisverzeichnis, dessen Inhalt nach dem Lauf uebernommen wird. Damit landen relative wie absolute Ausgabepfade am richtigen Ort, ohne dass der Prompt vom Wortlaut der Claude-Laeufe abweichen muss. Der Spiegel liegt in _meta des Laufs; die Codebasis bleibt unberuehrt. Der Spiegel allein genuegte nicht. Sechs Laeufe schrieben mit korrektem absolutem Pfad und wurden dennoch abgewiesen, weil OpenCode Ziele im Repository gegen den worktree-relativen Pfad abgleicht - ein Befund, der seit Skill 10.0.2 dokumentiert war und erst sichtbar wurde, als der Spiegel vom Temp-Verzeichnis ins Projekt wanderte. analyse-anforderungen.py erkennt Kennungen als Markdown-Ueberschrift, auch ohne Feldnamen, sofern die Pflichtfelder folgen. Regressionsprobe an fuenf Claude-Laeufen unveraendert. Ergebnisse der gueltigen Laeufe: Qwen 3.5-9B liefert 107 der 119 Anforderungen, davon 75 im Modus custom mit nur drei Subagenten. Gemma kommt auf 12. Der Modus builtin fiel bei beiden Modellen aus - drei von drei Laeufen endeten nach einem Turn ohne einen Werkzeugaufruf. Die 13 Laeufe mit Adapter 2.3.0 bis 2.5.1 sind Artefakte der Fehlersuche und als adapterbedingte Fehlmessungen gekennzeichnet. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
28e927013b
commit
6c5c26a2e4
@@ -1350,6 +1350,59 @@ eigenstaendige Aussage ueber lokal betriebene kleine Modelle zu lesen, nicht als
|
||||
|
||||
---
|
||||
|
||||
### Die lokale Matrix liefert Ergebnisse: Gemma gegen Qwen (01.09.2026)
|
||||
|
||||
Nach der Behebung des Ausgabepfad-Problems (Skill 13.0.0/13.1.0) liegen erstmals verwertbare
|
||||
lokale Messpunkte vor. Bedingung: Spiegel-Arbeitsverzeichnis, Denylist, **131.072 Kontexttokens
|
||||
fuer beide Modelle**, alleiniges Modell auf der GPU, Standard-Ausgabeblock im Wortlaut der
|
||||
Claude-Laeufe.
|
||||
|
||||
| Modell | Modus | Dateien | Anforderungen | Turns | Werkzeuge | Subagenten | Tokens |
|
||||
|---|---|---:|---:|---:|---:|---:|---:|
|
||||
| `gemma-4-e4b` | solo | 6 | **12** | 20 | 21 | 0 | 700.054 |
|
||||
| `gemma-4-e4b` | solo | 6 | 0 | 11 | 10 | 0 | 398.082 |
|
||||
| `gemma-4-e4b` | builtin | 0 | 0 | 1-5 | 0-4 | 0-3 | 10.808 / 65.999 |
|
||||
| `gemma-4-e4b` | custom | 0 | 0 | 7 | 6-11 | 4-11 | 118.523 / 228.231 |
|
||||
| `qwen3.5-9b` | solo | 7 | **32** | 35 | 43 | 0 | 1.398.994 |
|
||||
| `qwen3.5-9b` | builtin | 0 | 0 | 1 | 0 | 0 | 10.573 |
|
||||
| `qwen3.5-9b` | custom | 6 | **75** | 15 | 15 | 3 | 620.080 |
|
||||
|
||||
**Qwen 3.5-9B ist Gemma deutlich ueberlegen.** 107 der 119 Anforderungen entfallen auf Qwen, das
|
||||
zudem in beiden nicht-delegierenden Zellen lieferte. Der Groessenunterschied ist mit 9B gegen 7,5B
|
||||
gering; hinzu kommt allerdings ein Quantisierungsunterschied (Q8_0 gegen Q4_K_M), der die beiden
|
||||
nicht sauber trennbar macht - er ist als Einschraenkung mitzufuehren.
|
||||
|
||||
**`builtin` fiel bei beiden Modellen aus.** Drei von drei Laeufen endeten nach einem einzigen Turn
|
||||
**ohne einen einzigen Werkzeugaufruf**; der Agent kuendigte die Arbeit an und beendete den Zug:
|
||||
*"Ich erstelle das Modulinventar - dazu lese ich zunaechst die gesamte Codebasis."* Das ist kein
|
||||
Abbruch durch den Aufbau, sondern Modellverhalten: Die blosse Verfuegbarkeit werkzeugeigener
|
||||
Subagenten scheint die Modelle zu veranlassen, den eigenen Zug fuer beendet zu halten.
|
||||
|
||||
**Der beste lokale Messpunkt entsteht im Modus `custom`.** Qwens custom-Lauf lieferte in 76
|
||||
Minuten 75 Anforderungen ueber sechs Dateien - eine Groessenordnung, die mit den TensorX-Laeufen
|
||||
vergleichbar ist. Bemerkenswert: Er brauchte dafuer nur **drei** Subagenten und 15 Werkzeugaufrufe,
|
||||
waehrend der solo-Lauf mit 43 Aufrufen und 1,4 Mio. Tokens auf 32 Anforderungen kam. Die
|
||||
Rollenspezialisierung war hier also nicht nur ertragreicher, sondern auch sparsamer.
|
||||
|
||||
**Formattreue ist die zweite Huerde nach dem Ausgabepfad.** Von den vier Laeufen mit Artefakten
|
||||
lieferten drei formkonforme Bloecke; einer schrieb sechs korrekt benannte Dateien mit
|
||||
Aufzaehlungslisten statt Anforderungsbloecken - ohne Kennungen, ohne Ebenen, ohne Pruefideen. Dort
|
||||
sind die 0 Anforderungen eine korrekte Messung, keine Parserschwaeche. Die Unterscheidung zwischen
|
||||
*anders formatiert* (Markdown statt Klartext, wird erkannt) und *anders strukturiert* (eigenes
|
||||
Schema, wird nicht gezaehlt) ist fuer die Auswertung wesentlich.
|
||||
|
||||
**Einschraenkung: ein Durchgang ist keine Matrix.** Je Zelle liegen ein bis zwei Laeufe vor. Die
|
||||
Streuung war in dieser Reihe durchweg die dominierende Groesse - Gemmas beide solo-Laeufe
|
||||
unterscheiden sich bei identischer Bedingung um 12 gegen 0 Anforderungen. Fuer belastbare
|
||||
Aussagen sind Wiederholungen noetig.
|
||||
|
||||
**Nicht in die Auswertung eingehen** die 13 Laeufe der Iterationen 15 und 8 mit Adapter-Versionen
|
||||
2.3.0 bis 2.5.1. Sie entstanden waehrend der Fehlersuche am Ausgabepfad und sind Artefakte
|
||||
defekter Adapterstaende, keine Modellergebnisse. Sie bleiben mit Protokoll erhalten, sind aber als
|
||||
adapterbedingte Fehlmessungen gekennzeichnet.
|
||||
|
||||
---
|
||||
|
||||
## 6. Befunde
|
||||
|
||||
### 6.1 Die Anforderungsanzahl ist kein Qualitätsmaß
|
||||
|
||||
Reference in New Issue
Block a user