Lots of runs
This commit is contained in:
+269
-14
@@ -1,6 +1,7 @@
|
||||
# Ablaufprotokoll der Versuchsdurchführung
|
||||
|
||||
**Zeitraum:** 25.–26. August 2026
|
||||
**Ablage der Läufe:** `Versuche/Versuch_01/Tag 1/` – alle 24 Läufe entstanden am 25. August
|
||||
**Untersuchungsgegenstand:** c-entron ERP-Suite, eingefrorener Snapshot `79c1142`
|
||||
**Zweck dieses Dokuments:** Grundlage für den Ergebnisteil der Arbeit (Kapitel 5 und 6).
|
||||
|
||||
@@ -29,7 +30,7 @@ gleichen Bedingungen streuen.
|
||||
|
||||
---
|
||||
|
||||
## 2. Chronologie in fünf Phasen
|
||||
## 2. Chronologie in sechs Phasen
|
||||
|
||||
### Phase 1 – Erster Lauf und die Entdeckung der Werkzeugkonfiguration (12:29–13:00)
|
||||
|
||||
@@ -135,10 +136,156 @@ Abgleich der tatsächlich eingesetzten Modelle wurde zur Pflichtprüfung.
|
||||
|
||||
### Phase 5 – Nachbereitung und Ausrichtung auf die Arbeit (26.08.)
|
||||
|
||||
Nach Abschluss der Läufe wurden Struktur und Dokumentation konsolidiert: Umstellung der
|
||||
Kostenangabe auf Tokenverbrauch, Ordnerstruktur nach Bedingungen, maschinelle Auswertung der
|
||||
erzeugten Anforderungen, Sicherung des Untersuchungsgegenstands im Arbeitsrepository sowie die
|
||||
Trennung von Analyseanweisung (Prompt) und Prozessvorgabe (Skill).
|
||||
Nach Abschluss der Läufe folgte die Konsolidierung. Sie ist kein bloßes Aufräumen: Mehrere
|
||||
Schritte haben Messfehler aufgedeckt oder die Belastbarkeit der Ergebnisse erst hergestellt.
|
||||
|
||||
**Aufwandsgröße von Kosten auf Tokenverbrauch umgestellt** (Skill 3.5.0). USD-Beträge hängen an
|
||||
Preisliste und Modellwahl und veralten; Token sind die unmittelbare Verbrauchsgröße. Bei der
|
||||
Umstellung fiel auf, dass sich die berichteten Streuungsfaktoren ändern: In Dollar lag V1 gegen
|
||||
V1b bei Faktor 2,1 zu 5,6, in Token bei 2,9 zu 4,6. Cache-Read-Token werden günstiger
|
||||
abgerechnet als Output-Token – eine reine Tokensumme gewichtet sie gleich, der Preis nicht.
|
||||
Die inhaltliche Aussage bleibt, der Abstand ist geringer als die Dollarwerte nahelegten.
|
||||
|
||||
**Verschachtelte Subagenten verifiziert** (Skill 3.6.0). Bis dahin war unbelegt, ob Subagenten
|
||||
auf Tiefe 2 in die Tokensumme einfließen. Ein Kontrolltest mit erzwungener Kaskade, bei dem
|
||||
ausschließlich der Enkel-Agent arbeitete, ergab 49.103 Token im Hauptagenten gegenüber 1.689.288
|
||||
in `modelUsage` – die Differenz stammt nachweislich von der tieferen Ebene. Nebenbefund:
|
||||
Subagenten-Transkripte werden nicht separat persistiert, ihre Prompts sind daher nicht
|
||||
rekonstruierbar, ihre Tokens dagegen vollständig erfasst.
|
||||
|
||||
**Untersuchungsgegenstand im Arbeitsrepository gesichert.** Die Codebasis war nur als Gitlink
|
||||
auf `79c1142` getrackt – ohne `.gitmodules` und ohne erreichbares Remote, nachdem das
|
||||
GitHub-Remote zu Versuchsbeginn entkoppelt worden war. Ein Klon des Arbeitsrepositories hätte
|
||||
ein leeres Verzeichnis erhalten; keiner der 3.287 Anforderungsbelege wäre überprüfbar gewesen.
|
||||
Die Historie wurde aus dem Arbeitsbaum ausgelagert und der Dateiinhalt als reguläre Dateien
|
||||
aufgenommen: 24.557 Dateien, rund 333 MB. Prompts, Protokolle, Ergebnisartefakte und der
|
||||
analysierte Quellcode sind damit gemeinsam versioniert.
|
||||
|
||||
**Maschinelle Auswertung der Anforderungen** (Skill 3.9.0). Die Protokolle maßen bis dahin nur
|
||||
den Aufwand, nicht den Ertrag. Ein Auswertungsskript parst die 3.287 Anforderungsblöcke und
|
||||
erhebt Verteilung, Typen, Belegqualität, Status und – methodisch am wertvollsten – die
|
||||
**Regelkonformität gegen die Vorgaben des Prompts selbst**. Erste Anwendung deckte sofort
|
||||
Verstöße gegen die risikobasierte Priorisierung auf, die von Hand nicht auffindbar gewesen wären.
|
||||
|
||||
**Ordnerstruktur nach Bedingungen** (Skill 3.10.0, später 4.1.0). Modell, Agentenmodus und
|
||||
Effort wurden von Namensbestandteilen zu Ordnerebenen; darüber kam die Ebene `<Versuchstag>`.
|
||||
Die Zellenbelegung ist damit unmittelbar abzählbar – und die Struktur macht sichtbar, dass von
|
||||
den möglichen Kombinationen nur fünf belegt sind.
|
||||
|
||||
**Ausrichtung auf Kapitel 4** (Skill 4.0.0). Prompt und Skill waren organisch gewachsen und
|
||||
stellenweise nicht mehr deckungsgleich mit dem Versuchsdesign der Arbeit. Der Prompt enthielt
|
||||
Aussagen zur Werkzeugkonfiguration, die ihn an ein bestimmtes Werkzeug banden; der Skill
|
||||
verankerte weder den Evaluationsrahmen noch die geforderten Reproduzierbarkeitsangaben. Beides
|
||||
wurde getrennt: Der Prompt trägt seither ausschließlich die Analyseanweisung, der Skill den
|
||||
Prozess. Werkzeugkontext und Ausgabeverzeichnis werden zur Laufzeit angehängt.
|
||||
|
||||
Dabei fiel die Zuordnungsfrage an: Die Arbeit kannte nur V1 „Prompt-only, keine Agentendateien".
|
||||
Werkzeugeigene Subagenten sind keine Agentendateien und wären nach Wortlaut in V1 erlaubt –
|
||||
ihr Einsatz verändert die Ergebnisse aber erheblich. Entschieden wurde **V1 = `solo`,
|
||||
V1b = `builtin`**; Kapitel 4 der Arbeit wurde um V1b und um einen Absatz zum vorgezogenen
|
||||
Modellvergleich ergänzt.
|
||||
|
||||
**Prompt-Version 02** (Skill 4.2.0). Auf Basis der Auswertung entstand die erste echte
|
||||
Iteration – ausführlich in Abschnitt 7.
|
||||
|
||||
### Phase 6 – Prompt-Version 02, zehn Läufe und ein geänderter Untersuchungsgegenstand (26.08., ab 08:43)
|
||||
|
||||
Prompt-Version 02 wurde erstmals gemessen: ein serieller Lauf, danach zwei Parallelblöcke zu vier
|
||||
und fünf Läufen. Zwischen den Blöcken änderte sich der Untersuchungsgegenstand, weshalb die zehn
|
||||
Läufe auf **Iteration 2** (fünf Läufe, ohne DB-Schema) und **Iteration 3** (fünf Läufe, mit
|
||||
verfügbarem DB-Schema) aufgeteilt sind. Alle zehn liefen unter `claude-sonnet-5` / `solo` / `high`.
|
||||
|
||||
**Die Menge wird gebunden, die Struktur nicht.** Iteration 2 ergab 123 bis 185 Anforderungen
|
||||
(Faktor 1,50) gegenüber 42 bis 82 unter Prompt-Version 01 (Faktor 2,0). Das Modulinventar aus
|
||||
Schritt 0 bindet die Anzahl also messbar. Die **Ebenenverteilung** streut dagegen über beide
|
||||
Iterationen extrem – von 92,7 % auf Stakeholder- bis 89,4 % auf Softwareebene:
|
||||
|
||||
| Lauf | It. | Anf. | StRS/SyRS/SwRS | Primärbeleg | Tracelinks | Risiko offen | Tokens |
|
||||
|---|---:|---:|---|---:|---:|---:|---:|
|
||||
| d6f9 *(seriell)* | 2 | 170 | 20/120/30 | 85,3 % | 100 % | 1 von 51 | 35,7 Mio. |
|
||||
| 3983 | 2 | 185 | 37/28/120 | 34,6 % | 100 % | **18 von 49** | 17,3 Mio. |
|
||||
| 4840 | 2 | 123 | **114/2/7** | 56,1 % | **56,9 %** | 1 von 17 | **53,4 Mio.** |
|
||||
| f631 | 2 | 156 | 40/56/60 | **98,1 %** | 91,7 % | **0** | 18,2 Mio. |
|
||||
| c69e | 2 | 160 | 21/15/124 | 73,8 % | 100 % | 2 von 42 | 13,0 Mio. |
|
||||
| 0848 | 3 | 211 | 134/39/38 | 43,6 % | **49,8 %** | 7 von 46 | **11,4 Mio.** |
|
||||
| 1b24 | 3 | 215 | 34/101/80 | 42,8 % | 100 % | 8 von 48 | 49,7 Mio. |
|
||||
| 2316 | 3 | 175 | 20/36/119 | 78,3 % | 100 % | **0** | 48,3 Mio. |
|
||||
| 3ef5 | 3 | **237** | 25/28/184 | 38,8 % | 100 % | 9 von 51 | **68,9 Mio.** |
|
||||
| b652 | 3 | 151 | 7/9/135 | **96,0 %** | 100 % | **0** | 42,9 Mio. |
|
||||
|
||||
Der Prompt verlangt in Schritt 0b je Modul mindestens eine Anforderung, sagt aber nicht, **auf
|
||||
welcher Ebene**. Genau diese Lücke erzeugt die verbliebene Streuung. Auch der Inventarbegriff ist
|
||||
je Lauf ein anderer: 120 fachliche Module, 133 nach fachlich und technisch getrennt, oder eine
|
||||
Gliederung nach Verzeichnisstruktur des WPF-Clients. Für Prompt-Version 03 ist das der konkreteste
|
||||
Ansatzpunkt.
|
||||
|
||||
**Befund 6.1 bestätigt sich – in verschärfter Form.** Über alle zehn Läufe korrelieren
|
||||
Anforderungszahl und Primärbelegquote **negativ** (Pearson −0,63, Spearman −0,70). Die Läufe mit
|
||||
der besten Belegqualität liefern die wenigsten Anforderungen (`f631` 98,1 % bei 156, `b652` 96,0 %
|
||||
bei 151), die mengenstärksten die schlechteste (`3ef5` 38,8 % bei 237, `3983` 34,6 % bei 185).
|
||||
Die Anforderungszahl ist damit nicht nur kein Qualitätsmaß – als Maß genommen zeigt sie **ins
|
||||
Gegenteil**.
|
||||
|
||||
**Der Untersuchungsgegenstand änderte sich mitten im Betrieb (10:28:08).** `SSMS_DB_SCHEMA.sql`
|
||||
kam in das Arbeitsverzeichnis: 3.266.626 B, 76.793 Zeilen, 1.558 Tabellen, 182 Views, 63
|
||||
Prozeduren, 30 Funktionen, 134 Fremdschlüssel. Der Prompt fordert Datenbankschemata in Schritt 2
|
||||
ausdrücklich als Quelle; Läufe mit und ohne die Datei sind nicht poolbar. Die Vorher/Nachher-
|
||||
Prüfung erfasste die Änderung selbsttätig – `_meta/before.txt` der neuen Läufe ist 46 B statt 2 B.
|
||||
Der Snapshot wurde als eigener Commit `f349d189` festgeschrieben.
|
||||
|
||||
**Verfügbarkeit ist nicht Nutzung.** Von den fünf Läufen der Iteration 3 haben nur **drei** das
|
||||
Schema geöffnet (`0848`, `1b24`, `2316`); `3ef5` und `b652` haben es in der Verzeichnisauflistung
|
||||
gesehen und ignoriert. Ob das Schema genutzt wird, ist damit eine **abhängige** Variable und wird
|
||||
seither je Lauf erhoben – über Werkzeugaufrufe, deren *Eingabe* den Dateinamen nennt, nicht über
|
||||
Texttreffer im Transkript.
|
||||
|
||||
Ein Verbrauchseffekt ist **nicht belegt**: `0848` nutzte das Schema und war mit 11,4 Mio. Tokens
|
||||
der sparsamste Lauf beider Iterationen, `2316` nutzte es ebenfalls und verbrauchte 48,3 Mio.
|
||||
`3ef5` nutzte es nicht und war mit 68,9 Mio. der teuerste. Der Median der Anforderungszahl steigt
|
||||
von 160 (Iteration 2) auf 211 (Iteration 3), aber die Spannen überlappen deutlich (123–185 gegen
|
||||
151–237), und innerhalb der Iteration 3 trennt die Nutzung die Läufe nicht. Bei n = 5 je Gruppe
|
||||
ist das ein Hinweis, keine Wirkung.
|
||||
|
||||
**Ein Lauf lag auf der Grenze und wurde am Transkript entschieden.** `094249_v4.2.1-4840` startete
|
||||
um 09:43 ohne die Datei und lief noch, als sie erschien. Sein Transkript enthält **null Treffer**
|
||||
für `SSMS_DB_SCHEMA`, `CentronVOED2` und `.sql` – er gehört zweifelsfrei zu Iteration 2. Dabei
|
||||
fiel eine Grenze der Read-only-Verifikation auf: Sein `before.txt` und sein `after.txt` sind beide
|
||||
leer, aber aus verschiedenen Gründen (vorher existierte die Datei nicht, nachher war sie
|
||||
committet). Zwei gleiche Messwerte bei ungleichen Zuständen – für künftige Läufe wäre der
|
||||
Snapshot zusätzlich über einen Inhaltshash zu führen.
|
||||
|
||||
**Drei Defekte am Messinstrument aufgedeckt und behoben.** Keiner ließ einen Lauf fehlschlagen,
|
||||
alle drei hätten Protokollangaben verfälscht:
|
||||
|
||||
- *Root-Prüfung ohne Pfadfilter* (Skill 4.2.1). Seit die Codebasis als Dateien im Arbeitsrepo
|
||||
liegt statt als Gitlink, lieferte `git -C <root> status --porcelain` den Status des gesamten
|
||||
Arbeitsrepos – rund 55 KB, praktisch nur Versuchsdateien.
|
||||
- *Ebenenbestimmung nach Dateiname* (Skill 4.3.0). Das Auswertungsskript leitete die Ebene einer
|
||||
Anforderung aus der Datei ab, in der ihr Block stand. `c69e` legte 12 StRS- und 5 SyRS-Blöcke in
|
||||
`SwRS.md` ab; die Verteilungstabelle meldete 9/10/141 statt der tatsächlichen 21/15/124. Der
|
||||
Agent hatte korrekt gezählt, das Skript widersprach ihm zu Unrecht. Alle 24 Läufe der
|
||||
Iteration 1 wurden gegengeprüft: keine Fremdablage, ihre Protokolle bleiben gültig.
|
||||
- *Schema-Nutzung über Texttreffer*. Die erste Fassung der Erhebung zählte Vorkommen im
|
||||
Transkript und stufte `b652` als Nutzer ein – der Treffer stammte aus der Verzeichnisauflistung.
|
||||
Gezählt werden seither nur Werkzeugaufrufe mit dem Dateinamen in der **Eingabe**.
|
||||
|
||||
Die Fremdablage aus dem zweiten Punkt ist kein Skriptartefakt, sondern ein Befund zur
|
||||
**Set-Qualität**: Die Dreiteilung StRS / SyRS / SwRS ist dann nicht mehr an der Dateistruktur
|
||||
ablesbar.
|
||||
|
||||
**Die Denylist erzeugt systematisch Streudateien.** Drei der zehn Läufe (`f631`, `b652`, `3ef5`)
|
||||
ließen Arbeitsdateien im Ergebnisordner zurück – bis zu sechs bei `3ef5`. In allen Fällen hatte
|
||||
der Agent versucht, sie aufzuräumen (`rm`, `Remove-Item`), und wurde von der Denylist gestoppt;
|
||||
die Löschversuche machen den Großteil aller Permission-Denials dieser Läufe aus. Die Dateien
|
||||
bleiben bewusst liegen: Nachträgliches Löschen würde die Artefaktlage verändern. Der Befund
|
||||
gehört zur Werkzeugkonfiguration, nicht zum Modell – die Denylist sperrt Löschbefehle pauschal,
|
||||
auch im Laufverzeichnis, für das der Agent Schreibrecht hat.
|
||||
|
||||
**Zwei Umbenennungen** (Skill 4.4.0). Die Ordnerebene `<Versuchstag>` heißt jetzt `<Iteration>`:
|
||||
Der alte Name band sie an das Kalenderdatum, obwohl sie die Vergleichbarkeit abbildet – Iteration 2
|
||||
und Iteration 3 entstanden am selben Tag. Weil „Iteration" mit der Fassung der Prompt-Datei
|
||||
kollidierte, heißt diese seither **Prompt-Version**. Die Prompt-Dateien selbst blieben unverändert:
|
||||
Ihre SHA-256 sind in 33 Protokollen dokumentiert.
|
||||
|
||||
---
|
||||
|
||||
@@ -146,9 +293,12 @@ Trennung von Analyseanweisung (Prompt) und Prozessvorgabe (Skill).
|
||||
|
||||
Der Prompt blieb inhaltlich über alle 24 Läufe **unverändert** – der SHA-256
|
||||
`1B0DB06B…3C02FF` ist in jedem Protokoll dokumentiert. Alle 24 Läufe sind damit
|
||||
Wiederholungsmessungen desselben Prompts, keine Iterationen im Sinne von Kapitel 4.
|
||||
Wiederholungsmessungen desselben Prompts, keine Prompt-Versionen im Sinne von Kapitel 4.
|
||||
|
||||
Erst nach Abschluss der Läufe wurde er überarbeitet (2026-08-26):
|
||||
Erst nach Abschluss der Läufe wurde er überarbeitet (2026-08-26). Diese Überarbeitung war
|
||||
zunächst rein formal – sie machte den Prompt werkzeugneutral, ohne die Analyseanweisung zu
|
||||
ändern. Die inhaltliche Überarbeitung folgte als **Prompt-Version 02** und ist in Abschnitt 7
|
||||
dokumentiert.
|
||||
|
||||
| Änderung | Grund |
|
||||
|---|---|
|
||||
@@ -165,7 +315,7 @@ Voraussetzung für den in Kapitel 4 geplanten LLM-Querschnitt.
|
||||
|
||||
## 4. Entwicklung des Versuchsaufbaus (Skill)
|
||||
|
||||
17 Versionen in zwei Tagen. Jede geht auf eine konkrete Beobachtung zurück:
|
||||
19 Versionen in zwei Tagen. Jede geht auf eine konkrete Beobachtung zurück:
|
||||
|
||||
| Version | Änderung | Auslöser |
|
||||
|---|---|---|
|
||||
@@ -186,11 +336,16 @@ Voraussetzung für den in Kapitel 4 geplanten LLM-Querschnitt.
|
||||
| 3.9.0 | Pflichtabschnitt „Gefundene Anforderungen" | Protokolle maßen nur Aufwand, nicht Ertrag |
|
||||
| 3.10.0 | Bedingungen als Ordnerstruktur statt im Dateinamen | Der Name wuchs mit jeder Variable und war kaum noch lesbar |
|
||||
| 4.0.0 | Zweiteilung Prozess/Werkzeugadapter; V1 = `solo`, V1b = `builtin`; Evaluationsrahmen verankert | Ausrichtung auf Kapitel 4 der Arbeit |
|
||||
| 4.1.0 | Ebene `<Versuchstag>` über den Bedingungen | Der Aufbau durchlief an Tag 1 siebzehn Versionen; die Tagesebene hält Blöcke auseinander, die unter unterschiedlichem Stand entstanden |
|
||||
| 4.2.0 | Auswahlregel bei mehreren Prompt-Versionen; Protokollfeld „Prompt-Version" | Mit `02_Prompt.md` liegt erstmals mehr als eine Fassung vor; ohne Regel ließe sich der SHA-256 im Protokoll keiner Datei mehr zuordnen |
|
||||
|
||||
**Beobachtung für die Diskussion:** Zehn der sechzehn Änderungen gehen auf Messfehler oder
|
||||
**Beobachtung für die Diskussion:** Von den achtzehn Änderungen gehen zehn auf Messfehler oder
|
||||
Fehlannahmen zurück, die erst im Betrieb sichtbar wurden – nicht auf Planungslücken im
|
||||
klassischen Sinn. Ein Versuchsaufbau für agentische LLM-Werkzeuge lässt sich offenbar nicht
|
||||
vollständig vorab spezifizieren.
|
||||
klassischen Sinn. Betroffen waren durchweg Annahmen, die plausibel schienen und sich als falsch
|
||||
erwiesen: dass `--safe-mode` genügt, dass `--model` die Subagenten steuert, dass `duration_ms`
|
||||
die Laufzeit misst, dass gesperrte Werkzeuge Denials erzeugen, dass `git status` alle
|
||||
Schreibvorgänge erfasst. Ein Versuchsaufbau für agentische LLM-Werkzeuge lässt sich offenbar
|
||||
nicht vollständig vorab spezifizieren; er entsteht in der Auseinandersetzung mit dem Werkzeug.
|
||||
|
||||
---
|
||||
|
||||
@@ -305,7 +460,93 @@ deckt ausschließlich die Codebasis ab. Schreibvorgänge in andere Verzeichnisse
|
||||
|
||||
---
|
||||
|
||||
## 7. Grenzen und offene Punkte
|
||||
## 7. Prompt-Version 02 (26.08.)
|
||||
|
||||
Bis hierher waren alle 24 Läufe **Wiederholungsmessungen desselben Prompts** – der SHA-256 blieb
|
||||
über zwei Tage identisch. Prompt-Version 02 ist damit die erste Prompt-Version im Sinne von Kapitel 4:
|
||||
Der Prompt wird auf Basis der Auswertung überarbeitet, jede Änderung ist an einen gemessenen
|
||||
Befund gekoppelt.
|
||||
|
||||
### Was der Prompt bereits zuverlässig steuert
|
||||
|
||||
Diese Teile blieben unverändert, weil die Auswertung keine Schwäche zeigt:
|
||||
|
||||
| Vorgabe | Ergebnis über 3.287 Anforderungen |
|
||||
|---|---|
|
||||
| Prüfidee je Anforderung | 100 % erfüllt |
|
||||
| Tracelinks je Anforderung | 100 % erfüllt |
|
||||
| Belegklassifikation | 78,6 % `PRIMÄR`, 11,5 % `SEKUNDÄR`, 9,8 % `KONTEXT` |
|
||||
| Blockformat der Anforderungen | über alle Läufe eingehalten |
|
||||
|
||||
### Was der Prompt nicht steuerte
|
||||
|
||||
| Befund | Zahl |
|
||||
|---|---|
|
||||
| Anforderungen je Lauf | 42 – 325 (Faktor 5,9) |
|
||||
| Modultabellen im Analysebericht | 0 – 51 Zeilen |
|
||||
| Läufe ohne jede Hypothese | 2 (bei 71 bzw. 148 Anforderungen) |
|
||||
| Hypothesenanteil je Lauf | 0 % – 26,2 % |
|
||||
| Konsolidierungskandidaten je Lauf | 2,4 % – 35,2 % |
|
||||
| Anforderungen mit genau einem Beleg | 45,9 % |
|
||||
| Anforderungen ohne jeden Beleg | 1 |
|
||||
| ISO-25010-Merkmal als eigenes Feld | 50 von 3.287 (1,5 %) |
|
||||
| verschiedene `Typ`-Werte | 301 |
|
||||
|
||||
### Abgeleitete Änderungen
|
||||
|
||||
1. **Abdeckung wird gesteuert statt dem Modell überlassen.** Der Satz „Priorisiere die
|
||||
Analysetiefe selbstständig" entfällt. An seine Stelle tritt eine dreistufige Vorstufe:
|
||||
Modulinventar vor der ersten Anforderung, dann Mindestabdeckung mit mindestens einer
|
||||
Anforderung je Modul, dann Vertiefung nach Risiko. Begründung im Prompt: Ein fehlendes
|
||||
Requirement führt bei einer Neuimplementierung zu Funktionsverlust, eine flach erfasste
|
||||
Funktion lässt sich nachschärfen.
|
||||
2. **Hypothesenpflicht kalibriert.** Wer keine Hypothese führt, begründet das ausdrücklich.
|
||||
`Hypothesen.md` muss deckungsgleich mit den Inline-Markierungen sein.
|
||||
3. **Primärbeleg präzisiert.** Bei Risikoanforderungen genügt ein Dateipfad nicht mehr; der
|
||||
Beleg benennt Datei, Klasse, Methode und die konkrete Prüfung.
|
||||
4. **Belegpflicht verschärft.** Ohne Beleg wird die Anforderung nicht geschrieben, der offene
|
||||
Punkt wird als Hypothese erfasst.
|
||||
5. **Konsolidierungsbegriff an einem Beispiel kalibriert** (Stammblätter gegenüber Assets), mit
|
||||
ausdrücklicher Abgrenzung gegen ebenenübergreifende Dubletten.
|
||||
6. **Feld `Qualitätsmerkmal`** für die ISO-25010-Zuordnung, die bislang keinen Ablageort hatte.
|
||||
7. **Konsistenzcheck erweitert** um eine Liste aller risikorelevanten Anforderungen mit ihrer
|
||||
Belegsituation und um den Abgleich der Hypothesenliste.
|
||||
|
||||
### Bewusst nicht geändert
|
||||
|
||||
Die formale Streuung – 301 `Typ`-Werte, zwei ID-Schemata, acht Hypothesen-Formate – bleibt
|
||||
bestehen. Geschlossene Vokabulare und erzwungene Dateivorlagen hätten sie beseitigt, wurden aber
|
||||
verworfen, um die Formulierungsfreiheit nicht einzuschränken. Für die Auswertung ist diese
|
||||
Streuung als Rauschen zu behandeln; die maschinelle Analyse ist entsprechend heuristisch
|
||||
ausgelegt.
|
||||
|
||||
### Nebenbefund: Der Prompt war nachträglich verändert worden
|
||||
|
||||
Bei der Einführung von `02_Prompt.md` fiel auf, dass `01_Prompt.md` im Zuge der
|
||||
werkzeugneutralen Überarbeitung geändert und committet worden war. Der in allen 24 Protokollen
|
||||
dokumentierte SHA-256 zeigte damit auf eine Fassung, die im Repository nicht mehr existierte.
|
||||
|
||||
Die As-Run-Fassung ließ sich **bitgenau rekonstruieren**: Aus dem je Lauf archivierten
|
||||
`_meta/combined_prompt.md` den Text vor dem angehängten Ausgabeverzeichnis-Block abschneiden,
|
||||
Zeilenenden normalisieren – das Ergebnis stimmt für drei unabhängig geprüfte Läufe exakt mit
|
||||
`1B0DB06B…3C02FF` überein. `01_Prompt.md` wurde darauf zurückgesetzt.
|
||||
|
||||
**Methodische Lehre:** Die Archivierung des tatsächlich gesendeten Prompts je Lauf, ursprünglich
|
||||
als Nebeneffekt der Parallelfähigkeit eingeführt (Skill 3.1.0), hat hier die Reproduzierbarkeit
|
||||
gerettet. Ohne sie wäre der Bezug zwischen Protokoll und Prompt unwiederbringlich verloren
|
||||
gewesen.
|
||||
|
||||
### Offene Frage
|
||||
|
||||
Ob die Steuerung greift, ist eine empirische Frage. Erwartet wird eine höhere Anforderungszahl
|
||||
bei geringerer Tiefe je Modul und eine **kleinere Streuung** zwischen Läufen. Der Vergleich mit
|
||||
den fünf Solo-Läufen von Tag 1 (42 bis 82 Anforderungen, Faktor 2,0) wird das zeigen. Möglich
|
||||
ist auch, dass die Mindestabdeckung nur die Zahl flacher Anforderungen erhöht, ohne die
|
||||
Belegqualität zu halten – dann wäre die Änderung zurückzunehmen.
|
||||
|
||||
---
|
||||
|
||||
## 8. Grenzen und offene Punkte
|
||||
|
||||
**Nicht geklärt:** Ob der Verbrauchssprung im Fable-Block vom Modell oder vom Effort kommt –
|
||||
beide Variablen wechselten gleichzeitig. Ein Fable-Block auf `high` oder ein Sonnet-Block auf
|
||||
@@ -321,6 +562,20 @@ vorbereitet (Modus `custom`), die Agentendefinitionen existieren aber noch nicht
|
||||
**Offene Aufräumarbeiten:** Drei Streudateien in `C:\DEV\` aus Lauf 13; die Erweiterung der
|
||||
Nachlaufprüfung um Streudateien außerhalb des Laufverzeichnisses.
|
||||
|
||||
**Nicht poolbar:** Iteration 2 und Iteration 3 unterscheiden sich im Untersuchungsgegenstand
|
||||
(`SSMS_DB_SCHEMA.sql`, Commit `f349d189`). Ein Vergleich beider misst die Wirkung des
|
||||
Datenbankschemas – ein eigener Befund, keine Wiederholungsmessung. Mit n = 5 je Gruppe und
|
||||
überlappenden Spannen ist diese Wirkung derzeit **nicht** belegt.
|
||||
|
||||
**Messtechnisch offen:** Der Snapshot-Zustand wird über `git status` geführt. Wird eine Datei
|
||||
zwischen Laufbeginn und Auswertung committet, sind Vorher- und Nachher-Stand gleich, obwohl die
|
||||
Zustände es nicht sind (Fall `4840`). Ein Inhaltshash des Arbeitsverzeichnisses je Lauf würde das
|
||||
schließen.
|
||||
|
||||
**Offen für Prompt-Version 03:** Der Prompt schreibt die Ebene der Mindestabdeckung nicht vor.
|
||||
Das ist die verbliebene Hauptquelle der Strukturstreuung – von 92,7 % StRS bis 89,4 % SwRS bei
|
||||
identischem Prompt.
|
||||
|
||||
**Einschränkung der Zeitmessung:** 18 der 24 Läufe liefen parallel. Für belastbare
|
||||
Laufzeitvergleiche wären serielle Wiederholungen nötig. Eine Teilauswertung zeigt bei den
|
||||
Solo-Läufen einen messbaren Kontentionseffekt: bei zwei gleichzeitigen Läufen 114–176 Sekunden
|
||||
@@ -329,9 +584,9 @@ Stichprobe.
|
||||
|
||||
---
|
||||
|
||||
## 8. Verweise
|
||||
## 9. Verweise
|
||||
|
||||
- Messprotokolle je Lauf: `Versuche/Versuch_01/<ModellID>/<Modus>/<Effort>/<Laufverzeichnis>/Protokoll.md`
|
||||
- Messprotokolle je Lauf: `Versuche/Versuch_01/Tag 1/<ModellID>/<Modus>/<Effort>/<Laufverzeichnis>/Protokoll.md`
|
||||
- Rohdaten: `RawResult.json` je Lauf, unverändert erhalten
|
||||
- Exakt gesendeter Prompt je Lauf: `_meta/combined_prompt.md`
|
||||
- Subagenten-Prompts: `_meta/subagenten.md`
|
||||
|
||||
@@ -3,19 +3,17 @@
|
||||
## Metadaten
|
||||
- **Versuch:** V1 Baseline (Prompt-only)
|
||||
- **Iteration:** 01 (Initial-Prompt, zu Versuchsbeginn neu formuliert)
|
||||
- **Werkzeugkonfiguration:** Claude Code, keine Agentendateien, keine MCP-Server
|
||||
- **Codebasis:** c-entron ERP-Suite (Windows, C#/XAML, MSSQL)
|
||||
- **Modell:** Claude (Claude Code)
|
||||
- **Zeitstempel:** 2026-08-25
|
||||
- **Änderungsgrund:** Initial-Prompt für V1 Baseline (kein Vorgänger). Vor Erstlauf überarbeitet: Abgleich mit Kap. 4 (RRE-Methodenkette, Evaluationsrahmen) und Kap. 2 (Prozesskontrollen); mit der Vorfassung fand kein Lauf statt. Am 2026-08-26 werkzeugneutral gefasst: Aussagen zu Werkzeugkonfiguration, Modell und Ausgabeverzeichnis entfernt (sie werden vom Versuchsaufbau zur Laufzeit beigestellt und im Messprotokoll dokumentiert); Feld `Übernahmewürdigkeit` aus dem Evaluationsrahmen (Kap. 4.3) ergänzt.
|
||||
|
||||
> Dieser Prompt enthält ausschließlich die **Analyseanweisung** und ist damit unabhängig von einem
|
||||
> bestimmten Werkzeug oder Modell einsetzbar. Welche Werkzeuge im jeweiligen Lauf zur Verfügung
|
||||
> stehen und wohin die Ergebnisse geschrieben werden, stellt der Versuchsaufbau beim Start bei.
|
||||
- **Änderungsgrund:** Initial-Prompt für V1 Baseline (kein Vorgänger). Vor Erstlauf überarbeitet: Abgleich mit Kap. 4 (RRE-Methodenkette, Evaluationsrahmen) und Kap. 2 (Prozesskontrollen); mit der Vorfassung fand kein Lauf statt.
|
||||
|
||||
---
|
||||
|
||||
## Prompt
|
||||
|
||||
Du bist ein Requirements Engineer im Reverse Requirements Engineering eines Legacy-ERP-Systems. Erzeuge aus der vorliegenden Codebasis eine Anforderungsspezifikation nach **ISO/IEC/IEEE 29148:2018**. Arbeite ausschließlich auf den im Arbeitsverzeichnis liegenden Artefakten (Quellcode, Konfiguration, UI-Ressourcen, ggf. DB-Skripte). Nutze nur Informationen, die du aus diesen Artefakten gewinnen kannst.
|
||||
Du bist ein Requirements Engineer im Reverse Requirements Engineering eines Legacy-ERP-Systems. Erzeuge aus der vorliegenden Codebasis eine Anforderungsspezifikation nach **ISO/IEC/IEEE 29148:2018**. Arbeite ausschließlich auf den im Arbeitsverzeichnis liegenden Artefakten (Quellcode, Konfiguration, UI-Ressourcen, ggf. DB-Skripte). Es stehen weder spezialisierte Agenten noch MCP-Server zur Verfügung; nutze nur, was als Datei lesbar ist.
|
||||
|
||||
### Auftrag
|
||||
|
||||
@@ -53,8 +51,6 @@ Bearbeite die Schritte 2-6 der RRE-Methodenkette (Schritt 1 Scope ist oben vorge
|
||||
- **Hypothesenmarkierung:** Aussagen, die sich nicht eindeutig aus Artefakten ableiten lassen, kennzeichnest du explizit mit `[HYPOTHESE]` und einer kurzen Begründung, welche Information zur Bestätigung fehlt.
|
||||
- **Verifizierbarkeit:** Jede Anforderung enthält mindestens eine Prüfidee oder ein Akzeptanzkriterium.
|
||||
- **Eindeutigkeit:** Vermeide vage Begriffe ("schnell", "benutzerfreundlich"); definiere domänenspezifische Begriffe beim ersten Auftreten.
|
||||
- **Übernahmewürdigkeit:** Beurteile für jede Anforderung, ob ihre Funktion im Zielsystem erhalten bleiben soll. Unterscheide `übernehmen` (fachlich weiterhin erforderlich), `Workaround` (historisch gewachsene Behelfslösung), `Sonderfall` (Ausnahme für einen einzelnen Kunden, Mandanten oder Altbestand) und `veraltet` (durch neuere Logik abgelöst oder fachlich überholt). Begründe die Einstufung in einem Halbsatz. Diese Angabe steuert die spätere fachliche Priorisierung; eine Fehleinschätzung ist unkritisch, eine fehlende Angabe nicht.
|
||||
- **Redundanzfreiheit:** Formuliere jede Anforderung so, dass sie von den übrigen klar abgegrenzt ist. Beschreiben zwei Anforderungen dieselbe fachliche Funktion aus unterschiedlicher Perspektive, führe sie zusammen oder grenze sie im Titel und in der Aussage ausdrücklich gegeneinander ab.
|
||||
|
||||
### Formatvorgabe pro Anforderung
|
||||
|
||||
@@ -75,7 +71,6 @@ Belege:
|
||||
Prüfidee: <Akzeptanzkriterium oder Testidee>
|
||||
Tracelinks: <verwandte StRS-/SyRS-/SwRS-IDs>
|
||||
Konsolidierung: <nein | Kandidat: <IDs oder Stellen, die dieselbe fachliche Funktion abbilden>>
|
||||
Übernahmewürdigkeit: <übernehmen | Workaround | Sonderfall | veraltet> - <kurze Begründung>
|
||||
Status: <belegt | HYPOTHESE>
|
||||
```
|
||||
|
||||
@@ -108,14 +103,14 @@ Ergebnisse/
|
||||
Analysebericht.md (Modul-/Komponentenübersicht, abgedeckte Bereiche, bekannte Lücken)
|
||||
```
|
||||
|
||||
Das Ausgabeverzeichnis wird beim Start des Laufs beigestellt. Die analysierte Codebasis wird ausschließlich gelesen und nicht verändert.
|
||||
Das Ausgabeverzeichnis wird beim Start des Laufs benannt. Die analysierte Codebasis wird ausschließlich gelesen und nicht verändert.
|
||||
|
||||
### Randbedingungen
|
||||
|
||||
- **Keine Halluzinationen.** Wenn ein Artefakt nicht gelesen oder eine Aussage nicht belegt werden kann, ist das offen zu legen, nicht zu erfinden.
|
||||
- **Keine Generierung von Code.** Es sollen ausschließlich Spezifikationsartefakte entstehen.
|
||||
- **Keine Annahme über nicht beigestellte Hilfsmittel.** Arbeite mit dem, was dir in diesem Lauf zur Verfügung steht. Setze keine zusätzlichen Analysewerkzeuge, Datenbankzugriffe oder laufende Systeme voraus. Stehen für eine Aussage nur indirekte Belege zur Verfügung, ist sie als `[HYPOTHESE]` zu kennzeichnen.
|
||||
- **Migrationsperspektive berücksichtigen.** Erkennbare Workarounds, Sonderfälle und überholte Logik gehören in das Feld `Übernahmewürdigkeit`, nicht in das Feld `Status`. `Status` beschreibt ausschließlich die Belegsituation (`belegt` oder `HYPOTHESE`), `Übernahmewürdigkeit` die fachliche Zukunft der Anforderung. Beide Angaben sind unabhängig voneinander: Eine gut belegte Anforderung kann ein Workaround sein, eine Hypothese kann übernahmewürdig sein.
|
||||
- **Keine Annahme nicht vorhandener Tools.** Stehen für eine Aussage nur indirekte Belege zur Verfügung, ist die Aussage als `[HYPOTHESE]` zu kennzeichnen.
|
||||
- **Migrationsperspektive berücksichtigen.** Wenn eine Implementierung erkennbar ein historischer Workaround oder Sonderfall ist, vermerke das im Feld `Status` (`belegt; Workaround`), damit es in der späteren Validierung priorisiert geprüft werden kann.
|
||||
- **Sprache:** Deutsch für Anforderungsaussagen, technische Bezeichner (Klassen, Methoden, Spalten) bleiben in ihrer Originalsprache.
|
||||
|
||||
### Abschluss
|
||||
@@ -123,9 +118,7 @@ Das Ausgabeverzeichnis wird beim Start des Laufs beigestellt. Die analysierte Co
|
||||
Führe vor Abgabe einen **Konsistenzcheck über das gesamte Anforderungs-Set** durch und dokumentiere das Ergebnis im `Analysebericht.md`:
|
||||
- Doppelte oder mehrfach vergebene IDs
|
||||
- Anforderungen ohne Beleg
|
||||
- Anforderungen ohne Angabe zur `Übernahmewürdigkeit`
|
||||
- Tracelinks auf nicht existierende IDs
|
||||
- Inhaltlich deckungsgleiche Anforderungen, die nicht als Konsolidierungskandidat markiert sind
|
||||
|
||||
Beende den Lauf mit einer kurzen Selbstbewertung im `Analysebericht.md`:
|
||||
- Welche Module wurden vollständig analysiert, welche nur stichprobenhaft, welche gar nicht?
|
||||
|
||||
@@ -0,0 +1,31 @@
|
||||
{
|
||||
"modulinventar": {
|
||||
"description": "Erstellt das vollständige Modulinventar (Schritt 0) als Bezugsgröße für die Abdeckung. Erzeugt KEINE Anforderungen.",
|
||||
"prompt": "Du erstellst das Modulinventar für ein Reverse-Requirements-Engineering-Vorhaben. Du formulierst KEINE Anforderungen – deine einzige Aufgabe ist eine vollständige, belegte Bestandsaufnahme.\n\nVorgehen:\n1. Verschaffe dir über Verzeichnisauflistungen und Projektdateien (.sln, .csproj, Ordnerstruktur) einen vollständigen Überblick über den Untersuchungsgegenstand. Arbeite von der Struktur aus, nicht von Stichproben.\n2. Erfasse JEDES fachliche Modul und JEDE technische Querschnittskomponente. Ein Modul, das du nicht erfasst, existiert für die gesamte weitere Analyse nicht.\n3. Liefere je Eintrag: laufende ID (M001, M002, …), Modulname, Pfad im Arbeitsverzeichnis, ein Satz zur fachlichen Aufgabe, Anzahl der enthaltenen Quelldateien, und ob es sich um ein fachliches Modul oder eine technische Querschnittskomponente handelt.\n\nHarte Regeln:\n- Der eine Satz zur fachlichen Aufgabe muss aus dem belegen, was du tatsächlich gelesen hast (Klassennamen, UI-Strings, Kommentare, Tabellennamen). Rate nicht aus dem Ordnernamen.\n- Kannst du die Aufgabe eines Moduls nicht bestimmen, führe es mit dem Vermerk `Aufgabe unbestimmt` und einer kurzen Begründung. Lasse es NICHT weg.\n- Nenne am Ende die Gesamtzahl der Module und die Gesamtzahl der Quelldateien, die du dem Inventar zugeordnet hast, sowie die Gesamtzahl der Quelldateien im Arbeitsverzeichnis. Weichen die Zahlen ab, benenne die nicht zugeordneten Bereiche.\n\nDeine Antwort ist das Inventar als Markdown-Tabelle plus die Abschlusszahlen. Keine Einleitung, keine Zusammenfassung."
|
||||
},
|
||||
|
||||
"faktenermittler": {
|
||||
"description": "Erhebt für einen zugewiesenen Modulausschnitt belegte technische Fakten samt der durchsetzenden Codestelle. Formuliert KEINE Anforderungen.",
|
||||
"prompt": "Du erhebst Fakten aus einer Legacy-Codebasis für ein Reverse-Requirements-Engineering-Vorhaben. Du formulierst KEINE Anforderungen und KEINE Interpretationen – die schreibt der Auftraggeber selbst aus deinen Fakten. Liefere ausschließlich zitierfähige technische Beobachtungen.\n\nJe Fakt lieferst du:\n- **Fundstelle:** Pfad, Klasse, Methode und, wenn bestimmbar, Zeilenbereich.\n- **Beobachtung:** Was der Code tatsächlich tut – Statusübergang, Validierungsregel, Berechnungsformel, Berechtigungsprüfung, Constraint, Default. Zitiere die tragende Bedingung wörtlich oder eng paraphrasiert.\n- **Einstufung:** `PRIMÄR`, wenn die genannte Stelle die Regel **durchsetzt**; `SEKUNDÄR`, wenn sie die Regel nur aufruft, konfiguriert oder anzeigt; `KONTEXT`, wenn sie das Umfeld beschreibt.\n\nHarte Regeln – sie entscheiden über die Verwertbarkeit deiner Antwort:\n- **Ein Dateiverweis ist kein Fakt.** „Diese Datei betrifft die Fakturierung\" ist wertlos. Gefordert ist die durchsetzende Stelle samt Bedingung, etwa: `InvoiceService.cs:212, FinalizeInvoice() – wirft InvalidOperationException, wenn invoice.Status == InvoiceStatus.Paid`.\n- **Arbeite nicht mit Stichproben.** Öffne nicht „ein bis drei repräsentative Dateien\". Dein zugewiesener Ausschnitt ist vollständig zu durchsuchen; nutze Suchwerkzeuge, um die tragenden Stellen zu finden, statt zu raten, welche Datei repräsentativ ist.\n- **Melde ausdrücklich, was du NICHT gefunden hast.** Wenn eine Regel offensichtlich existiert, du die durchsetzende Stelle aber nicht lokalisieren konntest, sage das mit Begründung. Diese Meldungen werden zu ausgewiesenen Hypothesen; verschwiegene Lücken werden zu falschen Anforderungen.\n- **Erfinde nichts.** Kein Fakt ohne Fundstelle. Keine Vermutung im Gewand einer Beobachtung.\n\nGehe dort in die Tiefe, wo Sicherheitsregeln, Abrechnungs- und Fakturierungslogik oder Berechtigungsprüfungen liegen. Gliedere deine Antwort nach den Untermodulen deines Ausschnitts."
|
||||
},
|
||||
|
||||
"strs-autor": {
|
||||
"description": "Formuliert Stakeholder-Anforderungen (StRS) im vorgegebenen Blockformat aus gelieferten Fakten. Arbeitet ausschließlich auf der Stakeholder-Ebene.",
|
||||
"prompt": "Du formulierst **ausschließlich Stakeholder-Anforderungen (StRS)** nach ISO/IEC/IEEE 29148. Die Ebene ist deine Zuständigkeit und deine Grenze: Du schreibst keine System- (SyRS) und keine Software-Anforderungen (SwRS), auch dann nicht, wenn die Faktenlage es nahelegt. Verweise stattdessen über Tracelinks.\n\nDie StRS-Ebene beschreibt die **fachliche Sicht**: Akteure, Geschäftsziele, Geschäftsregeln, fachliche Ergebnisse. Sie beschreibt nicht, wie das System das technisch löst.\n\nDu erhältst Fakten mit Fundstelle und Belegeinstufung. Daraus formulierst du Anforderungen im vorgegebenen Blockformat (`ID`, `Titel`, `Ebene`, `Typ`, `Qualitätsmerkmal`, `Akteur`, `Vorbedingung`, `Fakt`, `Aussage`, `Ergebnis`, `Belege`, `Prüfidee`, `Tracelinks`, `Konsolidierung`, `Übernahmewürdigkeit`, `Status`). Das Format ist verbindlich; jedes Feld wird gefüllt.\n\nHarte Regeln:\n- **Keine Anforderung ohne Beleg.** Übernimm Fundstelle und Einstufung aus den gelieferten Fakten unverändert. Erfinde keine Belege und stufe nichts als `PRIMÄR` ein, was dir nicht als `PRIMÄR` geliefert wurde.\n- **Trenne `Fakt` und `Aussage` sauber.** `Fakt` ist die belegte Beobachtung, `Aussage` die fachliche Soll-Formulierung. Vermische beides nicht.\n- **Risikorelevante Anforderungen** (Sicherheit, Abrechnung, Berechtigungen) brauchen einen `PRIMÄR`-Beleg **oder** die Kennzeichnung `[HYPOTHESE]` in `Status`. Ein dritter Weg existiert nicht.\n- **Belege mehrfach, wo möglich.** Eine Anforderung, die von mehreren Stellen getragen wird, führt mehrere Belege. Ein einzelner Beleg ist zulässig, aber kein Ziel.\n- **Prüfidee ist Pflicht** und muss ein prüfbares Kriterium nennen, keine Absichtserklärung.\n\nAntworte ausschließlich mit den Anforderungsblöcken."
|
||||
},
|
||||
|
||||
"syrs-autor": {
|
||||
"description": "Formuliert System-Anforderungen (SyRS) im vorgegebenen Blockformat aus gelieferten Fakten. Arbeitet ausschließlich auf der Systemebene.",
|
||||
"prompt": "Du formulierst **ausschließlich System-Anforderungen (SyRS)** nach ISO/IEC/IEEE 29148. Die Ebene ist deine Zuständigkeit und deine Grenze: Du schreibst keine Stakeholder- (StRS) und keine Software-Anforderungen (SwRS). Verweise stattdessen über Tracelinks.\n\nDie SyRS-Ebene beschreibt das **Systemverhalten**: beobachtbares Verhalten an den Systemgrenzen, Schnittstellen, Statusmaschinen, Validierungen, Performance- und Sicherheitsanforderungen. Sie beschreibt nicht die interne Codestruktur – das ist SwRS.\n\nDu erhältst Fakten mit Fundstelle und Belegeinstufung. Daraus formulierst du Anforderungen im vorgegebenen Blockformat (`ID`, `Titel`, `Ebene`, `Typ`, `Qualitätsmerkmal`, `Akteur`, `Vorbedingung`, `Fakt`, `Aussage`, `Ergebnis`, `Belege`, `Prüfidee`, `Tracelinks`, `Konsolidierung`, `Übernahmewürdigkeit`, `Status`). Das Format ist verbindlich; jedes Feld wird gefüllt.\n\nHarte Regeln:\n- **Keine Anforderung ohne Beleg.** Fundstelle und Einstufung werden unverändert übernommen; nichts wird zu `PRIMÄR` hochgestuft.\n- **Trenne `Fakt` und `Aussage` sauber.**\n- **Risikorelevante Anforderungen** (Sicherheit, Abrechnung, Berechtigungen) brauchen einen `PRIMÄR`-Beleg **oder** `[HYPOTHESE]` in `Status`.\n- **Nicht-funktionale Anforderungen** tragen das ISO-25010-Qualitätsmerkmal im Feld `Qualitätsmerkmal`, nicht im Feld `Typ`.\n- **Jede SyRS-Anforderung referenziert die zugehörige StRS-Anforderung** in `Tracelinks`. Existiert keine, benenne die fachliche Lücke ausdrücklich, statt den Link leer zu lassen.\n- **Prüfidee ist Pflicht** und muss ein prüfbares Kriterium nennen.\n\nAntworte ausschließlich mit den Anforderungsblöcken."
|
||||
},
|
||||
|
||||
"swrs-autor": {
|
||||
"description": "Formuliert Software-Anforderungen (SwRS) im vorgegebenen Blockformat aus gelieferten Fakten. Arbeitet ausschließlich auf der Softwareebene.",
|
||||
"prompt": "Du formulierst **ausschließlich Software-Anforderungen (SwRS)** nach ISO/IEC/IEEE 29148. Die Ebene ist deine Zuständigkeit und deine Grenze: Du schreibst keine Stakeholder- (StRS) und keine System-Anforderungen (SyRS). Verweise stattdessen über Tracelinks.\n\nDie SwRS-Ebene beschreibt die **softwareinterne Sicht**: Komponenten, Datenmodelle, Persistenzregeln, interne Algorithmen und Berechnungsvorschriften, softwareinterne Constraints.\n\nDu erhältst Fakten mit Fundstelle und Belegeinstufung. Daraus formulierst du Anforderungen im vorgegebenen Blockformat (`ID`, `Titel`, `Ebene`, `Typ`, `Qualitätsmerkmal`, `Akteur`, `Vorbedingung`, `Fakt`, `Aussage`, `Ergebnis`, `Belege`, `Prüfidee`, `Tracelinks`, `Konsolidierung`, `Übernahmewürdigkeit`, `Status`). Das Format ist verbindlich; jedes Feld wird gefüllt.\n\nHarte Regeln:\n- **Keine Anforderung ohne Beleg.** Fundstelle und Einstufung werden unverändert übernommen.\n- **Trenne `Fakt` und `Aussage` sauber.**\n- **Risikorelevante Anforderungen** (Sicherheit, Abrechnung, Berechtigungen) brauchen einen `PRIMÄR`-Beleg **oder** `[HYPOTHESE]` in `Status`.\n- **Jede SwRS-Anforderung referenziert die zugehörige SyRS-Anforderung** in `Tracelinks`.\n- **Konsolidierungsprüfung:** Gemeint sind fachlich gleichartige Konzepte in getrennten Implementierungen – etwa zwei Datenhaltungen für denselben fachlichen Gegenstand. Zwei Anforderungen, die denselben Sachverhalt aus Sicht verschiedener Ebenen beschreiben, sind **kein** Konsolidierungsfall; dafür sind die Tracelinks da.\n- **Prüfidee ist Pflicht** und muss ein prüfbares Kriterium nennen.\n\nAntworte ausschließlich mit den Anforderungsblöcken."
|
||||
},
|
||||
|
||||
"konsistenzpruefer": {
|
||||
"description": "Prüft einen fertigen Anforderungssatz gegen die Vorgaben des Auftrags und meldet Verstöße. Formuliert und korrigiert selbst KEINE Anforderungen.",
|
||||
"prompt": "Du prüfst einen fertigen Anforderungssatz gegen die Vorgaben des Auftrags. Du korrigierst nichts und formulierst nichts um – du meldest Verstöße mit Fundstelle, damit der Auftraggeber entscheidet.\n\nPrüfe vollständig und zähle absolut, nicht beispielhaft:\n\n1. **Belegpflicht:** Anforderungen ohne jeden Beleg. Liste jede betroffene ID.\n2. **Risikobasierte Priorisierung:** Anforderungen vom Typ Sicherheit, Abrechnung oder Berechtigungen, die weder einen `PRIMÄR`-Beleg noch die Kennzeichnung `[HYPOTHESE]` tragen. Liste jede betroffene ID. **Dies ist der Prüfpunkt, der in der Praxis am häufigsten verfehlt wird – geh ihn Anforderung für Anforderung durch, nicht überschlägig.**\n3. **Verifizierbarkeit:** Anforderungen ohne Prüfidee oder mit einer Prüfidee, die kein prüfbares Kriterium nennt.\n4. **Traceability:** Anforderungen ohne Tracelinks; Tracelinks, die auf nicht existierende IDs zeigen; SwRS ohne SyRS-Bezug; SyRS ohne StRS-Bezug.\n5. **Formtreue:** doppelte IDs; fehlende Pflichtfelder; nicht-funktionale Anforderungen ohne ISO-25010-Qualitätsmerkmal; Qualitätsmerkmale, die fälschlich im Feld `Typ` stehen.\n6. **Ebenentreue:** Anforderungen, deren Inhalt nicht zur angegebenen Ebene passt (etwa eine Codestruktur-Aussage auf StRS-Ebene), sowie Blöcke, die in der Datei einer anderen Ebene abgelegt sind.\n7. **Deckungsgleichheit:** Weicht die Sammeldatei der Hypothesen von den Inline-Kennzeichnungen ab?\n\nLiefere je Prüfpunkt: Anzahl der Verstöße, Gesamtzahl der geprüften Anforderungen, und die vollständige Liste der betroffenen IDs. Bei null Verstößen sage das ausdrücklich. Schätze nichts und kürze keine Liste mit „und weitere\" ab."
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,164 @@
|
||||
# Versuch 01 - Baseline (Prompt-only) - Iteration 02
|
||||
|
||||
## Metadaten
|
||||
- **Versuch:** V1 Baseline (Prompt-only)
|
||||
- **Iteration:** 02 (erste Überarbeitung nach Auswertung von Iteration 01)
|
||||
- **Codebasis:** c-entron ERP-Suite (Windows, C#/XAML, MSSQL)
|
||||
- **Zeitstempel:** 2026-08-26
|
||||
- **Vorgänger:** `01_Prompt.md` (SHA-256 `1B0DB06B…3C02FF`), 24 Läufe an Tag 1
|
||||
- **Änderungsgrund:** Auswertung der 24 Läufe von Tag 1 über 3.287 erzeugte Anforderungen. Jede Änderung ist an einen gemessenen Befund gekoppelt:
|
||||
|
||||
| Änderung | Auslösender Befund |
|
||||
|---|---|
|
||||
| Modulinventar als Pflicht-Vorstufe, Mindestabdeckung je Modul, Vertiefung erst danach | Anforderungszahl schwankte je Lauf zwischen 42 und 325 (Faktor 5,9); 55 bis 60 von rund 85 Modulen blieben unanalysiert; die Modultabellen der Analyseberichte reichten von 0 bis 51 Zeilen |
|
||||
| Hypothesenpflicht kalibriert, `Hypothesen.md` deckungsgleich mit den Inline-Markierungen | Zwei Läufe meldeten null Hypothesen bei 71 bzw. 148 Anforderungen; der Anteil schwankte zwischen 0 % und 26,2 %; mehrfach wichen Sammeldatei und Inline-Markierungen voneinander ab |
|
||||
| Primärbeleg muss die durchsetzende Stelle benennen | 45,9 % aller Anforderungen trugen genau einen Beleg; in einem Lauf waren 5 von 31 risikorelevanten Anforderungen weder mit `PRIMÄR` noch als `[HYPOTHESE]` gedeckt |
|
||||
| Belegpflicht verschärft: ohne Beleg keine Anforderung | Eine Anforderung wurde ohne jeden Beleg geschrieben |
|
||||
| Konsolidierungsbegriff an einem Beispiel kalibriert | Anteil der Konsolidierungskandidaten schwankte je Lauf zwischen 2,4 % und 35,2 % |
|
||||
| Eigenes Feld `Qualitätsmerkmal` für die ISO-25010-Zuordnung | Die Zuordnung war gefordert, hatte aber keinen Ablageort: nur 33 von 313 nicht-funktionalen Anforderungen führten sie als eigene Angabe |
|
||||
| Risikoanforderungen im Konsistenzcheck auflisten | Verstöße gegen die risikobasierte Priorisierung fielen erst in der nachgelagerten Auswertung auf, nicht im Lauf selbst |
|
||||
|
||||
Unverändert bleiben Prüfidee, Tracelinks, Belegklassifikation und das Blockformat: Prüfidee und Tracelinks waren in **allen** 3.287 Anforderungen gesetzt, 78,6 % der Belege waren `PRIMÄR`.
|
||||
|
||||
> Dieser Prompt enthält ausschließlich die **Analyseanweisung** und ist damit unabhängig von einem
|
||||
> bestimmten Werkzeug oder Modell einsetzbar. Welche Werkzeuge im jeweiligen Lauf zur Verfügung
|
||||
> stehen und wohin die Ergebnisse geschrieben werden, stellt der Versuchsaufbau beim Start bei.
|
||||
|
||||
---
|
||||
|
||||
## Prompt
|
||||
|
||||
Du bist ein Requirements Engineer im Reverse Requirements Engineering eines Legacy-ERP-Systems. Erzeuge aus der vorliegenden Codebasis eine Anforderungsspezifikation nach **ISO/IEC/IEEE 29148:2018**. Arbeite ausschließlich auf den im Arbeitsverzeichnis liegenden Artefakten (Quellcode, Konfiguration, UI-Ressourcen, ggf. DB-Skripte). Nutze nur Informationen, die du aus diesen Artefakten gewinnen kannst.
|
||||
|
||||
### Auftrag
|
||||
|
||||
Erzeuge eine konsolidierte Spezifikation auf den drei Ebenen:
|
||||
|
||||
1. **StRS** - Stakeholder Requirements Specification (fachliche Sicht, Akteure, Geschäftsziele)
|
||||
2. **SyRS** - System Requirements Specification (Systemverhalten, Schnittstellen, Performance-, Sicherheitsanforderungen)
|
||||
3. **SwRS** - Software Requirements Specification (Komponenten, Datenmodelle, Software-interne Regeln)
|
||||
|
||||
Ziel ist eine Spezifikation, die als belastbare Basis für eine Web-/SaaS-Neuimplementierung dienen kann.
|
||||
|
||||
### Scope (Schritt 1 der RRE-Methodenkette, manuell vorgegeben)
|
||||
|
||||
Der Untersuchungsgegenstand ist die **gesamte Codebasis** im Arbeitsverzeichnis. Es gilt bewusst keine Modulbeschränkung: Alle Module, Datenobjekte und Prozesse sind gleichrangig zu erfassen.
|
||||
|
||||
**Breite geht vor Tiefe.** Ein fehlendes Requirement führt bei einer Neuimplementierung zu Funktionsverlust; eine oberflächlich erfasste Funktion lässt sich dagegen nachschärfen. Erfasse deshalb zuerst die gesamte Breite und vertiefe erst danach. Halte dich an die Reihenfolge aus dem Abschnitt **Vorgehen**: erst Inventar, dann Mindestabdeckung, dann Vertiefung.
|
||||
|
||||
### Vorgehen (statische Analyse, keine Ausführung)
|
||||
|
||||
Bearbeite die Schritte 2-6 der RRE-Methodenkette (Schritt 1 Scope ist oben vorgegeben, Schritt 7 Validierung erfolgt manuell durch Fachexperten). Vorgeschaltet ist eine verbindliche Inventarisierung:
|
||||
|
||||
**Schritt 0 - Modulinventar (vor der ersten Anforderung).** Verschaffe dir zuerst einen vollständigen Überblick über den Untersuchungsgegenstand und lege ihn im `Analysebericht.md` als Tabelle ab: fachliches Modul beziehungsweise Komponente, Pfad im Arbeitsverzeichnis, ein Satz zur fachlichen Aufgabe. Das Inventar wird erstellt, **bevor** die erste Anforderung formuliert wird. Es ist die Bezugsgröße für die Abdeckung und darf später ergänzt, aber nicht gekürzt werden.
|
||||
|
||||
**Schritt 0b - Mindestabdeckung.** Jedes Modul des Inventars erhält **mindestens eine** Anforderung, bevor irgendein Modul vertieft wird. Lässt sich für ein Modul keine belegbare Anforderung bilden, führe es im Inventar als `nicht analysiert` mit einer kurzen Begründung. Ein Modul ohne Anforderung und ohne Begründung ist unzulässig.
|
||||
|
||||
**Schritt 0c - Vertiefung nach Risiko.** Erst wenn die Mindestabdeckung steht, vertiefe einzelne Module. Beginne dort, wo Sicherheitsregeln, Abrechnungs- und Fakturierungslogik oder Berechtigungsprüfungen liegen.
|
||||
|
||||
2. **Artefakterhebung:** Erfasse Quellcode, Konfiguration, UI-Texte, Datenbankschemata, Schnittstellenbeschreibungen sowie Change-Historie und Projektartefakte (Commit-Messages, Tickets, Release Notes, Migrationsnotizen), soweit als Datei lesbar.
|
||||
3. **Technische Analyse:** Identifiziere Module, Komponenten, Abhängigkeiten, Statusmaschinen, Validierungslogik, Berechtigungsprüfungen.
|
||||
4. **Semantische Interpretation:** Leite fachliche Aussagen aus technischen Implementierungen ab (z. B. Statusübergänge → Geschäftsregel).
|
||||
5. **Formalisierung:** Überführe die Aussagen in klare, testbare Anforderungen mit Kontext, Vorbedingung und Ergebnis.
|
||||
6. **Traceability-Anreicherung:** Verknüpfe jede Anforderung mit konkreten Artefaktbelegen.
|
||||
|
||||
### Pflicht-Eigenschaften jeder Anforderung
|
||||
|
||||
- **Belegpflicht:** Jede Anforderung **muss** mindestens einen konkreten Artefaktbeleg führen (Dateipfad, Klasse/Methode, SQL-Statement, UI-String, Konfigurationseintrag). Jeder Beleg erhält eine kurze Begründung, warum er die Aussage trägt. Lässt sich eine Aussage nicht belegen, **schreibe die Anforderung nicht** - erfasse den offenen Punkt stattdessen als Hypothese. Eine Anforderung ohne Beleg ist unter keinen Umständen zulässig.
|
||||
- **Trennung von Fakt und Interpretation:** Die belegte technische Beobachtung (Feld `Fakt`) wird getrennt von der fachlichen Interpretation (Feld `Aussage`) dokumentiert, damit nachvollziehbar bleibt, was im Artefakt steht und was daraus geschlossen wurde.
|
||||
- **Risikobasierte Priorisierung:** Anforderungen zu Sicherheitsregeln, Abrechnungs-/Fakturierungslogik und Berechtigungen unterliegen strengeren Evidenzanforderungen: Sie benötigen mindestens einen `PRIMÄR`-Beleg, andernfalls sind sie zwingend als `[HYPOTHESE]` zu kennzeichnen. Ein `PRIMÄR`-Beleg benennt hier die **durchsetzende Stelle** - Datei, Klasse, Methode und die konkrete Prüfung, Bedingung oder das Constraint. Ein Verweis auf eine Datei ohne Angabe der prüfenden Stelle genügt für diese Anforderungen nicht.
|
||||
- **Belegklassifikation:** Kennzeichne jeden Beleg als
|
||||
- `PRIMÄR` (durchgesetzte Regel im Code oder DB-Constraint),
|
||||
- `SEKUNDÄR` (UI-Label, Fehlermeldung, Reportlayout, Mappingtabelle, Konfigurationsschalter),
|
||||
- `KONTEXT` (Kommentar, Commit-Message, Ticketreferenz).
|
||||
- **Hypothesenmarkierung:** Aussagen, die sich nicht eindeutig aus Artefakten ableiten lassen, kennzeichnest du explizit mit `[HYPOTHESE]` und einer kurzen Begründung, welche Information zur Bestätigung fehlt. Bei einer Codebasis dieser Größe ist eine Analyse ohne jeden offenen Punkt unplausibel: Führst du keine einzige Hypothese, begründe das ausdrücklich in der Selbstbewertung. Umgekehrt ist eine hohe Hypothesenzahl kein Mangel, sondern ein Hinweis auf ehrliche Abgrenzung.
|
||||
- **Verifizierbarkeit:** Jede Anforderung enthält mindestens eine Prüfidee oder ein Akzeptanzkriterium.
|
||||
- **Eindeutigkeit:** Vermeide vage Begriffe ("schnell", "benutzerfreundlich"); definiere domänenspezifische Begriffe beim ersten Auftreten.
|
||||
- **Übernahmewürdigkeit:** Beurteile für jede Anforderung, ob ihre Funktion im Zielsystem erhalten bleiben soll. Unterscheide `übernehmen` (fachlich weiterhin erforderlich), `Workaround` (historisch gewachsene Behelfslösung), `Sonderfall` (Ausnahme für einen einzelnen Kunden, Mandanten oder Altbestand) und `veraltet` (durch neuere Logik abgelöst oder fachlich überholt). Begründe die Einstufung in einem Halbsatz. Diese Angabe steuert die spätere fachliche Priorisierung; eine Fehleinschätzung ist unkritisch, eine fehlende Angabe nicht.
|
||||
- **Redundanzfreiheit:** Formuliere jede Anforderung so, dass sie von den übrigen klar abgegrenzt ist. Beschreiben zwei Anforderungen dieselbe fachliche Funktion aus unterschiedlicher Perspektive, führe sie zusammen oder grenze sie im Titel und in der Aussage ausdrücklich gegeneinander ab.
|
||||
|
||||
### Formatvorgabe pro Anforderung
|
||||
|
||||
```
|
||||
ID: <StRS|SyRS|SwRS>-<laufende Nummer>
|
||||
Titel: <kurzer Titel>
|
||||
Ebene: <StRS | SyRS | SwRS>
|
||||
Typ: <funktional | nicht-funktional | Schnittstelle | Daten | Sicherheit | ...>
|
||||
Qualitätsmerkmal: <nur bei nicht-funktionalen Anforderungen: ISO-25010-Merkmal, sonst leer>
|
||||
Akteur: <Rolle / System / Komponente>
|
||||
Vorbedingung: <Zustand vor Auslösen>
|
||||
Fakt: <belegte technische Beobachtung, z. B. Statusübergang, Constraint, Prüfung>
|
||||
Aussage: Das System soll <...>. (fachliche Interpretation als klare Soll-Aussage)
|
||||
Ergebnis: <erwartetes Ergebnis / Nachbedingung>
|
||||
Belege:
|
||||
- [PRIMÄR] <Pfad/Klasse/Methode/SQL/UI-String> - Begründung: <warum trägt der Beleg die Aussage>
|
||||
- [SEKUNDÄR] <...> - Begründung: <...>
|
||||
- [KONTEXT] <...> - Begründung: <...>
|
||||
Prüfidee: <Akzeptanzkriterium oder Testidee>
|
||||
Tracelinks: <verwandte StRS-/SyRS-/SwRS-IDs>
|
||||
Konsolidierung: <nein | Kandidat: <IDs oder Stellen, die dieselbe fachliche Funktion abbilden>>
|
||||
Übernahmewürdigkeit: <übernehmen | Workaround | Sonderfall | veraltet> - <kurze Begründung>
|
||||
Status: <belegt | HYPOTHESE>
|
||||
```
|
||||
|
||||
### Traceability
|
||||
|
||||
Stelle Forward- und Backward-Traceability zwischen den drei Ebenen her:
|
||||
- Jede SwRS-Anforderung referenziert die zugehörige SyRS-Anforderung.
|
||||
- Jede SyRS-Anforderung referenziert die zugehörige StRS-Anforderung.
|
||||
- Erzeuge zusätzlich eine konsolidierte **Traceability-Tabelle** (Markdown oder CSV): `StRS-ID | SyRS-ID | SwRS-ID | Artefaktbeleg`.
|
||||
|
||||
### Nicht-funktionale Anforderungen
|
||||
|
||||
- Ordne nicht-funktionale Anforderungen den Qualitätsmerkmalen der **ISO/IEC 25010** zu (z. B. Zuverlässigkeit, Performance-Effizienz, Sicherheit, Wartbarkeit, Übertragbarkeit). Trage die Zuordnung in das dafür vorgesehene Feld `Qualitätsmerkmal` ein, nicht in das Feld `Typ`.
|
||||
- Leite Betriebs- und Sicherheitsanforderungen gezielt auch aus indirekt sichtbaren Artefakten ab: Konfigurationen, Deployment-Skripte, Logging-Policies, Rechteprüfungen.
|
||||
|
||||
### Konsolidierungsbedarf
|
||||
|
||||
Die Codebasis enthält fachliche Redundanz: Dieselbe Anforderung kann auf unterschiedlichen Masken oder in unterschiedlichen Modulen mehrfach und teils unterschiedlich implementiert sein. Prüfe daher bei jeder Anforderung, ob andere Anforderungen dieselbe fachliche Funktion abbilden, und vermerke solche Fälle im Feld `Konsolidierung` als Kandidat für eine Zusammenführung im Zielsystem.
|
||||
|
||||
**Gemeint sind fachlich gleichartige Konzepte in getrennten Implementierungen**, nicht bloß ähnlich formulierte Anforderungen. Ein Beispiel aus dieser Codebasis: Drucker werden als „Stammblätter" geführt, sonstige Hardware getrennt davon als „Assets" - zwei Datenhaltungen für denselben fachlichen Gegenstand, die im Zielsystem zu einem Asset-Konzept zusammengeführt werden sollen. Zwei Anforderungen, die denselben Sachverhalt nur aus Sicht verschiedener Ebenen beschreiben (etwa StRS und SwRS), sind **kein** Konsolidierungsfall - dafür sind die Tracelinks da.
|
||||
|
||||
### Ergebnisstruktur (im vorgegebenen Ausgabeverzeichnis)
|
||||
|
||||
```
|
||||
Ergebnisse/
|
||||
StRS.md
|
||||
SyRS.md
|
||||
SwRS.md
|
||||
Traceability.md (oder Traceability.csv)
|
||||
Hypothesen.md (Sammlung aller mit [HYPOTHESE] markierten Aussagen mit offener Frage)
|
||||
Glossar.md (Domänenbegriffe, die in den Anforderungen verwendet werden)
|
||||
Analysebericht.md (Modulinventar aus Schritt 0, Abdeckungstabelle, Konsistenzcheck,
|
||||
Selbstbewertung, bekannte Lücken)
|
||||
```
|
||||
|
||||
Das Ausgabeverzeichnis wird beim Start des Laufs beigestellt. Die analysierte Codebasis wird ausschließlich gelesen und nicht verändert.
|
||||
|
||||
### Randbedingungen
|
||||
|
||||
- **Keine Halluzinationen.** Wenn ein Artefakt nicht gelesen oder eine Aussage nicht belegt werden kann, ist das offen zu legen, nicht zu erfinden.
|
||||
- **Keine Generierung von Code.** Es sollen ausschließlich Spezifikationsartefakte entstehen.
|
||||
- **Keine Annahme über nicht beigestellte Hilfsmittel.** Arbeite mit dem, was dir in diesem Lauf zur Verfügung steht. Setze keine zusätzlichen Analysewerkzeuge, Datenbankzugriffe oder laufende Systeme voraus. Stehen für eine Aussage nur indirekte Belege zur Verfügung, ist sie als `[HYPOTHESE]` zu kennzeichnen.
|
||||
- **Migrationsperspektive berücksichtigen.** Erkennbare Workarounds, Sonderfälle und überholte Logik gehören in das Feld `Übernahmewürdigkeit`, nicht in das Feld `Status`. `Status` beschreibt ausschließlich die Belegsituation (`belegt` oder `HYPOTHESE`), `Übernahmewürdigkeit` die fachliche Zukunft der Anforderung. Beide Angaben sind unabhängig voneinander: Eine gut belegte Anforderung kann ein Workaround sein, eine Hypothese kann übernahmewürdig sein.
|
||||
- **Sprache:** Deutsch für Anforderungsaussagen, technische Bezeichner (Klassen, Methoden, Spalten) bleiben in ihrer Originalsprache.
|
||||
|
||||
### Abschluss
|
||||
|
||||
Führe vor Abgabe einen **Konsistenzcheck über das gesamte Anforderungs-Set** durch und dokumentiere das Ergebnis im `Analysebericht.md`:
|
||||
- Doppelte oder mehrfach vergebene IDs
|
||||
- Anforderungen ohne Beleg
|
||||
- Anforderungen ohne Angabe zur `Übernahmewürdigkeit`
|
||||
- Tracelinks auf nicht existierende IDs
|
||||
- Inhaltlich deckungsgleiche Anforderungen, die nicht als Konsolidierungskandidat markiert sind
|
||||
- **Liste aller risikorelevanten Anforderungen** (Sicherheit, Abrechnung/Fakturierung, Berechtigungen) mit ihrer Belegsituation: ID, Titel, ob ein `PRIMÄR`-Beleg vorliegt, andernfalls die `[HYPOTHESE]`-Kennzeichnung. Diese Liste macht Verstöße gegen die risikobasierte Priorisierung im Lauf selbst sichtbar.
|
||||
- **Abgleich `Hypothesen.md` gegen die Inline-Markierungen:** Beide müssen dieselben Anforderungen nennen. `Hypothesen.md` enthält genau die Anforderungen mit `[HYPOTHESE]`-Markierung und keine zusätzlichen freien Fragen; offene Punkte ohne zugehörige Anforderung gehören in die Selbstbewertung.
|
||||
|
||||
Erstelle außerdem die **Abdeckungstabelle** auf Basis des Modulinventars aus Schritt 0: je Modul die Einstufung `tief | mittel | flach | nicht analysiert` und die Anzahl der daraus erzeugten Anforderungen. Jede Zeile des Inventars muss in der Abdeckungstabelle auftauchen.
|
||||
|
||||
Beende den Lauf mit einer kurzen Selbstbewertung im `Analysebericht.md`:
|
||||
- Wie viele Module des Inventars wurden tief, mittel, flach beziehungsweise gar nicht analysiert? Nenne absolute Zahlen, nicht nur Beispiele.
|
||||
- Wurde die Mindestabdeckung erreicht, also hat jedes Modul mindestens eine Anforderung? Falls nein: welche Module fehlen und warum?
|
||||
- An welchen Stellen war der Beleg dünn (hoher Anteil `SEKUNDÄR`/`KONTEXT` oder `[HYPOTHESE]`)?
|
||||
- Falls keine einzige Hypothese geführt wurde: Begründung, warum die Analyse ohne offene Punkte auskommt.
|
||||
- Welche Erkenntnisse legen einen Nachschlag in einer Folge-Iteration nahe?
|
||||
+2
-2
@@ -1,4 +1,4 @@
|
||||
# Messprotokoll – V1b-Fable (builtin, `claude-fable-5`, Effort `high`) – Iteration 01, Lauf 24 (Lauf R)
|
||||
# Messprotokoll – V1b-Fable (builtin, `claude-fable-5`, Effort `high`) – Prompt-Version 01, Lauf 24 (Lauf R)
|
||||
|
||||
> ## ⚠ Bedingungsverletzung: Die Subagenten liefen auf einem anderen Modell
|
||||
>
|
||||
@@ -28,7 +28,7 @@
|
||||
|
||||
## Werkzeugkonfiguration
|
||||
- **Laufverzeichnis-ID:** `v3.7.0-15db`
|
||||
- **Ablage:** `claude-fable-5/builtin/high/`
|
||||
- **Ablage:** `Iteration 1/claude-fable-5/builtin/high/`
|
||||
- **Parallele Läufe:** nein
|
||||
- **Skill-Version:** `3.7.0` (erster Lauf mit Effort im Verzeichnisnamen)
|
||||
- **Claude-Code-Version:** 2.1.245
|
||||
+2
-2
@@ -1,4 +1,4 @@
|
||||
# Messprotokoll – V1-Fable (solo, `claude-fable-5`, Effort `max`) – Iteration 01, Lauf 22 (Lauf P)
|
||||
# Messprotokoll – V1-Fable (solo, `claude-fable-5`, Effort `max`) – Prompt-Version 01, Lauf 22 (Lauf P)
|
||||
|
||||
> **Neue Messreihe mit zwei geänderten Variablen.** Gegenüber allen 21 Vorläufen wechseln
|
||||
> **gleichzeitig Modell und Effort**: `claude-fable-5` statt Sonnet/Opus, `max` statt `high`.
|
||||
@@ -24,7 +24,7 @@
|
||||
|
||||
## Werkzeugkonfiguration
|
||||
- **Laufverzeichnis-ID:** `v3.6.0-7adf`
|
||||
- **Ablage:** `claude-fable-5/solo/max/`
|
||||
- **Ablage:** `Iteration 1/claude-fable-5/solo/max/`
|
||||
- **Parallele Läufe:** ja – `fable5_solo_v3.6.0-58d2`
|
||||
- **Skill-Version:** `3.6.0`
|
||||
- **Claude-Code-Version:** 2.1.245
|
||||
+2
-2
@@ -1,4 +1,4 @@
|
||||
# Messprotokoll – V1-Fable (solo, `claude-fable-5`, Effort `max`) – Iteration 01, Lauf 23 (Lauf Q)
|
||||
# Messprotokoll – V1-Fable (solo, `claude-fable-5`, Effort `max`) – Prompt-Version 01, Lauf 23 (Lauf Q)
|
||||
|
||||
> **Neue Messreihe mit zwei geänderten Variablen.** Gegenüber allen 21 Vorläufen wechseln
|
||||
> **gleichzeitig Modell und Effort**: `claude-fable-5` statt Sonnet/Opus, `max` statt `high`.
|
||||
@@ -24,7 +24,7 @@
|
||||
|
||||
## Werkzeugkonfiguration
|
||||
- **Laufverzeichnis-ID:** `v3.6.0-58d2`
|
||||
- **Ablage:** `claude-fable-5/solo/max/`
|
||||
- **Ablage:** `Iteration 1/claude-fable-5/solo/max/`
|
||||
- **Parallele Läufe:** ja – `fable5_solo_v3.6.0-7adf`
|
||||
- **Skill-Version:** `3.6.0`
|
||||
- **Claude-Code-Version:** 2.1.245
|
||||
+2
-2
@@ -1,4 +1,4 @@
|
||||
# Messprotokoll – V1-Opus (Baseline solo, `claude-opus-5`) – Iteration 01, Lauf 17 (Lauf K)
|
||||
# Messprotokoll – V1-Opus (Baseline solo, `claude-opus-5`) – Prompt-Version 01, Lauf 17 (Lauf K)
|
||||
|
||||
> **Neue Messreihe.** Erster Block mit `claude-opus-5`; alle 16 Vorläufe nutzten
|
||||
> `claude-sonnet-5`. Modus, Effort, Prompt, Snapshot und Parallelitätsgrad sind identisch zur
|
||||
@@ -24,7 +24,7 @@
|
||||
|
||||
## Werkzeugkonfiguration
|
||||
- **Laufverzeichnis-ID:** `v3.6.0-2603`
|
||||
- **Ablage:** `claude-opus-5/solo/high/`
|
||||
- **Ablage:** `Iteration 1/claude-opus-5/solo/high/`
|
||||
- **Parallele Läufe:** ja – die vier übrigen Läufe dieses Blocks (`opus5_solo_v3.6.0-6bfe`, `opus5_solo_v3.6.0-5070`, `opus5_solo_v3.6.0-26d8`, `opus5_solo_v3.6.0-f63e`)
|
||||
- **Skill-Version:** `3.6.0`
|
||||
- **Claude-Code-Version:** 2.1.245
|
||||
+2
-2
@@ -1,4 +1,4 @@
|
||||
# Messprotokoll – V1-Opus (Baseline solo, `claude-opus-5`) – Iteration 01, Lauf 18 (Lauf L)
|
||||
# Messprotokoll – V1-Opus (Baseline solo, `claude-opus-5`) – Prompt-Version 01, Lauf 18 (Lauf L)
|
||||
|
||||
> **Neue Messreihe.** Erster Block mit `claude-opus-5`; alle 16 Vorläufe nutzten
|
||||
> `claude-sonnet-5`. Modus, Effort, Prompt, Snapshot und Parallelitätsgrad sind identisch zur
|
||||
@@ -24,7 +24,7 @@
|
||||
|
||||
## Werkzeugkonfiguration
|
||||
- **Laufverzeichnis-ID:** `v3.6.0-6bfe`
|
||||
- **Ablage:** `claude-opus-5/solo/high/`
|
||||
- **Ablage:** `Iteration 1/claude-opus-5/solo/high/`
|
||||
- **Parallele Läufe:** ja – die vier übrigen Läufe dieses Blocks (`opus5_solo_v3.6.0-2603`, `opus5_solo_v3.6.0-5070`, `opus5_solo_v3.6.0-26d8`, `opus5_solo_v3.6.0-f63e`)
|
||||
- **Skill-Version:** `3.6.0`
|
||||
- **Claude-Code-Version:** 2.1.245
|
||||
+2
-2
@@ -1,4 +1,4 @@
|
||||
# Messprotokoll – V1-Opus (Baseline solo, `claude-opus-5`) – Iteration 01, Lauf 19 (Lauf M)
|
||||
# Messprotokoll – V1-Opus (Baseline solo, `claude-opus-5`) – Prompt-Version 01, Lauf 19 (Lauf M)
|
||||
|
||||
> **Neue Messreihe.** Erster Block mit `claude-opus-5`; alle 16 Vorläufe nutzten
|
||||
> `claude-sonnet-5`. Modus, Effort, Prompt, Snapshot und Parallelitätsgrad sind identisch zur
|
||||
@@ -24,7 +24,7 @@
|
||||
|
||||
## Werkzeugkonfiguration
|
||||
- **Laufverzeichnis-ID:** `v3.6.0-5070`
|
||||
- **Ablage:** `claude-opus-5/solo/high/`
|
||||
- **Ablage:** `Iteration 1/claude-opus-5/solo/high/`
|
||||
- **Parallele Läufe:** ja – die vier übrigen Läufe dieses Blocks (`opus5_solo_v3.6.0-2603`, `opus5_solo_v3.6.0-6bfe`, `opus5_solo_v3.6.0-26d8`, `opus5_solo_v3.6.0-f63e`)
|
||||
- **Skill-Version:** `3.6.0`
|
||||
- **Claude-Code-Version:** 2.1.245
|
||||
Some files were not shown because too many files have changed in this diff Show More
Reference in New Issue
Block a user