Qualitaetstest der KI #19
Labels
No labels
status/blocked
status/claimed
status/entwurf
stufe/mvp-1
stufe/mvp-2
stufe/prio-b
stufe/spaeter
type/bug
type/feature
type/infra
type/tech-debt
No milestone
No project
No assignees
1 participant
Notifications
Due date
No due date set.
Dependencies
No dependencies set
Reference
robert/rezeptbuch#19
Loading…
Reference in a new issue
No description provided.
Delete branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
Ziel
Vor dem Anschluss der KI pruefen, ob die OpenAI-Modelle Rezepte zuverlaessig genug lesen - vor allem, ob sie ihre Unsicherheit erkennen und lieber markieren als still raten. Das Ergebnis entscheidet, welches Modell fuer welche Aufgabe eingesetzt wird.
Grundlage
PRD Kapitel 08 ("Qualitaetstest vor der Umsetzung", "Markieren von Unsicherheit", "Aufgaben der KI nach Anspruch");
docs/kritische_durchsicht.mdPunkt 22; CLAUDE.md (Stand).Abhaengig von
Akzeptanzkriterien
Nicht in dieser Stufe
Offene Fragen
Entscheidungen 08.10.2026 (Lena) zu den offenen Fragen - damit ist das Issue bereit:
https://openrouter.ai/api/v1, OpenAI-kompatibel). Lena legt den Schluessel selbst als Benutzer-UmgebungsvariableOPENROUTER_API_KEYan; er landet nie im Repo oder Chat. Ausgabenlimit: 10 Euro pro Monat.provider.data_collection: "deny").z-ai/glm-5.3-flash(guenstig, liest Bilder; soll moeglichst fuer alle Aufgaben genutzt werden) undopenai/gpt-6.1-solals grosser Massstab (AK-3). Besteht GLM ueberall, nutzt die App nur GLM; faellt es bei einer Aufgabe durch, wird dort das guenstigste Modell genommen, das bestanden hat.20220420_190622.jpgist eine gedruckte Kochbuchseite) - sie wird nachgetestet, sobald Lena ein Foto ablegt.status/entwurfentfernt.Nachtrag 08.10.2026 (Lena): Die handschriftliche Karte ist
daten/waffeln.jpeg(Knusprige Waffeln). Sie wird beim Bau von #19 nach "erste Rezepte/" uebernommen. Sie testet ausserdem Spanne ("1-2 El. Zucker"), Abkuerzungen ("Van. Zucker", "gestr. Te."), eine Alternative ("Rum oder abger. Zitrone"), "ergibt 12 Stueck" und Namen im Rezepttext ("Oda + Joerg" - fuer den Datenschutz-Test).Claimed by session "Loop go #12 -> #19 -> #20 -> #5 [acbb06]"
Fertig. Ergebnis in Alltagssprache:
docs/ki-qualitaetstest/zusammenfassung.md, ausführlicher Bericht:docs/ki-qualitaetstest/ergebnisse/2026-10-09_0409.md.Ergebnis
openai/gpt-6.1-sol) besteht alle drei Aufgaben (Foto lesen, Seitentext lesen, Rezept strukturieren) in allen 3 Durchläufen: keine einzige falsch gelesene Menge, unklare Stellen markiert (z. B. "½ Schmelzkäse"), Fotos in 15-28 Sekunden.z-ai/glm-5.3-flash) fällt bei jeder Aufgabe mindestens einmal durch: Waffelkarte einmal ganz ohne Zutaten, Fotos bis 131 Sekunden, bei langen Texten dreimal Abbruch nach 5 Minuten.Wie getestet (AK-1 bis AK-6)
docs/ki-qualitaetstest/kriterien.md). Nach dem ersten Lauf offen begründet verschärft: 3 Durchläufe, jeder muss bestehen.erste Rezepte/erwartet/: Kochbuchseite, handschriftliche Waffelkarte, PDF-Kochbuch, Tarte, Pizzateig, Zimtschnecken, englischer Blog (Sally's Chocolate Chip Cookies), Instagram (Cremiger Spitzkohl).dotnet run --project KiQualitaetstest. Gespeicherte Antworten lassen sich ohne neue Kosten neu auswerten. Die Vergleichslogik hat 15 eigene Tests (ohne KI).Gelernt für
#20So probierst du es selbst aus
Im Kochbuch-Ordner
dotnet run --project KiQualitaetstest -- --fall waffeln --durchlaeufe 1(kostet etwa 1 Cent), danach den neuen Bericht unterdocs/ki-qualitaetstest/ergebnisse/öffnen. Ohne Kosten:dotnet run --project KiQualitaetstest -- --textezeigt, welcher Text aus den Dateien gelesen wird.