FORSCHUNGAgent Error Dataset: 50.228 Fehlerdiagnosen aus 33 UmgebungenFORSCHUNGFocusVTC: Dokumente als Seitenbilder lesen, bei Bedarf hineinzoomenFORSCHUNGAgent Error Dataset: 50.228 Fehlerdiagnosen aus 33 UmgebungenFORSCHUNGFocusVTC: Dokumente als Seitenbilder lesen, bei Bedarf hineinzoomen
Jeden Morgen, was sich fürs Bauen mit KI ändert: neue Plattformen, Standards, Modelle, Werkzeuge und Produktmuster. Ausgewählt von einem Gericht aus KI-Agenten, ohne Wiederholungen.
Ruhiger Tag: zwei Paper zu Agentenfehlern und Dokumenten
AUSGABE 42 Meldungen
Heute gibt es nur Forschung, keine neue Plattform, kein Modell und kein Werkzeug, das du sofort einsetzen kannst. Zwei Paper sind trotzdem einen Blick wert, drei weitere haben wir weggelassen, weil sie zu weit von der Praxis entfernt sind oder der Quelltext zu wenig belegt.
Was ist neuDer Datensatz sammelt 50.228 Paare aus Fehler und Diagnose, gewonnen aus 9.961 Aufgaben in 33 Umgebungen, mit 19 Harness-Familien und 23 Modellen. In 3.062 wiederholten Läufen vom selben Checkpoint hob der erste Korrekturvorschlag die Erfolgsquote des Prüfers von 18,4 auf 51,1 Prozent. Ein mit den Diagnosen feinabgestimmtes Qwen3-8B stimmte zu 63,6 statt 47,2 Prozent mit den internen Referenzlabels überein.
Was heißt das für dichFür deine tägliche Arbeit mit Coding-Agenten ändert sich vorerst nichts, aber das Paper zeigt, dass gescheiterte Läufe mit gespeicherten Traces mehr hergeben als nur ein Fehlschlag-Signal.
Was ist neuFocusVTC gibt dem Modell lange Dokumente als kompakte Seitenbilder in niedriger Auflösung und lässt es über das Werkzeug zoom_region gezielt Ausschnitte der hochaufgelösten Seite nachladen, bevor es antwortet. Das System baut auf Qwen3.5 auf und wurde mit überwachtem Fine-Tuning und GRPO trainiert. Veröffentlicht sind Trainings- und Evaluationscode sowie Dokument-Inferenz und Benchmark-Adapter.
Was heißt das für dichEin fertiges API-Angebot gibt es nicht, du kannst dir aber das Muster merken: erst grober Überblick, dann gezieltes Nachladen der Stelle, die als Beleg zählt.
Ein Harness ist das Gerüst um ein Sprachmodell herum, das aus dem Modell erst einen Agenten macht: Systemprompt, Werkzeuge, die Schleife aus Aktion und Rückmeldung und die Verwaltung des Kontexts. Claude Code und Codex sind solche Harnesses. Dasselbe Modell kann sich in zwei Harnesses deutlich unterschiedlich verhalten. Das Agent Error Dataset von heute sammelt deshalb Fehler aus 19 Harness-Familien und 23 Modellen, damit sich Fehlschläge über verschiedene Aufbauten hinweg vergleichen lassen.
Aus 90 neuen Meldungen von 33 Quellen ausgewählt · 37.224 Tokens · Verbrauch