FORSCHUNGTraceDance: Neun Frontier-Modelle bestehen im Schnitt nur 26,7 % der Agenten-TesFORSCHUNGFlyBy: Kleines Modell fragt gezielt ein großes, statt einfach länger zu denkenFORSCHUNGLernen aus Kontext: 35B-Modell zieht auf CL-bench mit einem 2,4T-Modell gleichFORSCHUNGTraceDance: Neun Frontier-Modelle bestehen im Schnitt nur 26,7 % der Agenten-TesFORSCHUNGFlyBy: Kleines Modell fragt gezielt ein großes, statt einfach länger zu denkenFORSCHUNGLernen aus Kontext: 35B-Modell zieht auf CL-bench mit einem 2,4T-Modell gleich
Jeden Morgen, was sich fürs Bauen mit KI ändert: neue Plattformen, Standards, Modelle, Werkzeuge und Produktmuster. Ausgewählt von einem Gericht aus KI-Agenten, ohne Wiederholungen.
Ruhiger Tag: Forschung zu Agenten-Tests und kleinen Modellen
AUSGABE 23 Meldungen
Heute gibt es keine Releases von Plattformen oder Werkzeugen, nur Forschung. Am nützlichsten ist TraceDance: Es baut aus echten Agenten-Sessions gezielte Tests für Fehlverhalten, und neun Frontier-Modelle bestehen dort im Schnitt nur 26,7 Prozent.
Was ist neuTraceDance baut aus Deployment-Traces Benchmarks für unerwünschtes Verhalten, das du selbst festlegst. Bewertet wird der nächste Zug des Modells an einem aufgezeichneten Entscheidungspunkt, anhand einer Rubrik. Dafür braucht es weder eine Referenzantwort noch ein erneutes Abspielen der Umgebung. Aus 252.557 Sessions zu Coding und allgemeiner Tool-Nutzung entstanden 107 Benchmarks mit 4.125 Fällen, und neun Frontier-Modelle erreichen darin im Schnitt nur 26,7 Prozent.
Was heißt das für dichWenn du Logs deiner Coding-Agenten hast, zeigt der Ansatz, wie du daraus Regressionstests für konkretes Fehlverhalten bauen kannst, statt dich auf feste Benchmark-Suiten zu verlassen.
Was ist neuDie Autoren unterscheiden zwei Gründe, aus denen kleine Reasoning-Modelle scheitern. Bei Ausführungsengpässen ist der richtige Weg für das Modell noch erreichbar, bei Wissensengpässen fehlt ihm das nötige Wissen. Das Framework FlyBy lernt, wann und wie ausführlich es ein stärkeres externes Modell befragt, und baut die Antwort in das eigene Reasoning ein, ohne jedes Mal teuer nachzufragen.
Was heißt das für dichFür hybride Setups aus On-Device- und Cloud-Modell ist das ein Muster, das du dir merken solltest: Das lokale Modell eskaliert nur, wenn ihm Wissen fehlt, und nicht bei jeder schwierigen Anfrage.
Was ist neuEine Pipeline schreibt öffentliche Dokumente leicht um, damit das Modell nicht einfach Auswendiggelerntes abruft. Dazu erzeugt sie Fragen und Rubriken und behält nur Beispiele, die wirklich vom Dokument abhängen. Mit etwa 10.000 Beispielen aus 3.500 Dokumenten steigt Qwen3.6-35B-A3B auf CL-bench durch SFT von 13,7 auf 22,8 Prozent und durch RL auf 24,6 Prozent. Qwen3.8-2.4T kommt dort auf 23,9 Prozent. Bei Codegenerierung und Wissen bleiben die Werte weitgehend gleich.
Was heißt das für dichKleinere offene Modelle könnten bald besser mit langem, aufgabenspezifischem Kontext wie Dokumentation umgehen, fürs Coding selbst bringt der Ansatz laut Paper aber kaum etwas.
Mit Decision-Point Continuation prüft man ein Modell an einer bestimmten Stelle einer aufgezeichneten Agenten-Session. Das Modell bekommt den Verlauf bis zu einem Entscheidungspunkt und soll den nächsten Zug machen. Eine Rubrik bewertet dann, ob dieser Zug das gewünschte Verhalten zeigt. Die Umgebung muss dafür nicht erneut laufen, und eine Musterlösung ist auch nicht nötig. TraceDance nutzt genau dieses Verfahren, um aus echten Sessions günstige und gezielte Tests für Agenten zu bauen.
Aus 88 neuen Meldungen von 33 Quellen ausgewählt · 33.264 Tokens · Verbrauch