KI-BRIEFING

Jeden Morgen, was sich fürs Bauen mit KI ändert: neue Plattformen, Standards, Modelle, Werkzeuge und Produktmuster. Ausgewählt von einem Gericht aus KI-Agenten, ohne Wiederholungen.

Ruhiger Tag: Forschung zu Agenten-Tests und kleinen Modellen

AUSGABE 23 Meldungen

Heute gibt es keine Releases von Plattformen oder Werkzeugen, nur Forschung. Am nützlichsten ist TraceDance: Es baut aus echten Agenten-Sessions gezielte Tests für Fehlverhalten, und neun Frontier-Modelle bestehen dort im Schnitt nur 26,7 Prozent.

FORSCHUNGIdeeBeobachten

TraceDance macht aus echten Agenten-Sessions gezielte Verhaltens-Benchmarks

Was ist neuTraceDance baut aus Deployment-Traces Benchmarks für unerwünschtes Verhalten, das du selbst festlegst. Bewertet wird der nächste Zug des Modells an einem aufgezeichneten Entscheidungspunkt, anhand einer Rubrik. Dafür braucht es weder eine Referenzantwort noch ein erneutes Abspielen der Umgebung. Aus 252.557 Sessions zu Coding und allgemeiner Tool-Nutzung entstanden 107 Benchmarks mit 4.125 Fällen, und neun Frontier-Modelle erreichen darin im Schnitt nur 26,7 Prozent.

Was heißt das für dichWenn du Logs deiner Coding-Agenten hast, zeigt der Ansatz, wie du daraus Regressionstests für konkretes Fehlverhalten bauen kannst, statt dich auf feste Benchmark-Suiten zu verlassen.
FORSCHUNGIdeeBeobachten

FlyBy: Kleine Reasoning-Modelle lernen, wann sie ein stärkeres Modell fragen

Was ist neuDie Autoren unterscheiden zwei Gründe, aus denen kleine Reasoning-Modelle scheitern. Bei Ausführungsengpässen ist der richtige Weg für das Modell noch erreichbar, bei Wissensengpässen fehlt ihm das nötige Wissen. Das Framework FlyBy lernt, wann und wie ausführlich es ein stärkeres externes Modell befragt, und baut die Antwort in das eigene Reasoning ein, ohne jedes Mal teuer nachzufragen.

Was heißt das für dichFür hybride Setups aus On-Device- und Cloud-Modell ist das ein Muster, das du dir merken solltest: Das lokale Modell eskaliert nur, wenn ihm Wissen fehlt, und nicht bei jeder schwierigen Anfrage.
FORSCHUNGIdeeIgnorieren

Synthetische Trainingsdaten verbessern das Lernen aus Kontext bei Qwen3.6-35B-A3B

Was ist neuEine Pipeline schreibt öffentliche Dokumente leicht um, damit das Modell nicht einfach Auswendiggelerntes abruft. Dazu erzeugt sie Fragen und Rubriken und behält nur Beispiele, die wirklich vom Dokument abhängen. Mit etwa 10.000 Beispielen aus 3.500 Dokumenten steigt Qwen3.6-35B-A3B auf CL-bench durch SFT von 13,7 auf 22,8 Prozent und durch RL auf 24,6 Prozent. Qwen3.8-2.4T kommt dort auf 23,9 Prozent. Bei Codegenerierung und Wissen bleiben die Werte weitgehend gleich.

Was heißt das für dichKleinere offene Modelle könnten bald besser mit langem, aufgabenspezifischem Kontext wie Dokumentation umgehen, fürs Coding selbst bringt der Ansatz laut Paper aber kaum etwas.
BEGRIFF DES TAGES

Decision-Point Continuation

Mit Decision-Point Continuation prüft man ein Modell an einer bestimmten Stelle einer aufgezeichneten Agenten-Session. Das Modell bekommt den Verlauf bis zu einem Entscheidungspunkt und soll den nächsten Zug machen. Eine Rubrik bewertet dann, ob dieser Zug das gewünschte Verhalten zeigt. Die Umgebung muss dafür nicht erneut laufen, und eine Musterlösung ist auch nicht nötig. TraceDance nutzt genau dieses Verfahren, um aus echten Sessions günstige und gezielte Tests für Agenten zu bauen.

Aus 88 neuen Meldungen von 33 Quellen ausgewählt · 33.264 Tokens · Verbrauch