KI-BRIEFING

Jeden Morgen, was sich fürs Bauen mit KI ändert: neue Plattformen, Standards, Modelle, Werkzeuge und Produktmuster. Ausgewählt von einem Gericht aus KI-Agenten, ohne Wiederholungen.

Mistral Large 4 startet als Preview, Gewichte folgen

AUSGABE 108 Meldungen

Mistral hat Mistral Large 4 als öffentliche Preview gestartet: ein multimodales Modell mit 1 Billion Parametern für 1,36 Dollar pro Million Input-Token, betrieben in europäischen Rechenzentren. Die Gewichte sollen bis Ende Oktober folgen, dann kannst du es selbst betreiben, auch wenn es an die geschlossene Spitze nicht heranreicht. Wenn du "gemini-3.1-flash-image" im Produkt nutzt, merk dir außerdem den 29. Oktober: Dann schaltet Google den Vorgänger von Nano Banana 2.1 ab.

MODELLBetaAusprobieren

Mistral Large 4 startet als Preview: 1 Billion Parameter, Gewichte Ende Oktober

Was ist neuMistral hat am 6. Oktober 2026 Mistral Large 4 als öffentliche Preview gestartet, nutzbar per API über Mistral Studio. Laut Mistral ist es ein nativ multimodales MoE-Modell mit 1 Billion Parametern, davon 49 Milliarden aktiv, trainiert auf 3.800 NVIDIA Grace Blackwell GPUs in eigenen europäischen Rechenzentren. Es kostet 1,36 Dollar pro Million Input-Token und 4,18 Dollar pro Million Output-Token. Die Gewichte sollen bis Ende Oktober folgen; Lizenz und Kontextfenster nennt die Ankündigung nicht. Laut Simon Willison kennt die API nur die Reasoning-Stufen "none" und "high". Im Index von Artificial Analysis erreicht das Modell 38 Punkte, Claude Opus 5.5 führt laut The Decoder mit 58.

Was heißt das für dichDu bekommst ein günstiges Modell mit Bildeingabe, das Mistral in Europa unter europäischem Recht betreibt und das du nach Freigabe der Gewichte selbst betreiben kannst. An die geschlossene Spitze reicht es nicht: Mistral nennt 61,7 Prozent auf DeepSWE v1.1, im eigenen Blindtest zur Codequalität lag es hinter Claude Opus 5. Stark ist es laut Mistral bei Visual Grounding und Sicherheitsaufgaben, die andere Modelle ablehnen.
Was du diese Woche tun kannstHol dir in Mistral Studio einen API-Key und lass eine echte Aufgabe mit Bildeingabe oder Tool-Aufrufen einmal mit Reasoning "none" und einmal mit "high" laufen. Vergleiche Qualität und Kosten mit deinem jetzigen Modell. Für Produktion wartest du auf Gewichte und Lizenz Ende Oktober, denn das Modell ändert sich in der Preview noch.
Noch nicht geprüftDie Reasoning-Stufen "none" und "high" stützen sich nur auf Simon Willison, die Werte von Artificial Analysis auf Willison und The Decoder. Die Benchmark-Angaben stammen von Mistral selbst.
MODELLBetaAusprobieren

OpenAI gibt Decisions API mit gpt-6-luna frei, Vercel eskaliert unsichere Antworten

Was ist neuOpenAI hat laut Simon Willison die auf dem DevDay angekündigte Decisions API freigegeben. Das Modell "gpt-6-luna" beantwortet drei Fragetypen: Ja/Nein, Auswahl und Score. Bei Ja/Nein liefert es eine Wahrscheinlichkeit statt Fließtext. Anders als der Konkurrent Jev nimmt es neben Text auch Bilder an. Berechnet wird nur der Input: 10 Cent pro Million Token bei OpenAI, 4,2 Cent bei Jev. Willisons Plugin "llm-openai-decisions" 0.1a0 macht die API im Terminal nutzbar. Vercels AI Gateway kann eine Entscheidung jetzt an ein Fallback-Modell weiterreichen, wenn eine Confidence-Bedingung greift. Die Funktion ist Beta, und eine ausgelöste Eskalation kostet beide Stufen.

Was heißt das für dichKlassifikation, Routing und Moderation bekommst du damit als eigenen, billigen Baustein: Du fragst strukturiert und erhältst eine Wahrscheinlichkeit, statt Freitext eines Chat-Modells zu parsen. Mit dem Schwellenwert im AI Gateway zahlst du das teure Modell nur für die unsicheren Fälle. Mit Jev und OpenAI gibt es zwei Anbieter mit ähnlicher API-Form, der Preisvergleich lohnt sich.
Was du diese Woche tun kannstInstalliere das Plugin mit "llm install llm-openai-decisions" und teste eigene Fälle mit "llm -m openai-decisions/gpt-6-luna -s 'deine Frage'", Bilder hängst du mit "-a" an. Auf Vercel ergänzt du in "providerOptions.gateway.models" ein Objekt mit Fallback-Modell und "when: { confidenceBelow: 0.6 }".
Noch nicht geprüftDie OpenAI-Doku lag nicht vor: Freigabe, Preise, Bild-Input und Fragetypen stützen sich allein auf Simon Willisons Bericht. Ob das AI Gateway gpt-6-luna als Entscheidungsmodell führt, ist nicht belegt.
WERKZEUGStabilAusprobieren

Next.js 16.4 empfiehlt Cache Components für alle Apps und liefert Agenten-Upgrade mit

Was ist neuNext.js 16.4 empfiehlt Cache Components erstmals für jede App: Neue Projekte aus "create-next-app" haben sie aktiv, in Next.js 17 werden sie Standard. Die Lücken schließen "ensureStatic", das den Build abbricht, wenn dynamischer Inhalt in eine statische Route gerät, sowie "navigation()" und "prefetch()", die gecachte Inhalte aus Prefetch oder Shell ausnehmen. "next upgrade --agent" prüft die installierte Version, wählt das Ziel-Release und gibt dem Agenten Migrationsleitfäden, Codemods und Prüfschritte; Skills helfen beim Umbau auf Cache Components. Turbopacks Disk-Cache belegt 20 bis 25 Prozent weniger Platz, CSS-Module-Klassennamen und Export-Namen werden in Produktion gekürzt. React 19.3 bringt stabile View Transitions und Fragment Refs.

Was heißt das für dichCaching im App Router wechselt von implizit zu opt-in per "use cache", und mit Next.js 17 wird das der Standard: Für bestehende Apps lohnt es sich, die Migration jetzt zu planen. Mit "ensureStatic" sicherst du Shop-, Marketing- und Blogseiten gegen ungewolltes Rendern zur Anfragezeit ab. Dass ein Framework Upgrade-Anleitungen und Skills direkt für Agenten ausliefert, ist ein Muster, das du dir für eigene Werkzeuge abschauen kannst.
Was du diese Woche tun kannstLass deinen Agenten in einem Branch "npx next@canary upgrade --agent=latest" ausführen und setze danach in "next.config.ts" "cacheComponents: true" und "partialPrefetching: true". Auf Seiten, die statisch bleiben müssen, ergänze "export const ensureStatic = 'navigation'" und prüfe, ob der Build durchläuft.
MODELLStabilAusprobieren

Nano Banana 2.1 ist GA: etwa halber Preis, Vorgänger endet am 29. Oktober

Was ist neuGoogle hat das Bildmodell Gemini Nano Banana 2.1 ("gemini-nano-banana-2.1") in der Gemini API allgemein verfügbar gemacht. Es löst Nano Banana 2 ("gemini-3.1-flash-image") ab und soll laut Google bei Flash-Tempo Bildqualität, Prompt-Treue, Figurenkonsistenz und Textdarstellung in 1K, 2K und 4K verbessern. Besser werden sollen auch breite und Panorama-Formate (1:4, 4:1, 1:8, 8:1). The Decoder nennt 3,36 Cent pro 1K-Bild (vorher 6,70), 5,04 Cent für 2K und 7,56 Cent für 4K (vorher 15,10). "gemini-3.1-flash-image" ist abgekündigt und wird am 29. Oktober 2026 abgeschaltet. Laut The Decoder liefert Nano Banana Pro in der Praxis weiter realistischere Bilder; 2.1 patzte im Test bei Größenverhältnissen.

Was heißt das für dichWenn du "gemini-3.1-flash-image" im Produkt nutzt, bleiben dir gut drei Wochen bis zur Abschaltung. Der Wechsel halbiert laut The Decoder etwa die Kosten pro Bild, was 4K für größere Mengen kalkulierbarer macht. Für fotorealistische Motive solltest du dich nicht auf die Hersteller-Benchmarks verlassen: The Decoder sieht Nano Banana Pro in der Praxis weiter vorn.
Was du diese Woche tun kannstDurchsuche deinen Code nach "gemini-3.1-flash-image" und stelle in einer Testumgebung auf "gemini-nano-banana-2.1" um. Lass zehn deiner echten Prompts auf beiden Modellen laufen und vergleiche Proportionen und Text im Bild, bevor du vor dem 29. Oktober produktiv umschaltest.
Noch nicht geprüftDie Preise je Auflösung stammen aus dem Bericht von The Decoder, nicht aus dem Changelog; Googles Preisseite lag nicht vor.
WERKZEUGStabilAusprobieren

GitHub Stacked Pull Requests sind allgemein verfügbar, Approvals überleben den Rebase

Was ist neuGitHub hat Stacked Pull Requests allgemein freigegeben: große Änderungen lassen sich in kleine, aufeinander aufbauende PRs teilen, die einzeln geprüft und gemeinsam gemergt werden. Mit der GA behält "Rebase stack" Approvals für unveränderten Code, auch wenn das Repository veraltete Approvals sonst verwirft. Die dabei erzeugten Ersatz-Commits sind signiert und behalten die ursprüngliche Autorschaft. Ein Stack läuft als eine Merge-Gruppe durch die Merge Queue, und wer Repository-Regeln umgehen darf, kann damit den untersten offenen PR eines Stacks mergen. Der "pull_request"-Webhook kennt die neue Aktion "stacked", die CLI-Erweiterung "gh stack" unterstützt Git Worktrees. Verfügbar ist das auf allen github.com-Plänen. Auto-Merge für Stacks wird erst in den nächsten Wochen ausgerollt, GitHub Enterprise Server folgt in einem kommenden Release.

Was heißt das für dichCoding-Agenten liefern schnell große Diffs, die niemand gründlich prüft. Mit Stacks kannst du die Arbeit eines Agenten in kleine, abhängige PRs schneiden, ohne dass jeder Rebase nach einem Merge auf "main" die Freigaben wieder löscht. Weil "gh stack" jetzt Worktrees unterstützt, passt das zu Setups, in denen mehrere Agenten parallel in eigenen Worktrees arbeiten. Über die Webhook-Aktion "stacked" kann deine Automation auf Stacks reagieren.
Was du diese Woche tun kannstNimm ein Repository, in dem veraltete Approvals verworfen werden, und lass deinen Agenten die nächste größere Änderung mit "gh stack" als Stack aus zwei bis drei PRs anlegen. Merge den untersten PR und prüfe nach "Rebase stack", ob die Approvals der übrigen erhalten bleiben. Die Befehle findest du in der im Changelog verlinkten Dokumentation.
MODELLStabilAusprobieren

EmbeddingGemma 2: offenes multimodales Embedding-Modell mit 740M Parametern

Was ist neuGoogle DeepMind hat EmbeddingGemma 2 veröffentlicht, ein offenes Embedding-Modell, das Text, Code, Bilder, Video und Audio in einen gemeinsamen Vektorraum abbildet. Es hat 740 Millionen Parameter, basiert auf Gemma 4 und steht unter Apache 2.0. Die Encoder sind modular: Für reinen Text reichen 270M Parameter, Vision (170M) und Audio (300M) kommen optional dazu. Quantisiert braucht es laut Google auf einem Pixel 11 Pro rund 191 MB aktiven RAM für Text und rund 567 MB für das volle Modell. Die Vektoren lassen sich von 768 auf bis zu 128 Dimensionen kürzen. Die Gewichte liegen auf Hugging Face und Kaggle; als Laufzeiten nennt Google unter anderem LiteRT, MediaPipe, transformers.js, MLX, llama.cpp und Ollama.

Was heißt das für dichDu kannst Suche über Text, Bilder, Audio und Video mit einem lokalen Modell bauen, statt Captioning, Speech-to-Text und Text-Embedding zu verketten. Laut Google gleicht es Eingaben ohne Training direkt mit Label-Beschreibungen ab, also Zero-Shot-Intent-Routing in Millisekunden. Für Apple-Apps ist MLX genannt, ein eigener iOS-Weg steht in den vorliegenden Texten nicht. The Decoder nennt 20 bis 70 ms pro Anfrage per WebGPU.
Was du diese Woche tun kannstLade die Gewichte von Hugging Face und teste auf dem Mac mit MLX oder Ollama, ob eine Textsuche deine eigenen Bilder findet. Für Web-Apps: die Text-Variante mit transformers.js per WebGPU laden und die Latenz pro Anfrage selbst messen. Speichere die Vektoren testweise mit 256 statt 768 Dimensionen.
Noch nicht geprüftDie 20 bis 70 Millisekunden per WebGPU stehen nur bei The Decoder, nicht in den vorliegenden Google-Texten. RAM-Werte und die Routing-Latenz sind Herstellerangaben.
WERKZEUGStabilAusprobieren

Claude Code 2.1.292: Effort pro Sub-Agent, Plugin-Installation in einem Schritt

Was ist neuClaude Code 2.1.292 ist am 6. Oktober erschienen. Das Agent-Tool hat einen Parameter "effort", mit dem Claude einen Sub-Agenten auf der gewünschten Effort-Stufe startet. "claude plugin install --marketplace <source>" fügt den Marketplace bei Bedarf hinzu, mit denselben Policy-Prüfungen wie "claude plugin marketplace add", und installiert dann das Plugin. Mods bekommen Prompt-Caching in "$.model.complete" über "cache: true" an einem Textblock und das Event "prompt.autocomplete" für eigene Zeilen in der Autovervollständigung. Lokale stdio-MCP-Server handeln jetzt standardmäßig die Protokollversion 2026-07-28 aus, "MCP_PROTOCOL_NEGOTIATION=legacy" schaltet das ab. Dazu kommen viele Fixes, darunter ein Sicherheitsfix für Dateizugriffe auf Netzwerkpfade (UNC).

Was heißt das für dichMit "effort" pro Sub-Agent steuerst du, wie viel Aufwand in einen delegierten Teilauftrag fließt, statt alle Sub-Agenten gleich laufen zu lassen. Die geänderte MCP-Aushandlung betrifft jeden lokalen stdio-Server, auch auf Bedrock, Vertex und Foundry. Für Skripte zählt außerdem: "claude -p" und SDK-Sitzungen warten beim ersten Turn nicht mehr auf "resources/list" von HTTP- und SSE-MCP-Servern.
Was du diese Woche tun kannstAktualisiere auf 2.1.292 und bitte Claude in einer Aufgabe ausdrücklich, einen Such-Sub-Agenten mit niedrigerer und einen Review-Sub-Agenten mit höherer Effort-Stufe zu starten, dann vergleiche Dauer und Ergebnis. Hakt danach ein lokaler MCP-Server, setze "MCP_PROTOCOL_NEGOTIATION=legacy".
WERKZEUGStabilAusprobieren

Cursor: Lokale Agenten lassen sich jetzt aus der iOS-App beobachten und anschreiben

Was ist neuCursor hat "Remote Control" veröffentlicht: Aus der Cursor iOS-App siehst du die lokalen Agenten, die auf deinem Rechner laufen, und kannst ihnen Nachrichten schicken. Die Agenten ziehen dabei nicht um, sie laufen weiter lokal und die App verbindet sich mit dem Rechner. Rechner deines Kontos erscheinen nach dem Login automatisch in der App. Du tippst den Rechner an und bestätigst die Pairing-Anfrage in der Desktop-App, danach erscheint die Liste der Agenten. Der Rechner muss an und online bleiben. Die Einstellung "Keep this computer awake" unter Remote Control verhindert den Ruhezustand, verlangt aber Netzteil und offenen Deckel. Die Funktion ist standardmäßig aktiv, außer in Enterprise-Organisationen, wo Admins sie in den Org-Einstellungen einschalten. Cloud-Agenten sind nicht nötig.

Was heißt das für dichDas Muster ist für eigene Agenten-Apps übertragbar: Der Agent bleibt mit Code und Umgebung auf dem Rechner, das Handy dient nur zum Mitlesen und Antworten. Gekoppelt wird mit einer Bestätigung am Desktop statt nur über das Konto, und Enterprise-Organisationen müssen die Funktion erst freischalten. Der Preis des Ansatzes steht offen im Changelog: Ohne wachen, verbundenen Rechner geht nichts.
Was du diese Woche tun kannstInstalliere die Cursor iOS-App, melde dich an, tippe deinen Rechner an und bestätige das Pairing in der Desktop-App. Schalte unter Remote Control "Keep this computer awake" ein, starte einen längeren Agentenlauf und antworte ihm einmal vom Handy. Notiere dir dabei, was du für die Fernbedienung deiner eigenen Agenten-App übernehmen würdest.
BEGRIFF DES TAGES

Stacked Pull Requests

Bei Stacked Pull Requests teilst du eine große Änderung in mehrere kleine PRs, die aufeinander aufbauen. Jeder PR wird einzeln geprüft, gemergt wird der Stack gemeinsam. GitHub hat die Funktion jetzt allgemein freigegeben, und "Rebase stack" behält dabei Approvals für unveränderten Code. Das hilft dir vor allem bei Coding-Agenten, die schnell große Diffs liefern, die sonst niemand gründlich prüft. Mit "gh stack" und Worktrees passt das auch zu Setups, in denen mehrere Agenten parallel arbeiten.

Aus 118 neuen Meldungen von 60 Quellen ausgewählt · 318.238 Tokens · Verbrauch