WERKZEUGCloudflare Auto Router: "cloudflare/auto" wählt das Modell, Beta kostenlosPLATTFORMGemini ohne Abo nur noch mit Flash-Lite, AI Plus verliert das Pro-ModellMODELLStrands Decider 2B: offenes 2B-Modell entscheidet lokal in rund 115 msMODELLStrata: Qwen3.8-Flash-Next lokal ab 12 GB VRAM, 94 Token/s auf RTX 5070MUSTERSCM: lokale Foto- und Videosuche per CLIP, Whisper und Tesseract, MIT-LizenzWERKZEUGCloudflare Auto Router: "cloudflare/auto" wählt das Modell, Beta kostenlosPLATTFORMGemini ohne Abo nur noch mit Flash-Lite, AI Plus verliert das Pro-ModellMODELLStrands Decider 2B: offenes 2B-Modell entscheidet lokal in rund 115 msMODELLStrata: Qwen3.8-Flash-Next lokal ab 12 GB VRAM, 94 Token/s auf RTX 5070MUSTERSCM: lokale Foto- und Videosuche per CLIP, Whisper und Tesseract, MIT-Lizenz
Jeden Morgen, was sich fürs Bauen mit KI ändert: neue Plattformen, Standards, Modelle, Werkzeuge und Produktmuster. Ausgewählt von einem Gericht aus KI-Agenten, ohne Wiederholungen.
Cloudflare Auto Router wählt das Modell pro Anfrage
AUSGABE 85 Meldungen
Cloudflare hat den Auto Router im AI Gateway als öffentliche Beta freigegeben: Mit "cloudflare/auto" entscheidet das Gateway pro Anfrage, welches Modell ausreicht. Im hauseigenen Benchmark kostet das rund zehn Prozentpunkte Erfolg gegenüber Claude Opus 5.5, bei etwa 35 Prozent der Kosten. Dazu passt, dass Google Gemini Pro ab Oktober 2026 erst ab AI Pro für 21,99 Euro anbietet: Welches Modell du für welche Aufgabe bezahlst, wird zur eigenen Entscheidung.
Was ist neuCloudflare hat den Auto Router als öffentliche Beta im AI Gateway freigegeben. Du setzt als Modell "cloudflare/auto", und das Gateway wählt pro Anfrage ein Modell, das für die Aufgabe ausreicht. Zuerst filtert es den Pool nach Anfrageformat, Zugangsdaten, Zugriffsregeln, Spend Limits und Ausfällen. Dann bewertet ein Klassifikator auf Workers AI die jüngsten Nachrichten: Wahrscheinlichkeiten für 14 Aufgabenkategorien und Noten von eins bis fünf für Komplexität, Mehrdeutigkeit, Tragweite und Kontextabhängigkeit. Eine Scoring-Matrix verrechnet das mit Benchmark-Werten der Modelle und zieht einen Kostenabschlag ab, der bei schweren Aufgaben sinkt. In langen Sitzungen rechnet der Router Cache-Reads und Cache-Writes ein und bleibt innerhalb eines Turns meist beim Modell. Laut Cloudflare spart das intern in OpenCode bis zu 30 Prozent gegenüber reinen Frontier-Modellen. Im hauseigenen Benchmark (97 Aufgaben, je drei Läufe) kam "cloudflare/auto" auf 86,6 Prozent Erfolg für 2,10 Dollar, Claude Opus 5.5 auf 96,6 Prozent für 5,91 Dollar, GPT-6 Sol auf 84,2 Prozent für 2,64 Dollar. Während der Beta ist der Router kostenlos. Modellliste, zusätzliche Latenz und eigene Routing-Regeln nennt der Beitrag nicht; Clef erwähnt er nicht, als Vorhaben stehen nur strukturierte Entscheidungsmodelle als Vorstufe des Klassifikators.
Was heißt das für dichDu kannst die Modellwahl aus dem Code ins Gateway verlagern und zahlst für einfache Anfragen keine Frontier-Preise mehr. Der Preis dafür steht in Cloudflares eigener Tabelle: rund zehn Prozentpunkte weniger Erfolg als Opus 5.5 bei 35 Prozent der Kosten. Steuern kannst du laut Beitrag nur indirekt, über Zugangsdaten, Zugriffsregeln und Spend Limits am Gateway. Volle Unterstützung für Responses API und WebSockets fehlt noch.
Was du diese Woche tun kannstWenn du schon über AI Gateway gehst: Stell in einem unkritischen Pfad das Modell auf "cloudflare/auto" und lass 20 bis 30 deiner echten Aufgaben gegen dein festes Modell laufen. Vergleiche Kosten pro gelöster Aufgabe, nicht den Tokenpreis. Wie der Aufruf aus einem Worker aussieht, steht in der Entwicklerdoku, nicht im Blogpost.
Noch nicht geprüftDie Einsparung von bis zu 30 Prozent und alle Benchmark-Werte stammen aus Cloudflares internem Einsatz und einem hauseigenen, nicht veröffentlichten Benchmark. Nicht in den abgerufenen Seiten gefunden: 20.
Was ist neuGoogle ordnet laut The Decoder ab Oktober 2026 den Modellzugang für Gemini-Nutzer mit persönlichem Konto neu. Ohne Abo bleibt nur das kleinste Modell Flash-Lite, Flash und Pro entfallen. Im Tarif AI Plus (4,99 Euro) gibt es Flash-Lite und Flash, aber kein Pro mehr. Alle drei Modelle bekommst du erst mit AI Pro (21,99 Euro) und AI Ultra. Einen genauen Stichtag nennt der Bericht nicht, ebenso wenig, ob das kostenlose Kontingent der Gemini API und von AI Studio betroffen ist. Dass Google damit den Boden für das im Betrieb teurere Gemini 4 Argon bereitet, ist eine Vermutung des Autors, keine Angabe von Google.
Was heißt das für dichWenn du Gemini Pro bisher gratis oder über AI Plus für Prototypen, Gegenproben oder Modellvergleiche genutzt hast, brauchst du dafür künftig AI Pro für 21,99 statt 4,99 Euro. Für Produkte zählt das Muster: Die Staffelung nach Modellklasse erinnert laut The Decoder an das Freemium-Modell von ChatGPT. Nutzer ohne Abo erleben Gemini dann nur noch in der kleinsten Stufe.
Was du diese Woche tun kannstÖffne die Gemini-App und die Google-Supportseite zu den Abos und prüfe, welche Modelle dein Konto ab wann noch bekommt. Nutzt du Pro über AI Plus, rechne die 21,99 Euro für AI Pro gegen deinen Bedarf. Baust du auf dem Gratis-Kontingent der API, sieh in AI Studio nach, ob sich deine Limits ändern.
Noch nicht geprüftTarife, Preise und Modellzuordnung beruhen allein auf dem Bericht von The Decoder; die Google-Supportseite lag nicht vor. Der Bezug zu Gemini 4 Argon ist eine Vermutung des Autors.
Was ist neuAmazons Strands-Team hat am 1. Oktober 2026 Strands Decider 2B veröffentlicht, ein Entscheidungsmodell mit 2 Milliarden Parametern. Es erzeugt keinen Text, sondern wählt aus vorgegebenen Optionen oder vergibt einen Wert zwischen 0 und 1 und liefert zu jeder Antwort eine Konfidenz. Basis ist Qwen3.5-2B mit Pointer-Head statt LM-Head. Code, Trainingsdaten und Skripte liegen auf GitHub, die Gewichte auf Hugging Face; eine konkrete Lizenz nennt die Ankündigung nicht. Laut Amazon entscheidet es lokal im Median in rund 115 ms auf einer Nvidia RTX 3090, bei kleinen Aufgaben in rund 153 ms auf einem M3 MacBook, und liegt auf JevBench auf Platz 3 von 33 in der 2B-Klasse. Für Coding, Chat und komplexe Probleme taugt es laut Amazon nicht.
Was heißt das für dichRouting, Tool-Wahl, Guardrails und Policy-Klassifikation kannst du damit vor jeden Tool-Aufruf setzen, ohne einen weiteren LLM-Aufruf zu bezahlen. Das Modell läuft lokal auf CPU oder GPU, also auch auf einem MacBook. Im Strands Agents SDK hängt es im Beispiel als "InterventionHandler" mit "before_tool_call" vor dem Tool; fertige Bibliotheken für die Einbindung sind laut Team noch in Arbeit.
Was du diese Woche tun kannstInstalliere die CLI mit "pip install strands-decider" und teste eine eigene Routing-Frage mit "strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19" samt "--state" und "--choice". Prüfe vor einem Produkteinsatz die Lizenz im Repository. Für Strands-Agenten liegt ein Beispiel unter "examples/strands/".
Noch nicht geprüftLatenz und JevBench-Platzierung sind Amazons eigene Messungen. Das Datum 1. Oktober 2026 stammt aus dem SiliconANGLE-Bericht, der zudem v.20 nennt, während der Blog von v19 spricht.
Was ist neuStrata ist eine quelloffene Inferenz-Engine (MIT), die Qwen3.8-Flash-Next mit 125 Milliarden Parametern auf Gaming-PCs ausführt. Das README nennt nur Windows 10/11 und Linux mit NVIDIA- oder AMD-Karte ab 12 GB VRAM, mindestens 32 GB RAM und rund 80 GB Platte, macOS kommt nicht vor. Das Modell läuft stark komprimiert in den Stufen Q2_0 bis IQ3_S. Die Grafikkarte hält die meistgenutzten der 24.576 Experten, RAM und CPU den Rest. Das Projekt hat selbst 94 Token/s mit Q2_0 und 53 mit IQ3_S auf einer RTX 5070 gemessen, in kurzen Chats. Die 100 Token/s auf einer RTX 4090 aus dem Titel sind nicht gemessen: für eine RTX 3090 mit 24 GB schätzt das README 100 bis 140. Den Qualitätsverlust der Stufen beziffert es nicht.
Was heißt das für dichStrata stellt lokal eine OpenAI-kompatible API unter "http://127.0.0.1:8080/v1" bereit, dazu "/v1/messages" für Anthropic-Clients und "/v1/responses" für Codex CLI. Du kannst Claude Code oder Codex also ohne Cloud gegen ein großes Modell laufen lassen. Die Grenzen: Standardmäßig wird nur eine Anfrage gleichzeitig beantwortet, und die erste lange Nachricht braucht etwa eine Minute pro 30.000 Token.
Was du diese Woche tun kannstHast du einen Linux- oder Windows-PC mit 12 GB VRAM und 64 GB RAM, führe "./setup.sh" aus, nimm die empfohlene Größe IQ2_XS und starte Claude Code mit "ANTHROPIC_BASE_URL=http://127.0.0.1:8080" an einer echten Aufgabe aus deinem Repo. Arbeitest du nur am Mac, gibt es nichts zu tun, bis das Projekt Apple Silicon unterstützt.
Noch nicht geprüftAlle Geschwindigkeitswerte sind eigene Messungen des Projekts auf zwei Rechnern. Unabhängige Messungen lagen nicht vor.
Was ist neuSCM (Screen Memories) ist eine macOS-App unter MIT-Lizenz, die Fotos und Videos in beliebigen Ordnern lokal per Beschreibung durchsucht, ohne Cloud. Laut Dateiliste und README ist es eine Electron-App, keine native. Bilder embeddet standardmäßig CLIP ViT-L/14@336 über ONNX Runtime (rund 435 MB Download, laut README 480 bis 570 ms pro Bild auf der CPU). Videos zerlegt ffmpeg an Schnittgrenzen und embeddet je Segment den mittleren Frame; Tesseract liefert OCR, Whisper die Dialogsuche. Der Index liegt als JSON plus Float32-Dateien je Modell vor, gerankt wird per Kosinus-Ähnlichkeit. Gesamtwerte für Indexdauer und Speicher nennt das README nicht; Medien werden in die App-Bibliothek kopiert. Stand: Version 0.2.4, 8 Commits.
Was heißt das für dichInteressant ist der Aufbau, nicht das Produkt: Bedeutungssuche läuft über Embeddings, OCR und Dialog dagegen als wörtliche Suche ohne Vektoren, jeweils als eigener Modus. Dazu kommen eine Schwelle, die lieber keinen Treffer zeigt als Rauschen, eine Begründung pro Treffer und Neu-Embedding im Hintergrund beim Modellwechsel. Das lässt sich auf eine eigene Mac-App übertragen. Mit 8 Commits ist es eine Vorlage, kein Fundament.
Was du diese Woche tun kannstInstalliere es auf einem Apple-Silicon-Mac mit "brew tap allenv0/scm", "brew trust allenv0/scm" und "brew install --cask allenv0/scm/scm" und importiere einen kleinen Testordner mit Videos. Lies dann die Ordner "indexer" und "main-lib", wenn du Szenensegmentierung und Ranking für eine eigene App übernehmen willst.
Ein Entscheidungsmodell erzeugt keinen Text, sondern wählt aus vorgegebenen Optionen oder vergibt einen Wert zwischen 0 und 1. Amazons Strands Decider 2B liefert zu jeder Antwort zusätzlich eine Konfidenz und ersetzt dafür den LM-Head des Basismodells Qwen3.5-2B durch einen Pointer-Head. Weil es mit 2 Milliarden Parametern klein ist, läuft es lokal auf CPU oder GPU und entscheidet laut Amazon im Median in rund 115 ms auf einer Nvidia RTX 3090. Du setzt es für Routing, Tool-Wahl, Guardrails und Policy-Klassifikation vor einen Tool-Aufruf, ohne einen weiteren LLM-Aufruf zu bezahlen. Für Coding, Chat und komplexe Probleme taugt es laut Amazon nicht.
Aus 33 neuen Meldungen von 60 Quellen ausgewählt · 220.599 Tokens · Verbrauch