Unter 100 Millisekunden: AWS verschenkt das KI-Gehirn für Agenten
Amazon veröffentlicht Strands Decider 2B als Open Source, Cloudflare zieht mit Clef nach. Kleine Entscheidungsmodelle könnten teure LLM-Aufrufe in…
Aktien im Artikel
Goldesel Kompakt
Das Wichtigste in Kürze
- AWS-Neuheit: Amazon hat Strands Decider 2B veröffentlicht, ein offenes KI-Modell, das lokal läuft und Entscheidungen in unter 100 Millisekunden liefert.
- Cloudflare kontert: Cloudflare hat mit Clef und Clef-flash eigene Entscheidungsmodelle trainiert, die den bisherigen Vorreiter Jev bei der Latenz schlagen sollen.
- Warum das zählt: Kleine Entscheidungsmodelle können in KI-Agenten-Pipelines kostengünstige Zwischenstufen zwischen großen Sprachmodellen ersetzen.
Wenn ein KI-Agent eine Aufgabe erledigt, verbringt er die meiste Zeit nicht mit kompliziertem Denken, sondern mit Kleinkram: Welches Tool soll ich aufrufen? Ist diese Anfrage wichtig oder Spam? Darf dieser Schritt weitergereicht werden? Bisher landen solche Zwischenfragen bei großen Sprachmodellen, die dafür teuer und langsam sind. Amazon hat dafür am 1. Oktober eine Alternative veröffentlicht, die praktisch nichts kostet: Strands Decider 2B, ein offenes Modell, das nur entscheidet und dabei extrem schnell ist.
Was AWS da genau veröffentlicht hat
Strands Decider 2B ist Teil von strands-labs und richtet sich an Entwickler, die agentische KI-Anwendungen bauen und schnell experimentieren wollen. Das Modell ist vollständig quelloffen, Trainingsdaten und Skripte sind mitgeliefert. Wer will, kann also nachvollziehen oder anpassen, wie das Modell zu seinen Entscheidungen kommt. Das ist in der Praxis selten: Selbst bei vielen offenen Gewichtsdateien bleiben Datensätze und Trainingscode unter Verschluss.

AWS added Strands Decider 2B to strands-labs, a small decision model for agentic AI optimized for fast experimentation and local development. It runs locally, returns answers in under 100 milliseconds, and is fully open source.
AWS Newsroom, 1. Oktober 2026
Zwei Eigenschaften sind dabei die eigentliche Nachricht. Erstens läuft Strands Decider 2B lokal, also ohne Cloud-Aufruf und ohne Abrechnung pro Anfrage. Zweitens liefert es Antworten in unter 100 Millisekunden. In einem Agenten-Workflow, in dem Dutzende solcher Zwischenentscheidungen anfallen können, ist genau das der Unterschied zwischen einer flüssig reagierenden Anwendung und einem System, das bei jedem Schritt sichtbar ruckelt. Die Ankündigung im AWS Newsroom nennt schnelle Experimentierbarkeit und lokale Entwicklung als Hauptzweck.
Warum kleine Entscheider große Sprachmodelle entlasten können
Die Idee dahinter ist nicht neu, aber sie bekommt gerade Rückenwind. Der Technologiekommentator Michael Waitze beschreibt die Entwicklung so: Kleine, schnelle, offene Entscheidungsmodelle seien genau das, was agentische Workflows brauchen. Die Pointe ist architektonisch. Ein großer Sprachmodell-Aufruf kostet jedes Mal Geld, auch wenn am Ende nur eine Ja-Nein-Frage beantwortet wird. Ein kleines Spezialmodell, das auf dem eigenen Rechner läuft, kostet nach dem einmaligen Aufsetzen praktisch nichts mehr pro Anfrage.
Der Vorreiter dieser Modellklasse war Jev, ein reines Entscheidungsmodell, das die agentische Szene als Latenz-Referenz benutzt hat. An genau dieser Referenz messen sich nun die Neulinge. Auch OpenAI hat das Feld für sich entdeckt und eine Decisions API vorgestellt, die Entscheidungen als eigenständigen API-Typ anbietet, statt sie über Umwege von großen Sprachmodellen erledigen zu lassen. Wer Qualität und Preis vergleicht, landet daher schnell bei derselben Frage: Muss eineRouting-Entscheidung wirklich von einem Milliardenschweren Modell getroffen werden, oder reicht ein Modell, das genau dafür trainiert wurde?
Die Antwort fällt je nach Aufgabe unterschiedlich aus. Für das Verfassen eines Textes oder komplexes Schlussfolgern braucht es weiterhin große Modelle. Für die vielen kleinen Weichenstellungen dazwischen tut es ein Spezialist. Genau deshalb geht die Erwartung von Beobachtern wie Waitze dahin, dass spezialisierte kleine Entscheidungsmodelle große Sprachmodelle in agentischen Pipelines zunehmend als kostengünstige Routing- und Klassifikations-Zwischenstufen ablösen könnten.
Cloudflare zieht nach: Clef und Clef-flash
Dass Amazon mit Strands Decider 2B nicht allein bleibt, zeigt ein Blick auf Cloudflare. Das Unternehmen hat laut einem Bericht von AGTP Insights mit Clef und Clef-flash seine ersten hauseigenen KI-Modelle vorgestellt. Beide sind Entscheidungsmodelle, trainiert vom Workers-AI-Team, und Cloudflare sagt, dass beide den Pionier Jev bei der Geschwindigkeit schlagen.
Für Cloudflare ist das mehr als ein Experiment am Rand. Das Kerngeschäft des Unternehmens ist das Netzwerk, das Daten und Anfragen möglichst nah am Nutzer verarbeitet. Ein eigenes, kleines Entscheidungsmodell passt genau in diese Logik: Es kann auf Edge-Infrastruktur laufen und Routing-Entscheidungen dort treffen, wo sie anfallen, statt dafür den Umweg über eine zentrale Rechenzentrums-Region zu nehmen. Latenz ist bei Cloudflare seit jeher das Verkaufsargument, und mit Clef verlagert das Unternehmen dieses Argument in die KI-Ebene.
Der direkte Vergleich der drei Ansätze fällt trotzdem unterschiedlich aus. Strands Decider 2B ist das offenste Paket: Modell, Trainingsdaten und Skripte liegen offen, der Betrieb läuft lokal und damit ohne laufende Kosten. Clef und Clef-flash setzen auf Cloudflares Infrastruktur, was für Entwickler, die ohnehin auf Workers setzen, nahe liegt, aber eben an den Anbieter bindet. Jev bleibt als unabhängiger Maßstab im Spiel, muss sich aber nach Cloudflares Angaben bei der Latenz geschlagen geben. Eine unabhängige Gegenprüfung dieser Latenz-Angaben steht bislang aus.
Was das für Amazon und Cloudflare bedeutet
Für Amazon ist Strands Decider 2B kein Umsatzbringer, sondern ein Türöffner. Das Modell senkt die Hürde, agentische Anwendungen überhaupt zu bauen, und wer erst einmal mit dem offenen Modell experimentiert hat, landet mit wachsenden Anforderungen später oft bei managed Services. AWS hat dieses Muster schon öfter gefahren: offen anfangen, monetarisieren, wenn es ernst wird.
Für Cloudflare ist die Rechnung direkter. Ein eigenes Modell in der Edge-Infrastruktur stärkt das Workers-AI-Angebot gegenüber den großen Cloud-Plattformen, die in puncto Modellpalette deutlich breiter aufgestellt sind. Cloudflare kann dort nicht mithalten, muss es aber auch nicht: Ein schnelles, spezialisiertes Modell, das genau die Zwischenschritte in Agenten-Workflows übernimmt, ist ein gutes Argument für die eigene Plattform. Der Wettbewerb mit AWS ist damit nicht primär ein Modell-Wettbewerb, sondern einer um die Infrastruktur, in der solche Modelle laufen.
Der Trend zur Spezialisierung hat aber auch Grenzen. Entscheidungsmodelle sind Zwischenstufen, keine Ersatz für das große Modell am Ende der Pipeline. Wer komplexe Aufgaben lösen will, kommt an leistungsfähigen Sprachmodellen nicht vorbei. Die small deciders gewinnen dort Marktanteile, wo es nur um Auswahl geht, nicht um Erkenntnis. Und die Qualität solcher Modelle hängt weiterhin davon ab, wofür sie trainiert wurden; ein offener Trainingsdatensatz, wie AWS ihn mitliefert, macht das zwar nachprüfbar, aber nicht automatisch besser.
Relevante Titel zum Thema
Im Zentrum stehen zwei Titel: Amazon, weil AWS mit Strands Decider 2B die offene Referenz in dieses Segment gesetzt hat und über die Cloud-Plattform den Hauptnutzen aus wachsenden Agenten-Workflows zieht. Cloudflare ist als direkter Wettbewerber betroffen, weil das Unternehmen mit Clef und Clef-flash eigene Entscheidungsmodelle für seine Edge-Plattform vorstellt und damit seine Stellung im KI-Infrastruktur-Geschäft ausbauen will.
Relevante Titel zum Thema
Im Zusammenhang mit dem Anlass sind für Anleger vor allem diese Börsentitel von Interesse.
Quellen & weiterführende Berichte
Häufige Fragen
Was ist Strands Decider 2B?
Ein kleines Open-Source-Entscheidungsmodell von AWS für Agentic AI. Es läuft lokal, beantwortet Anfragen in unter 100 Millisekunden und wird inklusive Trainingsdaten und Skripten frei verfügbar gemacht.
Was unterscheidet ein Entscheidungsmodell von einem normalen KI-Modell?
Ein Entscheidungsmodell erzeugt keine langen Texte, sondern wählt zwischen vorgegebenen Optionen und gibt an, wie sicher es bei der Wahl ist. Das reicht für Routings- und Klassifikationsaufgaben in Agenten-Pipelines.
Welche Rolle spielt Cloudflare bei dem Thema?
Cloudflare hat mit Clef und Clef-flash laut eigenen Angaben seine ersten hauseigenen KI-Modelle trainiert. Beide sollen den bisherigen Latenz-Vorreiter Jev schlagen.
Warum sind kleine Entscheidungsmodelle günstiger als große Sprachmodelle?
Sie können lokal und ohne Abrechnung pro API-Aufruf laufen. In Agenten-Workflows, in denen viele Zwischenschritte nur eine Auswahl treffen müssen, sinken so die Kosten pro Anfrage deutlich.