Gemini 4 Argon: Eine Million Tokens Ausgabe und was das für Google bedeutet

Googles neues KI-Modell darf eine Million Tokens am Stück ausgeben und kostet deutlich weniger pro Aufgabe als die Konkurrenz. Aber bei vollständigen…

Blogartikelbild Gemini 4 Argon: Eine Million Tokens Ausgabe und was das für Google bedeutet
Bei Google bevorzugen

Goldesel Kompakt

Das Wichtigste in Kürze

  1. Ausgabe-Limit: Google hebt das maximale Ausgabe-Token-Limit von Gemini 4 Argon von 64.000 auf 1.000.000 Tokens.
  2. Kosten pro Task: Laut Artificial Analysis kostet Argon 1,99 US-Dollar pro Intelligence-Index-Task bei einem Score von 53.
  3. Schwäche beim Coden: Auf Vals' ProgramBench löst Argon nur 5 von 200 Programmen vollständig, Opus schafft 37.

Google hebt das Ausgabe-Limit von Gemini 4 Argon auf eine Million Tokens

Ein Tag nach der Vorstellung von Gemini 4 Argon zeichnet sich ab, worin Google den größten Hebel sieht: extreme Ausgabelängen. Das maximale Ausgabe-Token-Limit liegt bei einer Million Tokens, nachdem es zuvor 64.000 waren. Zum Vergleich: Gängige Konkurrenzmodelle arbeiten mit 128.000-Token-Grenzen. Für Agenten, die über viele Schritte hinweg Code prüfen, Hypothesen verwerfen und Pläne umschreiben, kann das den Unterschied zwischen einem fertigen Ergebnis und einem teuren Neustart ausmachen.

Messen lässt sich das Modell unter anderem über Artificial Analysis. Dort erzielt Argon bei der Benchmark AA-Omniscience eine Genauigkeit von 50 Prozent bei einer Halluzinationsrate von 15 Prozent. Zum Vergleich von Artificial Analysis selbst: Gemini 3.1 Pro lag bei 55 Prozent Genauigkeit. Die Halluzinationsrate zählt Fehler im Verhältnis zu allen nicht-korrekten Antworten, also inklusive Teilantworten und Verweigerungen. Argon gibt also seltener falsche Antworten, löst dafür aber auch weniger Aufgaben vollständig.

✓
✕
”
Was sind Output-Tokens?

KI-Modelle erzeugen Antworten in Tokens, das sind Text- oder Code-Brocken von wenigen Zeichen. Das Ausgabe-Limit begrenzt, wie lang eine zusammenhängende Antwort sein darf. Bei Agenten, die lange schriftlich überlegen und Code schreiben, war eine Grenze von 64.000 Tokens schnell erreicht, was den Abbruch der Arbeit erzwingen konnte. Eine Million Tokens erlaubt deutlich längere Arbeitsläufe in einem einzigen Durchgang.

Stärken: Preis, Halluzinationen und echte Software-Arbeit

Beim Preis setzt sich Argon an die Spitze der Messung: Artificial Analysis beziffert die Kosten auf 1,99 US-Dollar pro Intelligence-Index-Task bei einem Score von 53 und rund 62.000 Output-Tokens pro Aufgabe. Die Stärke liegt also nicht allein in der Punktzahl, sondern im Verhältnis von Leistung zu Kosten bei langen Reasoning-Läufen.

Die praktischste Demonstration liefert Google aus dem eigenen Haus. Im libgav1-Projekt, einer Bibliothek zur Videodekodierung, ersetzten autonome Agenten 32.000 Zeilen handgeschriebenen SIMD-Codes durch sicheren Rust-Code. Das Ergebnis ist laut Google 2,7-mal schneller als der bisherige Rust-Port und liefert identische Videoausgaben. Dahinter steht AlphaEvolve, das Code vorschlägt, Kandidaten ausführt und Verbesserungen über evolutionäre Suche auswählt. Bereits im Mai hatte Google berichtet, dass AlphaEvolve einen Gemini-Trainings-Kernel um 23 Prozent beschleunigte, was die Gesamttrainingszeit um 1 Prozent senkte, und die Schreibverstärkung bei der Datenbank Spanner um 20 Prozent reduzierte.

Googles Infrastrukturarbeit geht laut eigenen Angaben weiter: Nach dem Rollout der Optimierungen wurden mehr als 300 TiB Speicher freigesetzt, und Migrationsarbeiten am über 800.000 Zeilen umfassenden Zircon-Kernel laufen. Solche Zahlen sind intern, aber sie zeigen die Richtung: Google nutzt die eigenen Agenten, um die Kosten der eigenen Rechenzentren zu drücken.

Wo die Schwächen liegen: unvollständige Lösungen und Kritik aus dem Haus

Die Benchmarks zeigen auch Grenzen. Auf Vals‘ ProgramBench, einem Test, bei dem Kommandozeilenprogramme aus Binärdateien und Verhaltensbeschreibungen rekonstruiert werden müssen, besteht Argon 83,7 Prozent der versteckten Tests. Doch nur 5 von 200 Programmen löst es vollständig. Opus schafft 37 vollständige Lösungen bei 87,0 Prozent Testabdeckung. Die Lücke bei den fertigen Artefakten ist groß, auch wenn die durchschnittliche Testabdeckung nah beieinander liegt.

Dazu kommt interne Kritik. Bloomberg berichtet über uneinheitliche Coding-Leistungen, Schwächen bei Frontend-Aufgaben und interne Bedenken, dass das Modell auf Benchmarks optimiert worden sein könnte, was Google bestreitet. Das ist die zentrale Unsicherheit rund um Argon: Die gemessenen Höchstwerte und die berichtete Praxis klaffen auseinander, und welche Seite recht hat, lässt sich derzeit nicht abschließend sagen..

Ein Indiz für die Produktrealität liefert eine JetBrains-Umfrage unter mehr als 15.000 Entwicklern von Mai bis Juli: Claude Code nutzen demnach 39 Prozent, Codex 16 Prozent und Googles Antigravity 6 Prozent. Das Bewusstsein für Antigravity stieg zwar deutlich, die Nutzung blieb aber gleich. Bekanntheit allein erzeugt also keine Nutzer, und Google muss die Lücke zur Konkurrenz im Produkt schließen, nicht nur auf dem Benchmarkscore.

Was Gemini 4 Argon für die KI-Branche bedeutet

Argon verschiebt die Messlatte bei zwei Dingen, die für den Einsatz von Agenten in Unternehmen entscheidend sind: die Länge zusammenhängender Arbeitsschritte und die Kosten pro erledigter Aufgabe. Die Million-Token-Grenze gibt Entwicklern Spielraum, ein Problem in einem Durchgang zu untersuchen, statt bei jedem Limit einen Neustart zu riskieren. Gleichzeitig warnt Artificial Analysis davor, dass längere erfolglose Reasoning-Schleifen Latenz und Kosten drastisch erhöhen können. Das größere Budget schafft die Gelegenheit, garantiert aber nicht die Qualität der zusätzlichen Rechenzeit.

Dazu kommt ein Trend, den Google mit Argon glaubhaft macht: Verifikation als Teil des Systems. Weil Code automatisch geprüft wird, bevor er übernommen wird, darf der Generator auch häufiger falsch liegen, solange die Prüfung die Fehler abfängt. Das verändert die Ökonomie der Codesuche, und Google kann die Rechnung über eine ungewöhnlich große interne Arbeitslast streuen. Ob Architekturen wie Titans, MIRAS oder Nested Learning mit neuronalem Inferenz-Gedächtnis in der finalen Argon-Pipeline stecken, ist bislang nicht bestätigt.

Relevante Titel zum Thema

Für Alphabet ist Argon in erster Linie ein Hebel auf zwei Ebenen: wiederkehrende interne Einsparungen bei Infrastruktur und Training sowie ein Produkt, das gegen Claude, Codex und Microsofts Modelle kämpfen muss. Microsoft ist als Wettbewerber direkt betroffen, weil die Umfrage von JetBrains zeigt, wie stark OpenAI- und Anthropic-Werkzeuge die Entwicklergewohnheiten dominieren, gegen die Google mit Antigravity und Gemini ankämpft.

Aktienverlinkung: US02079K3059
Widget: key-figures

Relevante Titel zum Thema

Im Zusammenhang mit dem Anlass sind für Anleger vor allem diese Börsentitel von Interesse.

US02079K3059,US5949181045

Quellen & weiterführende Berichte

Loading...