Gemini 4 Argon debütiert mit 1-Million-Token-Ausgabe, 77,9 % bei DeepSWE und einem Preis von 2 $

Zusammenfassung der Neuigkeiten
Google kündigte Gemini 4 Argon am 30. September 2026 um 13:23 Uhr Pazifischer Zeit (16:23 Uhr US-Ostküstenzeit) an und präsentierte es als sein bisher leistungsstärkstes KI-Modell. Argon wurde für langfristige Aufgaben wie reale Softwareentwicklung, Rechts- und Finanzanalysen sowie Cyberabwehr entwickelt und ist das erste Flaggschiff-Release des Unternehmens seit dem Erscheinen der Gemini-3-Serie im November 2025. Der Zugang ist zunächst auf eine kleine Gruppe vertrauenswürdiger Partner beschränkt, eine breitere Einführung ist danach geplant.
Was Google angekündigt hat
Google beschreibt Gemini 4 Argon als den Beginn seiner „nächsten Ära der Spitzen-KI“. Das Modell richtet sich an Aufgaben, die sich über viele Schritte und lange Zeiträume erstrecken, wie etwa das Beheben von Fehlern in einer großen Codebasis, das Entwerfen eines detaillierten juristischen Dokuments oder das Recherchieren einer Finanzfrage aus vielen Quellen. Google hebt zudem ein verbessertes Verständnis für visuelles Material hervor, einschließlich langer Videos und komplexer Diagramme.
Die wichtigste technische Neuerung betrifft das Ausgabelimit. Argon kann bis zu 1 Million Token in einer einzigen Antwort generieren – gegenüber 64.000 bei früheren Gemini-Modellen. Dadurch lassen sich sehr lange Dokumente, umfangreiche Codeänderungen oder ausgedehnte Schlussfolgerungsketten erzeugen, ohne dass der Vorgang mittendrin abbricht.
Benchmark-Ergebnisse
Den veröffentlichten Zahlen zufolge führt Argon bei 13 der 18 in der Berichterstattung zum Launch erfassten Benchmarks oder teilt sich den Spitzenplatz. Zum Vergleich: GPT-6 Astra von OpenAI erreichte drei klare Spitzenplätze, Claude Opus 5.5 von Anthropic zwei.
Ausgewählte Ergebnisse umfassen:
- DeepSWE v1.1, ein Test für Softwareentwicklung: Argon erreichte 77,9 %, gegenüber 74,2 % für Claude Opus 5.5 und 74,1 % für GPT-6 Astra.
- AutomationBench: Argon erreichte 51,3 %, gegenüber 42,5 % für Claude Opus 5.5 und 41,4 % für GPT-6 Astra.
- Der Legal-Agent-Benchmark von Harvey: Argon erreichte 19,6 %, gegenüber 5,4 % für GPT-6 Astra und 3,8 % für Claude Opus 5.5.
- LVBench, ein Test zum Verständnis langer Videos: Argon erreichte 91,7 %, gegenüber 87,5 % für GPT-6 Astra und 83,7 % für Claude Opus 5.5.
Argon gewann jedoch nicht überall. GPT-6 Astra blieb bei FrontierSWE v2 (65,5 % gegenüber 55,0 %) und Terminal-Bench Science 0.1 (68,1 % gegenüber 57,6 %) vorn. Wie bei allen von Anbietern selbst gemeldeten Benchmarks werden unabhängige Tests zeigen, wie belastbar die Zahlen im Alltagseinsatz sind.
Fokus auf Cyberabwehr
Laut Google wurde Argon mit Blick auf defensive Sicherheit trainiert und kann schwerwiegende Softwareschwachstellen eigenständig finden, überprüfen und beheben. Aus diesem Grund erhalten zunächst ausgewählte vertrauenswürdige Cyberabwehr-Experten über das Fairwind-Programm Zugang, das Google Anfang September vorgestellt hatte. Die Idee dahinter ist, dass Sicherheitsteams Software absichern können, bevor das Modell einem breiten Publikum zugänglich wird.
Preise
Google hat einen Einführungspreis von 2 $ pro Million Eingabe-Token und 10 $ pro Million Ausgabe-Token festgelegt. Zwischengespeicherte Eingabe-Token kosten 0,10 $ pro Million – ein Rabatt von 95 % auf den regulären Eingabepreis. Zum Vergleich: Für GPT-6 Astra werden 10 $ bzw. 50 $ pro Million Eingabe- und Ausgabe-Token genannt.
Nach der Einführungsphase wird Argon voraussichtlich 4 $ pro Million Eingabe-Token und 20 $ pro Million Ausgabe-Token kosten, was den für Claude Opus 5.5 gemeldeten Basispreisen entspricht.
Verfügbarkeit und nächste Schritte
Argon ist noch nicht breit verfügbar. Laut Google nimmt das Modell zunächst an einem freiwilligen Prozess für Vorabzugang und Tests teil, bevor die Einführung ausgeweitet wird. Die breitere Freigabe soll voraussichtlich mit zahlenden API-Kunden und Abonnenten von Google AI Ultra beginnen.
Für Entwickler und Studierende sind vor allem das sehr große Ausgabefenster, der niedrige Einführungspreis und die Stärke des Modells bei langen, mehrstufigen Aufgaben entscheidend. Viele werden auf die allgemeine Verfügbarkeit und unabhängige Bewertungen warten, bevor sie entscheiden, ob sie darauf aufbauen möchten.