Start / News / Google führt Gemini 4 Argon ein, während Mitarbeiter Carbon testen – einen Checkpoint, der laut einigen mit Opus 5.5 mithalten soll
Gemini 4

Google führt Gemini 4 Argon ein, während Mitarbeiter Carbon testen – einen Checkpoint, der laut einigen mit Opus 5.5 mithalten soll

10. Okt. 20264 Min. Lesezeit
Google führt Gemini 4 Argon ein, während Mitarbeiter Carbon testen – einen Checkpoint, der laut einigen mit Opus 5.5 mithalten soll

Zusammenfassung der Neuigkeiten

Google bereitet sich darauf vor, sein neues Gemini-4-Modell mit dem internen Codenamen Argon weiteren Nutzern zugänglich zu machen, während Mitarbeiter bereits einen neueren internen Checkpoint namens Carbon ausprobieren. Einige Tester bezeichnen ihn als deutlichen Fortschritt, insbesondere beim Programmieren. Die Details stammen aus einem Bericht von Business Insider, der auf internen Dokumenten und Mitarbeiter-Chats basiert und hier mit der Sekundärberichterstattung über diesen Bericht sowie mit verwandten Meldungen abgeglichen wurde. Der Originalartikel von Business Insider ließ sich nicht direkt öffnen, daher stammen einige der folgenden Angaben von Aggregatoren und sollten als Informationen aus zweiter Hand betrachtet werden.

Was Google angekündigt hat

Google hat Gemini 4 Argon am 30. September 2026 angekündigt. Die veröffentlichte Berichterstattung nennt das Datum, aber keine Uhrzeit, sodass kein zeitzonenspezifischer Zeitstempel angegeben werden kann. Der Zugang begann über ein Programm namens Fairwind bei ausgewählten Cybersicherheitsspezialisten. Als Nächstes dürften zahlende API-Kunden und Abonnenten von Google AI Ultra folgen, doch Google hat noch keinen Termin für eine breitere Verfügbarkeit veröffentlicht.

Google gibt zudem an, dass bereits Tausende eigener Mitarbeiter das Modell intern für spezielle Programmier-, Recherche- und Schreibaufgaben nutzen.

Was die Mitarbeiter testen

Laut dem Bericht von Business Insider, wie er von anderen Medien wiedergegeben wurde, haben Mitarbeiter eine neuere Version von Gemini 4 mit dem Spitznamen Carbon ausprobiert. Der Bericht beschreibt eine interne Namensgebung, die auch ein Modell namens Barium-B umfasst, welches angeblich ausgewählt wurde, um zum öffentlich als Argon bekannten Modell zu werden. Carbon scheint ein späterer Checkpoint derselben Gemini-4-Reihe zu sein und kein Ersatz für Argon.

Ein Tester sagte, Carbon fühle sich beim Programmieren „wie Opus 5.5“ an – bezogen auf Anthropics Claude Opus 5.5 –, fügte jedoch hinzu, dass weitere Tests nötig seien. Manche Berichte stellen Carbon so dar, als würde es durch Training im Stil rekursiver Selbstverbesserung an Opus 5.5 heranreichen; diese Darstellung stammt allerdings von Aggregatoren und wurde von Google nicht bestätigt.

Wie Argon bisher abgeschnitten hat

Frühe unabhängige Tests platzierten Argon mit 53 Punkten auf dem Artificial Analysis Intelligence Index auf demselben Niveau wie GPT-6 Astra von OpenAI. Claude Opus 5.5 führte diesen Index weiterhin mit 58 Punkten an. Berichten zufolge halluziniert Argon in diesen frühen Tests zudem deutlich weniger als vergleichbare Modelle.

Ein separater Bloomberg-Bericht, wie er in der Sekundärberichterstattung wiedergegeben wurde, besagte, dass einige Google-Mitarbeiter an der Leistungsfähigkeit von Argon in der Praxis zweifeln. Sie beschrieben starke Ergebnisse bei branchenüblichen Benchmarks, aber schwächere Resultate bei bestimmten Programmieraufgaben. Zwei Personen sagten, das Modell scheine von „Benchmaxxing“ betroffen zu sein, also davon, auf Testergebnisse statt auf alltägliche Nützlichkeit optimiert zu werden. Gegenüber Bloomberg erklärte Google, es sei unzutreffend zu behaupten, das Modell schneide in Bereichen wie dem Programmieren unterdurchschnittlich ab.

Was noch unklar ist

Google hat weder bestätigt, dass Carbon als Produkt existiert, noch ob es veröffentlicht wird oder unter welchem Namen. Es ist unklar, ob Carbon als Update unter dem Namen Argon oder als eigenständiges Modell der Gemini-4-Familie erscheinen würde. Für Carbon wurden keine unabhängigen Benchmarks veröffentlicht, daher bleiben die Kommentare interner Tester anekdotisch.

Warum das wichtig ist

Veröffentlichungen von Frontier-Modellen erfolgen heute über gestaffelte Checkpoints mit internen Codenamen, begrenztem Frühzugang und schnellen Iterationen. Die Kluft zwischen Benchmark-Ergebnissen und praktischem Nutzen, besonders beim Programmieren, wird zunehmend zum entscheidenden Kriterium, nach dem Entwickler neue Modelle beurteilen. Leser sollten die Eindrücke interner Tester als frühe Signale und nicht als verifizierte Leistungsdaten betrachten, bis unabhängige Bewertungen von Carbon vorliegen.

Dieser Artikel wurde von der AIBARS-Redaktion mit KI-Unterstützung zusammengestellt. KI kann Fehler machen, prüfe wichtige Angaben daher an der Originalquelle. Fehler entdeckt? Schreibe an [email protected].

Gemini 4Google KI