Gemini 4 Argon: Was ist neu, Benchmarks und Preise
Googles neues Frontier-Modell ist für lange, mehrstufige Aufgaben in den Bereichen Coding, Recht, Finanzen und Cybersicherheit entwickelt — hier ist, was sich wirklich geändert hat.

Google hat soeben Gemini 4 Argon angekündigt, sein neues Frontier-Modell, das für tiefes Reasoning über lange, mehrstufige Workflows ausgelegt ist. Das Versprechen: Frontier-Leistung bei realen Software-Engineering-Aufgaben, Enterprise-Wissensarbeit wie Recht und Finanzen sowie Cybersicherheits-Abwehr — also genau die Aufgaben, die einen Agenten viele Schritte kosten, nicht nur einen einzigen Prompt. Dieser Leitfaden behandelt die Neuerungen, die von Google veröffentlichten Benchmarks, die Kosten, den Sprung auf ein 1M Output-Token-Limit und wer zuerst Zugang erhält.
Was ist Gemini 4 Argon?
Gemini 4 Argon ist Googles neuestes Frontier-Modell, positioniert als „nächste Ära der Frontier-Intelligenz". Google beschreibt es als ein Modell, das tiefes Reasoning über komplexe, langfristige Workflows aufrechterhalten kann und dabei Frontier-Leistung in realem Software-Engineering, Enterprise-Wissensarbeit wie Recht und Finanzen sowie Cybersicherheits-Abwehr liefert (Google).
Die Ankündigung erfolgte am 30. September 2026. Anders als bei einem typischen Modell-Launch ist Argon am ersten Tag nicht allgemein verfügbar — Google rollt es zunächst für eine Gruppe vertrauenswürdiger Cyber-Verteidiger über sein Fairwind-Programm aus und weitet den Zugang dann auf Entwickler, Unternehmen und Verbraucher aus, sobald die Sicherheitsmechanismen gefestigt sind (Google).
Was ist neu in Gemini 4 Argon
Die wichtigste Neuerung für Entwickler ist die Fähigkeit, in einem einzigen Durchlauf länger zu denken.
- 1M Output-Token-Limit. Google hat das Output-Token-Limit des Modells deutlich auf branchenführende 1M Token erweitert, gegenüber zuvor 64K. Die Aussage: Wenn das Modell genug Spielraum hat, um in einer einzigen Trajektorie Hunderttausende von Token zu generieren, kann es eine neue Tiefe im Reasoning erreichen und schwierige Probleme in einem Durchgang lösen (Google).
- Fokus auf langfristige Aufgaben. Argon ist für Aufgaben optimiert, die Planung, Werkzeugnutzung und Konzentration über viele Schritte erfordern — von alltäglichem Debugging bis hin zu umfangreichen Codebase-Migrationen.
- Multimodale Wissensarbeit. Google hebt die Stärke des Modells hervor, wenn die Aufgabe visuelles Verständnis erfordert — professionelle Diagrammanalyse, das Extrahieren von Details aus langen Videos und das Arbeiten über eine Reihe von Dokumenten hinweg.
Zum Vergleich: Dies ist ein größeres Release als Googles jüngtes Gemini 3.8 Flash-Update: Argon ist ein Frontier-Modell, das auf die schwierigsten und längsten Aufgaben ausgerichtet ist, nicht auf kosteneffiziente Hochvolumenarbeit.
Gemini 4 Argon Benchmarks
Alle nachfolgenden Zahlen stammen aus Googles Launch-Materialien und sollten daher als herstellerberichtete Benchmarks und nicht als unabhängige Tests betrachtet werden (Google).
- DeepSWE v1.1 (langfristiges Software-Engineering): 77,9 %, was Google als neuen Stand der Technik für reale, langfristige Engineering-Aufgaben bezeichnet.
- Vals Index: Argon ist das führende Modell in diesem Index, der den wirtschaftlichen Einfluss in den Bereichen Finanzen, Coding, Recht und Steuern misst, gewichtet nach dem Beitrag jedes Sektors zum US-BIP.
- AutomationBench (Zapier): Platz 1 mit einem Score von 51,3 %, der die End-to-End-Ausführung über zentrale Geschäftsfunktionen hinweg misst.
- LVBench (Verständnis langer Videos): 91,7 %, was Google als Stand der Technik anführt.
- CWE-bench v1 (Schwachstellenbehebung): Geteilter erster Platz mit einem Spitzenwert von 68 %.
Google teilte außerdem interne Ergebnisse mit: Argon habe Quantenforschern geholfen, eine veröffentlichte Baseline in wenigen Minuten um 40 % zu übertreffen, und Argon-Agenten hätten einen Rust-Video-Decoder (für libgav1) entwickelt, der 2,7-mal schneller läuft als ein bestehender Rust-Port bei identischer Ausgabe. Diese Angaben sind als illustrative interne Beispiele zu verstehen, nicht als reproduzierbare Benchmarks.
Gemini 4 Argon Preise
Google hat einen Einführungspreis festgelegt:
- 2 $ pro Million Input-Token
- 10 $ pro Million Output-Token
- Gecachte Input-Token werden mit 95 % Rabatt auf den Input-Token-Preis berechnet
Nach dem Einführungszeitraum steigt der Standardpreis auf 4 $ pro Million Input-Token und 20 $ pro Million Output-Token (Google). Wer mit Argon plant, sollte beachten: Das 1M-Output-Limit kombiniert mit dem Frontier-Output-Preis kann bei langen, token-intensiven Trajektorien schnell teuer werden — kalkulieren Sie vor allem die Output-Kosten ein.
Führend in der defensiven Cybersicherheit
Cybersicherheit steht im Mittelpunkt dieses Launches. Google hat Argon darauf trainiert, besonders leistungsfähig in der Abwehr zu sein: Es kann kritische Software-Schwachstellen autonom finden, validieren und beheben. Für vertrauenswürdige Verteidiger und Googles eigene interne Teams will Google Argon ohne Cyber-Sicherheitsbeschränkungen bereitstellen, damit sie seine vollen Frontier-Fähigkeiten zur Verteidigung nutzen können (Google).
Ein frühes Beispiel, das Google anführt: Der Sicherheitsanbieter Wiz entdeckte mithilfe von Argon über seine „Scan for Good"-Initiative eine kritische Schwachstelle, die sensible personenbezogene Daten in weltweit von Krankenhäusern genutzter Gesundheitssoftware offenlegte — ein schwerwiegendes Risiko, das frühere Frontier-Modelle laut Google übersehen hatten.
Dies baut auf der Cyber-Ausrichtung auf, die Google mit seiner Gemini 3.8 Flash Cyber-Variante begonnen hat, und erweitert die autonome Schwachstellenerkennung und -behebung auf ein Frontier-Modell.
Sicherheit und der schrittweise Rollout
Da Argon Frontier-Fähigkeiten — einschließlich Cyber — mitbringt, schränkt Google den Zugang ein und stärkt die Sicherheitsmechanismen vor einer breiten Veröffentlichung. Das Unternehmen erklärt:
- Es beteiligt sich am freiwilligen Prozess der US-Regierung für den Vorab-Zugang zu Modellen.
- Es lehnt schädliche Cyber- und CBRN-Anfragen gemäß seinem Frontier Safety Framework ab und bewahrt dabei legitime Dual-Use-Forschung.
- Es stärkt den Schutz gegen indirektes Prompt Injection, bei dem bösartige Anweisungen im Kontext versuchen, das Modell zu übernehmen — Google behauptet, führende Robustheit im Gray Swan Indirect Prompt Injection Benchmark zu erreichen.
- Es überwacht die Chain-of-Thought und die Aktionen von Argon, um Fehlausrichtungen zu erkennen und die Ausführung bei Bedarf zu stoppen (Google).
Wer erhält Gemini 4 Argon und wann
Der Zugang erfolgt stufenweise:
- Jetzt: Vertrauenswürdige Cyber-Verteidiger über das Fairwind-Programm sowie Googles interne Teams.
- Als nächstes: Entwickler, Unternehmen und Verbraucher, beginnend mit zahlenden API-Kunden und Google AI Ultra-Abonnenten.
Kurz gesagt: Argon ist noch kein allgemein verfügbares Release. Wer Agenten entwickelt, sollte es einplanen, aber noch nicht damit prototypisieren — und auf die Öffnung der kostenpflichtigen API warten.
Ist das relevant, wenn Sie Agenten entwickeln?
Argons Design — lange Trajektorien, intensiver Werkzeugeinsatz und ein 1M-Output-Limit — passt direkt zu agentischen Workloads: Codebase-Migrationen, mehrstufige Finanz- oder Rechtsrecherchen und Sicherheitsbehebungen, die viele Dateien umfassen. Die offenen Fragen sind die Kosten bei Frontier-Output-Preisen und wann das Modell außerhalb von Fairwind tatsächlich aufrufbar ist. Bis dahin bleibt das neuere Gemini 3.8 Flash die zugängliche Option für hochvolumige Agenten-Schleifen.
Nutzen Sie das mit Ihrer eigenen KI-Belegschaft
Frontier-Modelle wie Gemini 4 Argon sind nur dann nützlich, wenn etwas sie in echte, mehrstufige Arbeit orchestriert — Planung, Werkzeugaufrufe und die vollständige Erledigung einer Aufgabe von Anfang bis Ende. Eigent ist eine Open-Source-„Cowork"-Desktop-App: eine Multi-Agenten-Belegschaft, die lokal läuft, sodass Sie leistungsfähige Modelle auf Coding-, Recherche- und Dokumenten-Workflows ansetzen können, während Ihre Daten auf Ihrem Rechner bleiben. Sehen Sie, wie eine Agenten-Belegschaft das Überprüfen von GitHub-PRs übernimmt, oder lesen Sie unsere Analyse von Gemini 3.8 Flash für Coding und Agenten. Laden Sie Eigent herunter und bauen Sie Ihre eigene KI-Belegschaft auf.
Recent Posts

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews
Eigent v1.0.5 improves Session recovery, task queues, process and file previews, Space settings, and model support.

Claude Opus 5.5: Neuerungen, Benchmarks und Preise
Claude Opus 5.5 erklärt: das erste Claude-5.5-Modell, 40 % günstiger als Opus 5, 30 % schnellere Ausgabe, neue agentenbasierte Coding-Benchmarks, Preise und Safety.

GPT-6 Sol und Luna: OpenAIs günstigere Coding- und Agentic-Modelle
GPT-6 Sol und Luna erweitern OpenAIs GPT-6-Familie unterhalb von Astra mit deutlichen Preissenkungen und verbessertem Coding. Hier sind die Änderungen, die Benchmarks und wann man welches Modell einsetzt.