Grok 4.6 vs Grok 4.5, GPT-5.6 Sol & Fable 5: Was sich wirklich ändert
Eine ehrliche Einschätzung vor dem Launch, wo xAIs reines Post-Training-Upgrade realistisch gegenüber den Modellen landen kann, die es schlagen muss.

Grok 4.6 ist xAIs nächstes Flaggschiff – und die Besonderheit ist ungewöhnlich: Es behält Grok 4.5's genaue Grundlage bei und steckt das gesamte Upgrade ins Post-Training. Das macht einen „Grok 4.6 vs Grok 4.5 vs GPT-5.6 Sol vs Fable 5"-Vergleich schwierig – denn zum Zeitpunkt dieses Artikels gibt es für Grok 4.6 weder veröffentlichte Benchmarks noch eine Modellkarte oder Preisangaben. Dieser Leitfaden zieht eine klare Linie zwischen dem, was xAI bestätigt hat, und dem, was noch Spekulation ist, und zeigt dann die echte Benchmark-Hürde, die Grok 4.6 überwinden muss.
Der ehrliche Ausgangspunkt: Noch keine Grok 4.6-Zahlen
Vor jedem Vergleich der Vorbehalt, den die meisten Beiträge überspringen: Es gibt keine offiziellen Grok 4.6-Benchmarks. Anfang August 2026 hatte xAI weder eine Grok 4.6-Modellkarte noch eine Benchmark-Tabelle, keinen API-Bezeichner und keine Preisangaben veröffentlicht – die Entwicklerdokumentation listete Grok 4.5 noch als aktuelles Modell. Jede Leistungszahl, die derzeit Grok 4.6 zugeschrieben wird, ist eine Prognose, keine Messung.
Dieser Artikel macht daher etwas anderes als ein normaler Direktvergleich. Wir verankern uns an Grok 4.5's gemessenen Ergebnissen, behandeln GPT-5.6 Sol und Fable 5 als die Hürde, die Grok 4.6 überwinden muss, und kennzeichnen Erwartungen klar als Erwartungen. Die ersten echten Grok 4.6-Daten werden in der Woche nach dem Launch von unabhängigen Leaderboards kommen – dann erst sollte man urteilen.
Was Grok 4.6 tatsächlich ist (bestätigt)
Folgendes haben xAI und Elon Musk offiziell mitgeteilt:
- Gleiche Grundlage wie Grok 4.5. Grok 4.6 basiert auf demselben ~1,5-Billionen-Parameter-V9-Fundament; die Verbesserung stammt aus erweitertem Supervised Fine-Tuning (SFT) und Reinforcement Learning (RL) – nicht aus einem größeren Modell. Frühe Berichte, die von einem 2-Billionen-Parameter-Modell sprachen, wurden später korrigiert; die 2,1T-Basis gehört zum Nachfolger Grok 4.7.
- Ein Verfeinerungsrelease, kein neues Basismodell. Das Ziel ist besseres Instruction-Following, saubererer Code und stabileres Reasoning auf demselben schnellen, kostengünstigen Fundament.
- Ein kurzfristiger, gestaffelter Launch. Musk bezeichnete Grok 4.6 Anfang August 2026 als wenige Tage bis eine Woche entfernt, mit Grok 4.7 (die größere 2,1T-Basis) einige Wochen dahinter. xAIs Termine sind bekanntermaßen ungefähr – jedes konkrete Datum sollte als Zielmarke verstanden werden.
Alles andere – genaue Benchmark-Werte, API-Preis, Änderungen am Kontextfenster – ist bis zum Launch unbestätigt.
Die Post-Training-Wette und warum sie wichtig ist
Die meisten Frontier-Releases setzen auf eine größere Basis mit mehr Parametern. xAI hält die Basis konstant und steckt den gesamten Gewinn ins Post-Training. Das macht Grok 4.6 zu einem sauberen Test einer echten Frage in der KI-Welt: Wie viel besser kann ein Modell werden, ohne zu wachsen? Ein neues 2T+-Fundament ist langsam und teuer zu trainieren, während ein Post-Training-Durchlauf schneller ausgeliefert werden kann – xAI kann 4.6 jetzt auf der bewährten Basis veröffentlichen und später mit dem schwereren 4.7 nachziehen. Wenn 4.6 auf identischem Fundament einen bedeutenden Sprung gegenüber 4.5 zeigt, ist das ein Signal für das gesamte Feld, nicht nur für xAI. (Einordnung nach Build Fast with AI's Grok 4.6 Vorschau.)
Die Grok 4.5-Baseline (das ist der echte Anker)
Da Grok 4.6 Grok 4.5 verfeinert, sind die 4.5-Zahlen die ehrliche Ausgangslinie. Grok 4.5 wurde am 8. Juli 2026 mit einer bewusst gemischten, aber starken Geschichte gelauncht:
- Coding Agents: ~76 auf dem Artificial Analysis Coding Agent Index – ungefähr gleichauf mit GPT-5.5 in Codex und etwa einen Punkt hinter Fable 5. (sentisight.ai)
- Terminal-Bench 2.1: ~83,3 %, innerhalb eines Punktes von Fable 5 und GPT-5.5, und vor Opus 4.8. (sentisight.ai)
- SWE Marathon: eine führende ~29 % Single-Attempt-Lösungsrate, über Opus 4.8's 26 %. (kucoin.com)
- SWE-Bench Pro: ~64,7 % – das schwächste Ergebnis, deutlich hinter Fable 5's ~80,4 %. (sentisight.ai)
- Intelligence Index: ~54, ein großer Sprung gegenüber Grok 4.3, aber hinter Fable 5 (~60), Opus 4.8 (~56) und GPT-5.5 (~55). (kingy.ai)
Der rote Faden: Grok 4.5 ist ein nahezu frontier-fähiges, ungewöhnlich effizientes Arbeitstier, zu einem Preis von rund $2 / $6 pro Million Input-/Output-Token – der Preis-Leistungs-Marktführer – aber kein klarer Benchmark-Sieger, und merklich schwächer bei den schwierigsten Long-Horizon-Coding-Tests. Das ist die Plattform, die Grok 4.6 verbessern soll.
Die Hürde: GPT-5.6 Sol und Fable 5
Diese beiden sind die Frontier, an der Grok 4.6 gemessen wird. Ihre Zahlen sind real.
Claude Fable 5 (Anthropic, veröffentlicht am 9. Juni 2026) ist ein „Mythos-class"-Modell, das eine Stufe über Opus 4.8 positioniert ist. Es erzielt ~62 auf dem Artificial Analysis Intelligence Index und ist genau dort am stärksten, wo Grok 4.5 am schwächsten ist – ~80,4 % auf SWE-Bench Pro. Es ist mit $10 / $50 pro Million Token auch teuer und etwas weitschweifig. (artificialanalysis.ai, anthropic.com)
GPT-5.6 Sol (OpenAI, veröffentlicht am 9. Juli 2026) ist das Flaggschiff der Sol/Terra/Luna-Familie mit maximalem Reasoning-Aufwand und einem Multi-Agent-„Ultra"-Modus. Bei maximalem Reasoning setzt es mit ~80 auf dem Artificial Analysis Coding Agent Index einen State-of-the-Art-Wert – etwa 2,8 Punkte über Fable 5 – während OpenAI berichtet, weniger als die Hälfte der Output-Token und weniger als die Hälfte der Zeit zu benötigen. Der Preis liegt bei $5 / $30 pro Million Token mit einem ~1,05M-Token-Kontextfenster. Es gewinnt jedoch nicht alles: Bei SWE-Bench Pro liegt es deutlich hinter Fable 5. (openai.com, artificialanalysis.ai)
Die Schlussfolgerung für Grok 4.6: Die Frontier hat sich nach dem Launch von Grok 4.5 verschoben. Grok 4.5's Effizienz zu erreichen ist das Mindeste; die Lücke bei SWE-Bench Pro-artigen Tests gegenüber Fable 5 und GPT-5.6 Sol zu schließen ist die eigentliche Herausforderung.
Grok 4.6 vs. das Feld: Wo es realistisch landen kann
Da 4.6 ein Post-Training-Durchlauf auf der 4.5-Basis ist, folgt hier eine fundierte Einschätzung – Erwartungen sind klar als solche gekennzeichnet.
| Dimension | Grok 4.5 (gemessen) | GPT-5.6 Sol max (gemessen) | Fable 5 (gemessen) | Grok 4.6 (erwartet) |
|---|---|---|---|---|
| Basis | ~1,5T V9 | nicht offengelegt | Mythos-class | ~1,5T V9 (wie 4.5) |
| Coding Agent Index | ~76 | ~80 (SOTA) | ~79 | Wahrscheinlich leichte Verbesserung; unbewiesen |
| SWE-Bench Pro | ~64,7 % | hinter Fable 5 | ~80,4 % | Post-Training könnte die Lücke verringern |
| Intelligence Index | ~54 | ~61 | ~62 | Moderater Gewinn, kein Sprung |
| Token-Effizienz | Klassenführend | Stark | Weitschweifig | Wahrscheinlich weiterhin eine Stärke |
| API-Preis (ein/aus pro 1M) | ~$2 / $6 | $5 / $30 | $10 / $50 | Nicht angekündigt; 4.5 als Referenz |
Was realistisch zu erwarten ist: besseres Instruction-Following, saubererer Code und stabileres Reasoning auf demselben schnellen, kostengünstigen Fundament – kein Sprung in der rohen Modellgröße und kein plötzlicher Durchbruch über Fable 5 bei den härtesten Evals. Wenn xAI die aggressive $2 / $6-Preisgestaltung beibehält, bleibt Grok 4.6's stärkstes Argument Intelligenz pro Dollar, nicht eine Spitzenposition in Benchmark-Rankings. Die Arena- und Artificial Analysis-Werte in der Woche nach dem Launch sind der erste echte Test, ob die Post-Training-Gewinne der Ankündigung entsprechen.
Sollte man auf Grok 4.6 warten?
- Kein Grok-Nutzer, Entscheidung diese Woche? Arbeit nicht pausieren. Grok 4.6 ist eine Verfeinerung eines bereits verfügbaren Modells, keine neue Fähigkeitsklasse – jetzt das beste bewährte Modell für die jeweilige Aufgabe nutzen und neu bewerten, sobald echte Benchmarks vorliegen.
- Bereits bei SuperGrok oder X Premium? Es sollte automatisch in der Modellauswahl erscheinen, ohne zusätzliche Kosten – es gibt nichts zu tun, außer abzuwarten.
- Das stärkste xAI-Modell gewünscht? Das relevantere Datum ist das Grok 4.7-Fenster (die größere 2,1T-Basis) einige Wochen später, nicht der 4.6-Launch.
Der vernünftige Schritt für alle anderen: Das Modell ausliefern lassen, unabhängige Bewertungen abwarten und Grok 4.6 anhand gemessener Ergebnisse beurteilen – nicht anhand der Ankündigungen vor dem Launch.
Diese Modelle als KI-Teammitglied einsetzen
Benchmarks sind eine Sache; ein Modell dazu zu bringen, tatsächlich ein Repository zu prüfen, Befehle auszuführen, einen PR zu reviewen und zu iterieren, ist eine andere. Eigent ist eine Open-Source-„Cowork"-Desktop-App, die Modelle wie Grok, GPT-5.6 Sol und Claude in eine lokale Multi-Agent-Belegschaft verwandelt – eigene API-Keys mitbringen und das Modell hinter jedem Agenten austauschen, wenn sich die Frontier verschiebt. Wer mit Code arbeitet, kann sehen, wie ein Team von Agenten GitHub PRs reviewt, oder eigene Agenten durch Herunterladen von Eigent starten. Für mehr zu xAIs Coding-Stack bieten unsere Artikel über Grok Bot KI-Teammitglieder und Grok Bot vs. ChatGPT Work einen Einblick, was diese Modelle leisten, sobald sie den Benchmark-Tisch verlassen.
Recent Posts

Grok 4.6 Fähigkeiten und reale Anwendungsfälle für KI-Agenten
Ein praxisnaher Blick auf Grok 4.6 Fähigkeiten und Anwendungsfälle: langlebige Agenten, Coding und visuelle Arbeit – plus wie man es in einer Multi-Agenten-KI-Belegschaft einsetzt.

Grok Bot: SpaceXAIs KI-Teammitglieder, die echte Arbeit leisten
Grok Bot ist der neue KI-Agent von SpaceXAI und Cursor – Teammitglieder, die sich in Ihre Tools einloggen und echte Aufgaben erledigen. Was er kann, wer ihn nutzen kann und wie er im Vergleich abschneidet.

Grok Bot vs. ChatGPT Work: Welche agentische KI-Belegschaft gewinnt?
Grok Bot vs. ChatGPT Work im Vergleich: Computer-Use-Agenten vs. Ausführungsmodus, Autonomie, Konnektoren, Preisgestaltung und welche agentische KI-Belegschaft zu Ihrem Team passt.