logo
  • Umgebungen
  • Enterprise
  • Preise
Blogs
Jul 31, 2026

DeepSeek V4 Flash offiziell: Agent-Benchmarks übertreffen V4 Pro Preview

Gleiche Architektur, gleicher Preis, neu trainierte Gewichte — das günstige Modell übertrifft jetzt das Preview-Flaggschiff im Agentenbereich, mit nativer Responses API und Codex-Unterstützung

EigentEigent
Share to
DeepSeek V4 Flash offiziell: Agent-Benchmarks übertreffen V4 Pro Preview
  • Was sich tatsächlich geändert hat
  • Die Benchmark-Zahlen
  • Warum „Gleiche Größe, besserer Agent" wichtig ist
  • Responses API und Codex-Unterstützung
  • Was das für Ihren Stack bedeutet
  • Tun Sie dies mit Ihrer eigenen KI-Belegschaft
  • Häufig gestellte Fragen
Automate Everything with
AI Workforce on Desktop
Download Eigent

DeepSeek hat die offizielle Version seiner V4 Flash API in die öffentliche Beta überführt — und die Schlagzeile ist kein neues Modell, sondern ein Retraining. Der Build, gekennzeichnet als DeepSeek-V4-Flash-0731, behält exakt dieselbe Architektur, Größe und denselben Preis wie die Preview-Version, aber seine Agent-Benchmark-Werte übertreffen nun deutlich V4-Pro-Preview, das größere und teurere Modell derselben Familie. Außerdem wird native Responses API-Unterstützung hinzugefügt und es ist für Codex angepasst. Wenn Sie bereits deepseek-v4-flash aufrufen, wurde das Modell hinter Ihrer API kostenlos dramatisch verbessert.

Was sich tatsächlich geändert hat

Laut dem offiziellen API-Changelog von DeepSeek befindet sich die offizielle V4 Flash API nun in der öffentlichen Beta, und die Aufrufmethode ist unverändert — Sie setzen den Modellnamen auf deepseek-v4-flash, genau wie während der Preview. (DeepSeek-Changelog)

Drei Fakten definieren dieses Release:

  • Es ist ein Retraining, kein neues Modell. DeepSeek gibt an, dass V4-Flash-0731 dieselbe Architektur und Größe wie V4-Flash-Preview beibehält und lediglich neu post-trainiert wurde. Neue Gewichte auf demselben Grundgerüst — weshalb die Integration ein Drop-in-Wechsel ist. (DeepSeek-Changelog)
  • Die Agent-Zahlen sind die eigentliche Geschichte. DeepSeek beschreibt „deutlich verbesserte Agent-Fähigkeiten" mit Benchmark-Ergebnissen, die V4-Pro-Preview weit übertreffen. Das Upgrade zielt auf autonome Ausführung und Tool-Calling bei komplexen Aufgaben ab. (DeepSeek-Changelog)
  • Dies ist vorerst nur für die API. Das Upgrade gilt ausschließlich für die V4 Flash API. Die V4 Pro API sowie die Modelle in DeepSeeks App und auf der Website bleiben unverändert; DeepSeek kündigt an, dass das offizielle V4 Pro Release bald folgen wird. (DeepSeek-Changelog)

Das strategische Signal sticht hervor. Für den Großteil der V4-Generation war die Hierarchie einfach: Pro ist leistungsstark, Flash ist günstig und schwächer. Dieses Retraining kehrt diese Geschichte für agentische Workloads um — das leichtgewichtige Modell erzielt nun Werte über dem Preview-Flaggschiff. (TechNode)

Die Benchmark-Zahlen

DeepSeek hat mit dem 0731-Build eine vollständige Benchmark-Tabelle veröffentlicht. Dies sind die offiziell selbst gemeldeten Werte aus dem Changelog:

BenchmarkV4-Flash-0731
Terminal Bench 2.182,7
NL2Repo54,2
Cybergym76,7
DeepSWE54,4
Toolathlon (verifiziert)70,3
Agent Last Exam25,2
Automation Bench (Public)25,1
DSBench-FullStack68,7
DSBench-Hard59,6

Quelle: DeepSeek API-Changelog. DSBench-FullStack und DSBench-Hard sind interne Testsets von DeepSeek — eine Full-Stack-Entwicklungssuite bzw. eine anspruchsvolle Coding-Agent-Suite.

Zwei Vorbehalte, bevor Sie die Aussage „übertrifft V4 Pro Preview" zu wörtlich nehmen:

  • Der Vergleich ist nicht vollständig gleichwertig. V4-Flash-0731 erzielt 82,7 auf Terminal Bench 2.1, während der in der Berichterstattung genannte V4-Pro-Preview-Wert (67,9) auf Terminal Bench 2.0 basiert — unterschiedliche Versionen des Testsets, sodass ein direkter Vergleich nicht vollständig fair ist. (36Kr)
  • Code-Agent-Aufgaben verwendeten ein spezifisches Harness. DeepSeek weist darauf hin, dass die öffentlichen Code-Agent-Benchmarks mit seinem „DeepSeek Harness Minimal Mode" (noch nicht veröffentlicht) bei maximaler Anstrengung, top-p 0,95, Temperatur 1,0 durchgeführt wurden. Ihre Produktionszahlen hängen von Ihrem eigenen Scaffolding ab. (DeepSeek-Changelog)

Dennoch ist das Ausmaß bemerkenswert: Ein Modell mit ungefähr 13B aktivierten Parametern, das Agent-Werte in diesem Bereich erzielt, zeigt, wie viel allein das Post-Training bewegen kann. (36Kr)

Warum „Gleiche Größe, besserer Agent" wichtig ist

V4 Flash ist ein 284B-Parameter-MoE mit ~13B aktiven Parametern, gegenüber V4 Pros 1,6T gesamt / ~49B aktiv. Beide teilen ein 1M-Token-Kontextfenster. Der eigentliche Zweck von Flash war Durchsatz und Kosten — man tauschte etwas Leistungsfähigkeit gegen Geschwindigkeit. (Für die vollständige Spezifikationsübersicht siehe unseren DeepSeek V4 Pro-Leitfaden.)

Indem DeepSeek die Agent-Leistung verbessert, ohne die Parameteranzahl zu ändern, zielt das Unternehmen genau auf den Schmerzpunkt, den die meisten Teams in der Produktion erleben: Sie wollen kostengünstige, hochgradig parallele Automatisierung, können es sich aber nicht leisten, ein 1,6T-Flaggschiff für jeden Agentenschritt zu betreiben. Ein günstigeres Modell, das Tool-Calling und mehrstufige Ausführung gut beherrscht, verändert die Wirtschaftlichkeit des Betriebs von Agenten im großen Maßstab. (BigGo Finance)

Für alle, die Agent-Pipelines aufbauen, lautet die praktische Schlussfolgerung eine Routing-Entscheidung: Mehr alltägliche Agentenschritte können nun standardmäßig auf Flash zurückgreifen, während die Eskalation zu einem schwereren Modell den wirklich schwierigen Verzweigungen vorbehalten bleibt.

Responses API und Codex-Unterstützung

Die andere Hälfte dieses Releases senkt die Integrationshürde. Das offizielle V4 Flash unterstützt nativ das Responses-API-Format und ist speziell für Codex angepasst. (DeepSeek-Changelog)

Das ist wichtig, weil die Responses API das Format ist, das OpenAIs neuere agentische Werkzeuge — einschließlich Codex — erwarten. Native Unterstützung bedeutet, dass Teams, die bereits in einen Codex-ähnlichen Workflow eingebunden sind, diesen mit Konfigurationsänderungen statt einer Neuentwicklung auf deepseek-v4-flash umstellen können. DeepSeek gibt an, das Ziel sei es, die Hürde für die Entwicklerakzeptanz zu senken; die Konfigurationsdetails finden sich in der API-Dokumentation. (BigGo Finance)

In Kombination mit der Tatsache, dass die V4 API bereits über OpenAI-ähnliche ChatCompletions und Anthropic-ähnliche Schnittstellen erreichbar ist, optimiert DeepSeek klar auf Drop-in-Kompatibilität über die wichtigsten Agent-Ökosysteme hinweg. (DeepSeek-Changelog)

Was das für Ihren Stack bedeutet

Wenn Sie auf DeepSeek aufbauen, hier die Kurzfassung:

  • Bereits auf der Preview? Sie erhalten das Upgrade ohne Codeänderungen — gleicher Modellname, gleicher Preis, besseres Agent-Verhalten. Führen Sie Ihre Evaluierungen erneut durch, um zu bestätigen, dass die Verbesserung bei Ihren Aufgaben sichtbar wird, nicht nur bei den veröffentlichten Benchmarks.
  • Betreiben Sie Codex-ähnliche Workflows? V4 Flash ist dank nativer Responses-API-Unterstützung und Codex-Anpassung nun ein echter Kandidat als günstigeres Backend.
  • Warten auf V4 Pro? DeepSeek kündigt an, dass das offizielle Pro-Release bald kommt; dieses Flash-Retraining ist ein Vorgeschmack auf die Post-Training-Gewinne, die Sie dort wahrscheinlich ebenfalls sehen werden.
  • Behandeln Sie Anbieter-Benchmarks als Richtungswerte. Die Werte sind selbst gemeldet, einige Sets sind intern, und der Terminal-Bench-Versionsunterschied bedeutet, dass die Formulierung „übertrifft Pro Preview" einen Vorbehalt benötigt, bis unabhängige Evaluierungen vorliegen.

Tun Sie dies mit Ihrer eigenen KI-Belegschaft

Ein Modell, das günstiger und besser wird, ist genau der Grund, warum sich eine modell-agnostische Agent-Plattform auszahlt — Sie möchten das beste Modell für jeden Schritt einsetzen, ohne die Architektur neu zu gestalten. Eigent ist eine Open-Source-Multi-Agent-„Cowork"-Desktop-App, die spezialisierte Modelle über reale Workflows orchestriert, sodass Sie routinemäßige Agentenschritte an ein schnelles, günstiges Modell wie V4 Flash weiterleiten und schwierige Verzweigungen anderswo eskalieren können. Wenn Sie agentische Coding-Aufgaben verdrahten, sehen Sie, wie Eigent Workflows wie das Überprüfen von GitHub-PRs handhabt, oder laden Sie Eigent herunter, um Ihre eigene KI-Belegschaft lokal aufzubauen.

Häufig gestellte Fragen

Was ist DeepSeek V4 Flash?

DeepSeek V4 Flash ist die leichtgewichtige Variante der V4-Modellfamilie von DeepSeek — ein 284B-Parameter-Mixture-of-Experts-Modell mit ungefähr 13B aktiven Parametern und einem 1M-Token-Kontextfenster, optimiert für schnelle, kostengünstige und hochdurchsatzfähige Workloads. Die offizielle API (Build 0731) befindet sich nun in der öffentlichen Beta.

Was hat sich im offiziellen V4 Flash Release geändert?

Der 0731-Build behält dieselbe Architektur, Größe und denselben Preis wie die Preview-Version, wurde jedoch neu post-trainiert und liefert deutlich stärkere Agent-Benchmark-Werte. Außerdem wird native Responses-API-Unterstützung und Codex-Anpassung hinzugefügt. Die Aufrufmethode ist unverändert — Sie setzen den Modellnamen weiterhin auf deepseek-v4-flash.

Übertreffen V4 Flashs Benchmarks wirklich V4 Pro Preview?

DeepSeeks selbst gemeldete Agent-Werte übertreffen V4-Pro-Preview bei mehreren Benchmarks. Der Vergleich ist jedoch nicht vollständig gleichwertig — beispielsweise basiert der Flash-Wert auf Terminal Bench 2.1, während der genannte Pro-Preview-Wert auf Terminal Bench 2.0 basiert. Behandeln Sie die Zahlen als Richtungswerte, bis unabhängige Evaluierungen sie bestätigen.

Funktioniert V4 Flash mit Codex?

Ja. Das offizielle V4 Flash unterstützt nativ das Responses-API-Format und ist speziell für Codex angepasst, sodass Codex-ähnliche Workflows es mit Konfigurationsänderungen statt einer Neuentwicklung als Backend nutzen können.

Erhält V4 Pro dasselbe Upgrade?

Noch nicht. Dieses Update gilt ausschließlich für die V4 Flash API. Die V4 Pro API sowie DeepSeeks App- und Web-Modelle bleiben unverändert, obwohl DeepSeek ankündigt, dass das offizielle V4 Pro Release bald folgen wird.

Recent Posts

Grok Bot: SpaceXAIs KI-Teammitglieder, die echte Arbeit leisten
Aug 11, 2026

Grok Bot: SpaceXAIs KI-Teammitglieder, die echte Arbeit leisten

Grok Bot ist der neue KI-Agent von SpaceXAI und Cursor – Teammitglieder, die sich in Ihre Tools einloggen und echte Aufgaben erledigen. Was er kann, wer ihn nutzen kann und wie er im Vergleich abschneidet.

EigentEigent
Grok Bot vs. ChatGPT Work: Welche agentische KI-Belegschaft gewinnt?
Aug 11, 2026

Grok Bot vs. ChatGPT Work: Welche agentische KI-Belegschaft gewinnt?

Grok Bot vs. ChatGPT Work im Vergleich: Computer-Use-Agenten vs. Ausführungsmodus, Autonomie, Konnektoren, Preisgestaltung und welche agentische KI-Belegschaft zu Ihrem Team passt.

EigentEigent
Grok Bot vs Claude Cowork: Welcher KI-Mitarbeiter erledigt wirklich die Arbeit?
Aug 11, 2026

Grok Bot vs Claude Cowork: Welcher KI-Mitarbeiter erledigt wirklich die Arbeit?

Grok Bot vs Claude Cowork im Vergleich bei Computer-Use, persistentem Gedächtnis, Multi-Agenten-Teams, Preisgestaltung und Kontrolle — plus die Open-Source-Mitarbeiter-Option, die keiner von beiden bietet.

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

Teste Eigent noch heute

Lade die Open-Source-Desktop-App herunter. Deine KI-Belegschaft, die auf deinem Rechner läuft.

Eigent herunterladen
Eigent

Erhalte die neuesten Updates, Tutorials und Releases rund um die Automatisierung von KI-Belegschaften.

ProduktEigentUmgebungenPreiseUnternehmen
EntdeckenLösungenAnwendungsfälleFähigkeitenPluginsBlogs
EntwicklerDokuGitHubCAMEL-AIOpen Source FundPartner
HerunterladenFür Open Source
UnternehmenÜber unsMarkeKarriereNutzungsbedingungenDatenschutzerklärungSicherheit & VertrauenCookie-RichtlinieRückerstattungs- & Testrichtlinie

Alle Rechte vorbehalten © 2026 EIGENT UK LTD

Eigent 1.0 Neue Version veröffentlicht !download