logo
  • Ambientes
  • Empresas
  • Preços
Blogs
Jul 31, 2026

DeepSeek V4 Flash Oficial: Benchmarks de Agentes que Superam o V4 Pro Preview

Mesma arquitetura, mesmo preço, pesos retreinados — o modelo econômico agora supera o flagship preview em tarefas de agentes, com suporte nativo à Responses API e ao Codex

EigentEigent
Share to
DeepSeek V4 Flash Oficial: Benchmarks de Agentes que Superam o V4 Pro Preview
  • O Que Realmente Mudou
  • Os Números dos Benchmarks
  • Por Que "Mesmo Tamanho, Agente Melhor" Importa
  • Suporte à Responses API e ao Codex
  • O Que Isso Significa para Sua Stack
  • Faça Isso com Sua Própria Força de Trabalho de IA
  • Perguntas Frequentes
Automate Everything with
AI Workforce on Desktop
Download Eigent

A DeepSeek acaba de lançar a versão oficial de sua API V4 Flash em beta público — e o destaque não é um modelo novo, mas sim um retreinamento. A build, identificada como DeepSeek-V4-Flash-0731, mantém exatamente a mesma arquitetura, tamanho e preço do preview, mas seus benchmarks de agentes agora superam em muito o V4-Pro-Preview, o modelo maior e mais caro da mesma família. Ela também adiciona suporte nativo à Responses API e é adaptada para o Codex. Se você já chama deepseek-v4-flash, o modelo por trás da sua API acaba de melhorar drasticamente sem custo adicional.

O Que Realmente Mudou

Conforme o changelog oficial da API da DeepSeek, a API oficial do V4 Flash está agora em beta público, e o método de chamada permanece inalterado — você define o nome do modelo como deepseek-v4-flash exatamente como fazia durante o preview. (Changelog da DeepSeek)

Três fatos definem este lançamento:

  • É um retreinamento, não um modelo novo. A DeepSeek afirma que o V4-Flash-0731 mantém a mesma arquitetura e tamanho do V4-Flash-Preview e passou apenas por um novo pós-treinamento. Novos pesos na mesma estrutura — por isso a integração é uma substituição direta. (Changelog da DeepSeek)
  • Os números de agentes são o ponto central. A DeepSeek descreve "capacidades de agentes significativamente aprimoradas", com resultados de benchmark muito superiores ao V4-Pro-Preview. A atualização tem como alvo a execução autônoma e a chamada de ferramentas em tarefas complexas. (Changelog da DeepSeek)
  • Por enquanto, apenas via API. A atualização se aplica somente à API do V4 Flash. A API do V4 Pro e os modelos no aplicativo e no site da DeepSeek permanecem inalterados, e a DeepSeek afirma que o lançamento oficial do V4 Pro virá em breve. (Changelog da DeepSeek)

O sinal estratégico é o que mais chama atenção. Durante a maior parte da geração V4, a hierarquia era simples: Pro é poderoso, Flash é barato e mais fraco. Este retreinamento inverte essa narrativa para cargas de trabalho agênticas — o modelo leve agora registra números acima do flagship preview. (TechNode)

Os Números dos Benchmarks

A DeepSeek publicou uma tabela completa de benchmarks com a build 0731. Estes são os scores oficiais autodeclarados do changelog:

BenchmarkV4-Flash-0731
Terminal Bench 2.182,7
NL2Repo54,2
Cybergym76,7
DeepSWE54,4
Toolathlon (verificado)70,3
Agent Last Exam25,2
Automation Bench (Público)25,1
DSBench-FullStack68,7
DSBench-Hard59,6

Fonte: Changelog da API DeepSeek. DSBench-FullStack e DSBench-Hard são conjuntos de testes internos da DeepSeek — um conjunto de desenvolvimento full-stack e um conjunto de agentes de codificação avançada, respectivamente.

Duas ressalvas antes de interpretar demais a afirmação de "supera o V4 Pro Preview":

  • A comparação não é perfeitamente equivalente. O V4-Flash-0731 pontua 82,7 no Terminal Bench 2.1, enquanto o número do V4-Pro-Preview citado na cobertura (67,9) é no Terminal Bench 2.0 — versões diferentes do conjunto de testes, portanto a comparação direta não é totalmente justa. (36Kr)
  • As tarefas de Code Agent usaram um harness específico. A DeepSeek observa que os benchmarks públicos de Code Agent foram executados usando seu "DeepSeek Harness minimal mode" (ainda não lançado) com esforço máximo, top-p 0,95, temperatura 1,0. Seus números em produção dependem do seu próprio scaffolding. (Changelog da DeepSeek)

Ainda assim, a magnitude é notável: um modelo com aproximadamente 13B de parâmetros ativos alcançando scores de agentes nessa faixa demonstra o quanto o pós-treinamento sozinho pode mover o ponteiro. (36Kr)

Por Que "Mesmo Tamanho, Agente Melhor" Importa

O V4 Flash é um MoE (Mixture-of-Experts) de 284B parâmetros com ~13B parâmetros ativos, em comparação com o V4 Pro, que tem 1,6T no total / ~49B ativos. Ambos compartilham uma janela de contexto de 1M de tokens. O objetivo do Flash sempre foi throughput e custo — você trocava alguma capacidade por velocidade. (Para o detalhamento completo das especificações, veja nosso guia do DeepSeek V4 Pro.)

Ao elevar o desempenho de agentes sem alterar a contagem de parâmetros, a DeepSeek está mirando exatamente no ponto de dor que a maioria das equipes enfrenta em produção: elas querem automação de baixo custo e alta concorrência, mas não podem executar um flagship de 1,6T em cada etapa do agente. Um modelo mais barato que lida bem com chamadas de ferramentas e execução em múltiplas etapas muda a economia de rodar agentes em escala. (BigGo Finance)

Para quem constrói pipelines de agentes, a conclusão prática é de roteamento: mais das suas etapas cotidianas de agentes podem agora usar o Flash por padrão, com escalada para um modelo mais pesado reservada para os ramos genuinamente difíceis.

Suporte à Responses API e ao Codex

A outra metade deste lançamento reduz a barreira de integração. O V4 Flash oficial suporta nativamente o formato da Responses API e é especificamente adaptado para o Codex. (Changelog da DeepSeek)

Isso importa porque a Responses API é o formato que as ferramentas agênticas mais recentes da OpenAI — incluindo o Codex — esperam. O suporte nativo significa que equipes já integradas a um fluxo de trabalho no estilo Codex podem apontá-lo para deepseek-v4-flash com mudanças de configuração, em vez de uma reescrita completa. A DeepSeek afirma que o objetivo é reduzir a barreira para adoção por desenvolvedores, e os detalhes de configuração estão na documentação da API. (BigGo Finance)

Combinado com o fato de que a API V4 já é acessível tanto por interfaces no estilo ChatCompletions da OpenAI quanto no estilo Anthropic, a DeepSeek está claramente otimizando para compatibilidade de substituição direta nos principais ecossistemas de agentes. (Changelog da DeepSeek)

O Que Isso Significa para Sua Stack

Se você desenvolve com DeepSeek, aqui está o resumo:

  • Já está no preview? Você recebe a atualização sem nenhuma mudança de código — mesmo nome de modelo, mesmo preço, comportamento de agente melhorado. Reexecute suas avaliações para confirmar que a melhoria aparece nas suas tarefas, não apenas nos benchmarks publicados.
  • Rodando fluxos de trabalho no estilo Codex? O V4 Flash agora é um candidato genuíno como backend mais barato, graças ao suporte nativo à Responses API e à adaptação ao Codex.
  • Aguardando o V4 Pro? A DeepSeek afirma que o lançamento oficial do Pro está chegando em breve; este retreinamento do Flash é uma prévia dos ganhos de pós-treinamento que você provavelmente verá lá também.
  • Trate os benchmarks dos fornecedores como indicativos. Os scores são autodeclarados, alguns conjuntos são internos, e a incompatibilidade de versão do Terminal Bench significa que o enquadramento "supera o Pro Preview" precisa de um asterisco até que avaliações independentes confirmem.

Faça Isso com Sua Própria Força de Trabalho de IA

Um modelo ficando mais barato e melhor é exatamente o motivo pelo qual uma plataforma de agentes agnóstica ao modelo compensa — você quer encaixar o melhor modelo para cada etapa sem precisar rearquitetar tudo. O Eigent é um aplicativo desktop de "Cowork" multi-agente de código aberto que orquestra modelos especializados em fluxos de trabalho reais, para que você possa rotear etapas rotineiras de agentes para um modelo rápido e barato como o V4 Flash e escalar os ramos difíceis para outro lugar. Se você está configurando tarefas de codificação agêntica, veja como o Eigent lida com fluxos de trabalho como revisão de PRs no GitHub, ou baixe o Eigent para construir sua própria força de trabalho de IA localmente.

Perguntas Frequentes

O que é o DeepSeek V4 Flash?

O DeepSeek V4 Flash é a variante leve da família de modelos V4 da DeepSeek — um modelo Mixture-of-Experts (MoE) de 284B parâmetros com aproximadamente 13B parâmetros ativos e uma janela de contexto de 1M de tokens, ajustado para cargas de trabalho rápidas, de baixo custo e alto throughput. A API oficial (build 0731) está agora em beta público.

O que mudou no lançamento oficial do V4 Flash?

A build 0731 mantém a mesma arquitetura, tamanho e preço do preview, mas passou por um novo pós-treinamento, entregando scores de benchmark de agentes significativamente mais fortes. Ela também adiciona suporte nativo à Responses API e adaptação ao Codex. O método de chamada permanece inalterado — você ainda define o nome do modelo como deepseek-v4-flash.

Os benchmarks do V4 Flash realmente superam o V4 Pro Preview?

Os scores de agentes autodeclarados pela DeepSeek superam o V4-Pro-Preview em vários benchmarks. Mas a comparação não é totalmente equivalente — por exemplo, o score do Flash é no Terminal Bench 2.1, enquanto o score citado do Pro Preview é no Terminal Bench 2.0. Trate os números como indicativos até que avaliações independentes os confirmem.

O V4 Flash funciona com o Codex?

Sim. O V4 Flash oficial suporta nativamente o formato da Responses API e é especificamente adaptado para o Codex, portanto fluxos de trabalho no estilo Codex podem usá-lo como backend com mudanças de configuração, em vez de uma reescrita completa.

O V4 Pro receberá a mesma atualização?

Ainda não. Esta atualização se aplica apenas à API do V4 Flash. A API do V4 Pro e os modelos no aplicativo e na web da DeepSeek permanecem inalterados, embora a DeepSeek afirme que o lançamento oficial do V4 Pro virá em breve.

Recent Posts

Capacidades e Casos de Uso Reais do Grok 4.6 para Agentes de IA
Aug 12, 2026

Capacidades e Casos de Uso Reais do Grok 4.6 para Agentes de IA

Uma análise prática das capacidades e casos de uso do Grok 4.6: agentes de longa duração, programação e trabalho visual, além de como usá-lo em uma força de trabalho multi-agente de IA.

EigentEigent
Grok 4.6 vs Grok 4.5, GPT-5.6 Sol & Fable 5: O Que Realmente Muda
SetorAug 12, 2026

Grok 4.6 vs Grok 4.5, GPT-5.6 Sol & Fable 5: O Que Realmente Muda

Grok 4.6 vs Grok 4.5, GPT-5.6 Sol e Fable 5: o que o xAI realmente confirmou, o que ainda é especulação e o real patamar de benchmarks que esta atualização exclusiva de pós-treinamento precisa superar.

EigentEigent
Grok Bot: Os Colegas de IA da SpaceXAI Que Fazem Trabalho de Verdade
Aug 11, 2026

Grok Bot: Os Colegas de IA da SpaceXAI Que Fazem Trabalho de Verdade

Grok Bot é o novo agente de IA da SpaceXAI e Cursor—colegas que entram nas suas ferramentas e concluem trabalhos reais. O que faz, quem pode usar e como se compara.

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

Experimente o Eigent hoje

Baixe o app desktop open source e comece a automatizar com uma força de trabalho de IA na sua máquina.

Baixar Eigent
Eigent

Receba as últimas novidades e tutoriais sobre automação de workforce com IA.

ProdutoEigentAmbientesPreçosEmpresarial
ExplorarSoluçõesCasos de usoHabilidadesPluginsBlog
DesenvolvedoresDocumentaçãoGitHubCAMEL-AIFundo Open SourceParceiro
BaixarPara código aberto
EmpresaSobre nósMarcaCarreirasTermos de usoPolítica de privacidadeSegurança e confiançaPolítica de cookiesPolítica de reembolso e teste

Todos os direitos reservados © 2026 EIGENT UK LTD

Nova versão do Eigent 1.0 lançada!download