DeepSeek V4 Flash se hace oficial: benchmarks de agentes que superan a V4 Pro Preview
Misma arquitectura, mismo precio, pesos reentrenados — el modelo económico ahora supera al flagship preview en tareas de agentes, con soporte nativo de Responses API y Codex

DeepSeek acaba de lanzar la versión oficial de su API V4 Flash en beta pública — y el titular no es un modelo nuevo, sino un reentrenamiento. La versión, etiquetada como DeepSeek-V4-Flash-0731, mantiene exactamente la misma arquitectura, tamaño y precio que la preview, pero sus puntuaciones en benchmarks de agentes ahora superan ampliamente a V4-Pro-Preview, el modelo más grande y costoso de la misma familia. También añade soporte nativo para la Responses API y está adaptado para Codex. Si ya llamas a deepseek-v4-flash, el modelo detrás de tu API acaba de mejorar drásticamente sin costo adicional.
Qué cambió exactamente
Según el registro de cambios oficial de la API de DeepSeek, la API oficial de V4 Flash está ahora en beta pública y el método de llamada no ha cambiado — simplemente estableces el nombre del modelo como deepseek-v4-flash, igual que durante la preview. (Registro de cambios de DeepSeek)
Tres hechos definen este lanzamiento:
- Es un reentrenamiento, no un modelo nuevo. DeepSeek indica que V4-Flash-0731 mantiene la misma arquitectura y tamaño que V4-Flash-Preview y solo fue re-post-entrenado. Nuevos pesos sobre el mismo esqueleto — por eso la integración es un cambio directo sin modificaciones. (Registro de cambios de DeepSeek)
- Los números de agentes son la noticia. DeepSeek describe "capacidades de agente significativamente mejoradas", con resultados de benchmarks que superan ampliamente a V4-Pro-Preview. La mejora apunta a la ejecución autónoma y la llamada a herramientas en tareas complejas. (Registro de cambios de DeepSeek)
- Por ahora, solo para la API. La actualización aplica únicamente a la API de V4 Flash. La API de V4 Pro y los modelos en la app y el sitio web de DeepSeek no han cambiado, y DeepSeek indica que el lanzamiento oficial de V4 Pro llegará pronto. (Registro de cambios de DeepSeek)
La señal estratégica es lo que más destaca. Durante la mayor parte de la generación V4, la jerarquía era simple: Pro es potente, Flash es económico y menos capaz. Este reentrenamiento invierte esa narrativa para cargas de trabajo agénticas — el modelo ligero ahora publica números por encima del flagship preview. (TechNode)
Los números de los benchmarks
DeepSeek publicó una tabla completa de benchmarks con la versión 0731. Estas son las puntuaciones oficiales autoreportadas del registro de cambios:
| Benchmark | V4-Flash-0731 |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon (verificado) | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench (Público) | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
Fuente: Registro de cambios de la API de DeepSeek. DSBench-FullStack y DSBench-Hard son conjuntos de pruebas internas de DeepSeek — una suite de desarrollo full-stack y una suite de agentes de codificación avanzada, respectivamente.
Dos advertencias antes de interpretar demasiado la frase "supera a V4 Pro Preview":
- La comparación no es perfectamente equivalente. V4-Flash-0731 obtiene 82.7 en Terminal Bench 2.1, mientras que la cifra de V4-Pro-Preview citada en la cobertura (67.9) corresponde a Terminal Bench 2.0 — versiones diferentes del conjunto de pruebas, por lo que la comparación directa no es del todo justa. (36Kr)
- Las tareas de Code Agent usaron un harness específico. DeepSeek indica que los benchmarks públicos de Code Agent se ejecutaron usando su "DeepSeek Harness minimal mode" (aún no publicado) con máximo esfuerzo, top-p 0.95, temperatura 1.0. Tus números en producción dependerán de tu propio andamiaje. (Registro de cambios de DeepSeek)
Aun así, la magnitud es notable: un modelo con aproximadamente 13B parámetros activados alcanzando puntuaciones de agente en este rango demuestra cuánto puede mover la aguja el post-entrenamiento por sí solo. (36Kr)
Por qué importa "mismo tamaño, mejor agente"
V4 Flash es un MoE de 284B parámetros con ~13B parámetros activos, frente a los 1.6T totales / ~49B activos de V4 Pro. Ambos comparten una ventana de contexto de 1M tokens. El objetivo de Flash siempre fue el rendimiento y el costo — se sacrificaba algo de capacidad por velocidad. (Para el desglose completo de especificaciones, consulta nuestra guía de DeepSeek V4 Pro.)
Al elevar el rendimiento de agentes sin cambiar el número de parámetros, DeepSeek apunta exactamente al punto de dolor que la mayoría de los equipos encuentran en producción: quieren automatización de bajo costo y alta concurrencia pero no pueden permitirse ejecutar un flagship de 1.6T en cada paso del agente. Un modelo más económico que gestiona bien la llamada a herramientas y la ejecución en múltiples pasos cambia la economía de ejecutar agentes a escala. (BigGo Finance)
Para quienes construyen pipelines de agentes, la conclusión práctica es de enrutamiento: más pasos cotidianos de agente pueden ahora usar Flash por defecto, reservando la escalada a un modelo más pesado para las ramas genuinamente difíciles.
Soporte para Responses API y Codex
La otra mitad de este lanzamiento reduce la barrera de integración. La V4 Flash oficial soporta nativamente el formato de Responses API y está específicamente adaptada para Codex. (Registro de cambios de DeepSeek)
Esto importa porque la Responses API es el formato que espera el nuevo conjunto de herramientas agénticas de OpenAI — incluyendo Codex. El soporte nativo significa que los equipos ya integrados en un flujo de trabajo estilo Codex pueden apuntarlo a deepseek-v4-flash con cambios de configuración en lugar de una reescritura completa. DeepSeek indica que el objetivo es reducir la barrera para la adopción por parte de desarrolladores, y los detalles de configuración están en su documentación de API. (BigGo Finance)
Combinado con el hecho de que la API V4 ya es accesible tanto a través de ChatCompletions estilo OpenAI como de interfaces estilo Anthropic, DeepSeek claramente está optimizando para compatibilidad directa en los principales ecosistemas de agentes. (Registro de cambios de DeepSeek)
Qué significa esto para tu stack
Si construyes sobre DeepSeek, aquí está la versión resumida:
- ¿Ya usas la preview? Obtienes la mejora sin cambios de código — mismo nombre de modelo, mismo precio, mejor comportamiento de agente. Vuelve a ejecutar tus evaluaciones para confirmar que la mejora se refleja en tus tareas, no solo en los benchmarks publicados.
- ¿Ejecutas flujos de trabajo estilo Codex? V4 Flash es ahora un candidato genuino como backend más económico, gracias al soporte nativo de Responses API y la adaptación para Codex.
- ¿Esperando V4 Pro? DeepSeek indica que el lanzamiento oficial de Pro llegará pronto; este reentrenamiento de Flash es una vista previa de las ganancias de post-entrenamiento que probablemente verás allí también.
- Trata los benchmarks del proveedor como indicativos. Las puntuaciones son autoreportadas, algunos conjuntos son internos, y la discrepancia de versión en Terminal Bench significa que el encuadre "supera a Pro Preview" necesita un asterisco hasta que lleguen evaluaciones independientes.
Haz esto con tu propia fuerza laboral de IA
Un modelo que se vuelve más económico y mejor es exactamente la razón por la que una plataforma de agentes agnóstica al modelo resulta valiosa — quieres incorporar el mejor modelo para cada paso sin rediseñar la arquitectura. Eigent es una aplicación de escritorio multi-agente de código abierto tipo "Cowork" que orquesta modelos especializados en flujos de trabajo reales, para que puedas enrutar los pasos rutinarios de agente a un modelo rápido y económico como V4 Flash y escalar las ramas difíciles a otro lugar. Si estás configurando tareas de codificación agéntica, mira cómo Eigent gestiona flujos de trabajo como revisar PRs de GitHub, o descarga Eigent para construir tu propia fuerza laboral de IA de forma local.
Preguntas frecuentes
¿Qué es DeepSeek V4 Flash?
DeepSeek V4 Flash es la variante ligera de la familia de modelos V4 de DeepSeek — un modelo Mixture-of-Experts de 284B parámetros con aproximadamente 13B parámetros activos y una ventana de contexto de 1M tokens, optimizado para cargas de trabajo rápidas, económicas y de alto rendimiento. La API oficial (versión 0731) está ahora en beta pública.
¿Qué cambió en el lanzamiento oficial de V4 Flash?
La versión 0731 mantiene la misma arquitectura, tamaño y precio que la preview, pero fue re-post-entrenada, lo que entrega puntuaciones de benchmarks de agentes significativamente más altas. También añade soporte nativo de Responses API y adaptación para Codex. El método de llamada no ha cambiado — sigues estableciendo el nombre del modelo como deepseek-v4-flash.
¿Los benchmarks de V4 Flash realmente superan a V4 Pro Preview?
Las puntuaciones de agentes autoreportadas por DeepSeek superan a V4-Pro-Preview en varios benchmarks. Pero la comparación no es completamente equivalente — por ejemplo, la puntuación de Flash corresponde a Terminal Bench 2.1 mientras que la puntuación citada de Pro Preview es de Terminal Bench 2.0. Trata los números como indicativos hasta que evaluaciones independientes los confirmen.
¿V4 Flash funciona con Codex?
Sí. La V4 Flash oficial soporta nativamente el formato de Responses API y está específicamente adaptada para Codex, por lo que los flujos de trabajo estilo Codex pueden usarla como backend con cambios de configuración en lugar de una reescritura completa.
¿V4 Pro recibirá la misma actualización?
Todavía no. Esta actualización aplica únicamente a la API de V4 Flash. La API de V4 Pro y los modelos de la app y el sitio web de DeepSeek no han cambiado, aunque DeepSeek indica que el lanzamiento oficial de V4 Pro llegará pronto.
Recent Posts

Grok Bot: Los compañeros de IA de SpaceXAI que hacen trabajo real
Grok Bot es el nuevo agente de IA de SpaceXAI y Cursor—compañeros que inician sesión en tus herramientas y completan trabajo real. Qué hace, quién puede usarlo y cómo se compara.

Grok Bot vs. ChatGPT Work: ¿Cuál fuerza laboral de IA agéntica gana?
Comparativa Grok Bot vs ChatGPT Work: agentes de uso de computadora vs modo de ejecución, autonomía, conectores, precios y qué fuerza laboral de IA agéntica se adapta mejor a tu equipo.

Grok Bot vs Claude Cowork: ¿Cuál IA compañera de trabajo realmente hace el trabajo?
Comparación de Grok Bot vs Claude Cowork en uso de computadora, memoria persistente, equipos multiagente, precios y control — más la opción de compañero de trabajo de código abierto que ninguno ofrece.