- La versión oficial de la API de DeepSeek-V4-Flash se lanzó en beta pública el 31 de julio de 2026, y puede usarse en el método de llamada existente indicando solo el nombre del modelo como
deepseek-v4-flash - En rendimiento de agentes, superó ampliamente a V4-Pro-Preview y obtuvo 82.7 puntos en Terminal Bench 2.1, además de 76.7 en Cybergym, 70.3 en Toolathlon verified y 68.7 en DSBench-FullStack
- Los benchmarks de agentes de código se midieron en el próximo modo mínimo de DeepSeek Harness bajo las condiciones de max effort,
top_p=0.95ytemperature=1.0 - La versión oficial de V4-Flash soporta de forma nativa el formato Responses API y fue ajustada para Codex, manteniendo la misma estructura y tamaño de modelo que la Preview, con solo reentrenamiento de posprocesamiento aplicado
- El alcance de los cambios se limita a la API de V4-Flash; la API de V4-Pro y los modelos de APP/WEB se mantienen, y la versión oficial de V4-Pro se lanzará pronto
Lanzamiento en beta pública y uso de la API
- La versión oficial de la API de DeepSeek-V4-Flash se lanzó en beta pública el 31 de julio de 2026
- El método de llamada existente se mantiene sin cambios, y se puede usar la versión más reciente configurando el parámetro del modelo como
deepseek-v4-flash - La familia V4 se ofrece en la misma
base_urlde antes mediante OpenAI ChatCompletions y la interfaz de Anthropic- V4-Pro usa
deepseek-v4-proy V4-Flash usadeepseek-v4-flash - Los nombres de modelo anteriores,
deepseek-chatydeepseek-reasoner, estaban programados para descontinuarse el 24 de julio de 2026 - Durante el periodo de transición, ambos nombres apuntaban respectivamente al modo sin razonamiento y al modo con razonamiento de V4-Flash
- V4-Pro usa
Resultados de benchmarks de agentes
- La versión oficial de V4-Flash registró resultados muy por encima de V4-Pro-Preview en rendimiento de agentes
- Terminal Bench 2.1: 82.7
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench Public: 25.1
- DSBench-FullStack: 68.7
- DSBench-Hard: 59.6
- Las tareas de agente de código en benchmarks públicos se midieron con el próximo modo mínimo de DeepSeek Harness
- El nivel de effort se configuró en max, con
top_p=0.95ytemperature=1.0
- El nivel de effort se configuró en max, con
- DSBench-FullStack es un conjunto interno de pruebas de desarrollo full-stack, y DSBench-Hard es un conjunto interno de problemas de alta dificultad para agentes de código
Integración con Responses API y Codex
- La versión oficial de V4-Flash soporta de forma nativa el formato Responses API y fue ajustada para Codex
- La configuración necesaria para la integración con Codex puede consultarse en la documentación oficial
Alcance de los cambios del modelo
DeepSeek-V4-Flash-0731mantiene la misma estructura y tamaño de modelo que V4-Flash-Preview- Solo se aplicó reentrenamiento de posprocesamiento, sin cambios en la estructura del modelo en sí
- La actualización se aplica únicamente a la API de DeepSeek-V4-Flash
- La API de DeepSeek-V4-Pro no cambia
- Los modelos ofrecidos en APP/WEB también se mantienen sin cambios
- La versión oficial de DeepSeek-V4-Pro se lanzará pronto
1 comentarios
Comentarios de Hacker News
Personalmente me entusiasma más que K3. El modelo DSV4 tiene un costo de serving muy bajo, así que a medida que mejore el rendimiento puede convertirse en un modelo “suficientemente bueno” para más tareas
DeepSeek lleva mucho tiempo ofreciendo una versión Pro muy barata y la integró con OpenCode y otros, así que es muy posible que también haya reunido muchos datos reales de trabajo de desarrollo. Si usan eso para posentrenamiento, también podrían lograr mejoras adicionales
También me pregunto cuánto mejoraría K3 si lo destilaran a DSV4. Los modelos baratos y rápidos son especialmente beneficiosos para la comunidad porque no desaparecen a capricho del proveedor y su rendimiento se puede seguir aprovechando. Al menos Flash puede ejecutarse en casa con equipo de menos de 10 mil dólares, pero los modelos grandes de GLM o K3 son poco realistas
Estoy haciendo el 90% del trabajo con Flash. No sé por qué, pero me va mejor que Pro, y además es muy barato y rápido
Si mantienes los cambios por debajo de 1,000 líneas y tomas tú mismo las decisiones de arquitectura, casi no se siente la diferencia con los modelos de punta. El 10% restante lo uso para encontrar bugs o problemas de seguridad, o para revisar si hay una mejor estructura; Flash también lo hace bastante bien, pero hago validación cruzada
La iteración rápida es mucho mejor que esperar 5~10 minutos por cambios pequeños. Últimamente Kimi y GLM razonaban demasiado tiempo sin necesidad y se volvían lentos. Además, puedes meter muchos datos como dependencias, logs o dumps de rendimiento sin preocuparte por límites, y en ingeniería inversa de binarios no te topas con restricciones de seguridad
En cambio, también hay casos de gente a la que le rechazan prompts que no tienen nada que ver con seguridad, así que me pregunto si la diferencia entre plataformas o usuarios puede ser tan grande
Uso sobre todo OpenCode, que consume menos tokens que Claude Code, y también espero que DeepSeek lance su propio harness de programación
En mis últimos 30 días usando DeepSeek para la mayoría de mis tareas diarias de agente personal, el costo fue de 4.55 dólares, con 3,467 solicitudes API y 323,183,886 tokens
Como ingeniero que lidera un equipo pequeño, tengo un estándar de calidad alto y aplico el mismo criterio a mis proyectos personales, pero en tareas de programación y revisión no me ha decepcionado en absoluto. Para otras tareas uso otros modelos
Ahora ejecuto casi todo dentro de pi con Flash. Si tienes el servidor MCP adecuado, herramientas para reducir contexto y buenas skills, puedes implementar cualquier tarea
Algunas sesiones toman más de 30 turnos, pero es tan rápido y barato que incluso trabajando una hora completa basta con unos 0.5 dólares. Aun así, en flujos de trabajo con múltiples subagentes también uso modelos más caros para roles de planificación, revisión y oráculo
Llevo semanas sin usar la suscripción lenta de Opus. También monté un chat autoalojado en OpenWebUI que funciona en el teléfono y soporta MCP y skills, con lo que reemplacé por completo a Perplexity; entre hosting y suscripciones gasto unos 18 dólares al mes
top_pytemperatureen piSi los benchmarks reflejan bien el rendimiento en uso real, es un modelo sorprendente. El modelo de 300B supera el rendimiento del modelo preliminar anterior DS4 Pro de 1.8T parámetros e incluso parece mejor que GPT 5.6 Luna
Sigue siendo más barato que Luna incluso después de la baja de precio
Es bastante impresionante que el modelo de 200B compita con GLM-5.2 y se acerque a Opus 4.8
Si estas cifras también se traducen en rendimiento general y además se suma el excelente caché de DeepSeek, parece que va a tener muchísimo uso
Me pregunto por qué no podían llamarlo
v4.1-Flashpara distinguirlo con más claridadSi supera el rendimiento de deepseek-v4-pro, que ya era suficientemente útil, manteniendo la velocidad y el bajo precio, entonces es muy prometedor
deepseek-v4-flash ya era el modelo con mejor relación precio/rendimiento, así que parece que la brecha en la métrica inteligencia/costo se ampliará aún más. Aunque el bajo costo del API de DeepSeek también implica entregar información del codebase a China
Me pregunto si tiene sentido una configuración que use Kimi K3 en tareas caras en lugar de Opus, y DSV4 Flash para tareas generales en lugar de Sonnet
Me interesan casos de uso de DSv4 en agentes para fines distintos a programación. En particular, me gustaría saber cómo usan DSv4 quienes antes hacían clasificación o categorización y tareas similares con GPT-5.4 mini