1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • La versión oficial de la API de DeepSeek-V4-Flash se lanzó en beta pública el 31 de julio de 2026, y puede usarse en el método de llamada existente indicando solo el nombre del modelo como deepseek-v4-flash
  • En rendimiento de agentes, superó ampliamente a V4-Pro-Preview y obtuvo 82.7 puntos en Terminal Bench 2.1, además de 76.7 en Cybergym, 70.3 en Toolathlon verified y 68.7 en DSBench-FullStack
  • Los benchmarks de agentes de código se midieron en el próximo modo mínimo de DeepSeek Harness bajo las condiciones de max effort, top_p=0.95 y temperature=1.0
  • La versión oficial de V4-Flash soporta de forma nativa el formato Responses API y fue ajustada para Codex, manteniendo la misma estructura y tamaño de modelo que la Preview, con solo reentrenamiento de posprocesamiento aplicado
  • El alcance de los cambios se limita a la API de V4-Flash; la API de V4-Pro y los modelos de APP/WEB se mantienen, y la versión oficial de V4-Pro se lanzará pronto

Lanzamiento en beta pública y uso de la API

  • La versión oficial de la API de DeepSeek-V4-Flash se lanzó en beta pública el 31 de julio de 2026
  • El método de llamada existente se mantiene sin cambios, y se puede usar la versión más reciente configurando el parámetro del modelo como deepseek-v4-flash
  • La familia V4 se ofrece en la misma base_url de antes mediante OpenAI ChatCompletions y la interfaz de Anthropic
    • V4-Pro usa deepseek-v4-pro y V4-Flash usa deepseek-v4-flash
    • Los nombres de modelo anteriores, deepseek-chat y deepseek-reasoner, estaban programados para descontinuarse el 24 de julio de 2026
    • Durante el periodo de transición, ambos nombres apuntaban respectivamente al modo sin razonamiento y al modo con razonamiento de V4-Flash

Resultados de benchmarks de agentes

  • La versión oficial de V4-Flash registró resultados muy por encima de V4-Pro-Preview en rendimiento de agentes
    • Terminal Bench 2.1: 82.7
    • NL2Repo: 54.2
    • Cybergym: 76.7
    • DeepSWE: 54.4
    • Toolathlon verified: 70.3
    • Agent Last Exam: 25.2
    • Automation Bench Public: 25.1
    • DSBench-FullStack: 68.7
    • DSBench-Hard: 59.6
  • Las tareas de agente de código en benchmarks públicos se midieron con el próximo modo mínimo de DeepSeek Harness
    • El nivel de effort se configuró en max, con top_p=0.95 y temperature=1.0
  • DSBench-FullStack es un conjunto interno de pruebas de desarrollo full-stack, y DSBench-Hard es un conjunto interno de problemas de alta dificultad para agentes de código

Integración con Responses API y Codex

  • La versión oficial de V4-Flash soporta de forma nativa el formato Responses API y fue ajustada para Codex
  • La configuración necesaria para la integración con Codex puede consultarse en la documentación oficial

Alcance de los cambios del modelo

  • DeepSeek-V4-Flash-0731 mantiene la misma estructura y tamaño de modelo que V4-Flash-Preview
  • Solo se aplicó reentrenamiento de posprocesamiento, sin cambios en la estructura del modelo en sí
  • La actualización se aplica únicamente a la API de DeepSeek-V4-Flash
    • La API de DeepSeek-V4-Pro no cambia
    • Los modelos ofrecidos en APP/WEB también se mantienen sin cambios
  • La versión oficial de DeepSeek-V4-Pro se lanzará pronto

1 comentarios

 
GN⁺ 2 시간 전
Comentarios de Hacker News
  • Personalmente me entusiasma más que K3. El modelo DSV4 tiene un costo de serving muy bajo, así que a medida que mejore el rendimiento puede convertirse en un modelo “suficientemente bueno” para más tareas
    DeepSeek lleva mucho tiempo ofreciendo una versión Pro muy barata y la integró con OpenCode y otros, así que es muy posible que también haya reunido muchos datos reales de trabajo de desarrollo. Si usan eso para posentrenamiento, también podrían lograr mejoras adicionales
    También me pregunto cuánto mejoraría K3 si lo destilaran a DSV4. Los modelos baratos y rápidos son especialmente beneficiosos para la comunidad porque no desaparecen a capricho del proveedor y su rendimiento se puede seguir aprovechando. Al menos Flash puede ejecutarse en casa con equipo de menos de 10 mil dólares, pero los modelos grandes de GLM o K3 son poco realistas

    • Los únicos proveedores a los que podría aceptar dar datos de entrenamiento serían DeepSeek y Moonshot
    • Espero que al combinarlo con DwarfStar sea posible tener una IA local bastante útil
  • Estoy haciendo el 90% del trabajo con Flash. No sé por qué, pero me va mejor que Pro, y además es muy barato y rápido
    Si mantienes los cambios por debajo de 1,000 líneas y tomas tú mismo las decisiones de arquitectura, casi no se siente la diferencia con los modelos de punta. El 10% restante lo uso para encontrar bugs o problemas de seguridad, o para revisar si hay una mejor estructura; Flash también lo hace bastante bien, pero hago validación cruzada
    La iteración rápida es mucho mejor que esperar 5~10 minutos por cambios pequeños. Últimamente Kimi y GLM razonaban demasiado tiempo sin necesidad y se volvían lentos. Además, puedes meter muchos datos como dependencias, logs o dumps de rendimiento sin preocuparte por límites, y en ingeniería inversa de binarios no te topas con restricciones de seguridad

    • Tal vez por la forma en que redacto los prompts, pero los modelos de OpenAI que usé vía Codex nunca se negaron a hacer ingeniería inversa de binarios. Incluso ahora estoy analizando firmware de terceros con Codex y nunca me he topado con restricciones
      En cambio, también hay casos de gente a la que le rechazan prompts que no tienen nada que ver con seguridad, así que me pregunto si la diferencia entre plataformas o usuarios puede ser tan grande
    • DeepSeek V4 Flash es suficiente para la mayoría de las tareas y responde rápido. Compro tokens sobre todo en FireWorks.ai, en EE. UU., pero también ya prepagué bastante a DeepSeek
      Uso sobre todo OpenCode, que consume menos tokens que Claude Code, y también espero que DeepSeek lance su propio harness de programación
    • En general es bueno, pero en OpenRouter el límite de tokens de salida es demasiado estricto. Si cae en una trampa de razonamiento, no logra salir por sí solo dentro del límite, pero aun así reemplazó a los modelos de Kimi
  • En mis últimos 30 días usando DeepSeek para la mayoría de mis tareas diarias de agente personal, el costo fue de 4.55 dólares, con 3,467 solicitudes API y 323,183,886 tokens
    Como ingeniero que lidera un equipo pequeño, tengo un estándar de calidad alto y aplico el mismo criterio a mis proyectos personales, pero en tareas de programación y revisión no me ha decepcionado en absoluto. Para otras tareas uso otros modelos

    • Me gustaría saber qué método y prompts usan para revisión de código con LLM. La calidad de las respuestas me pareció bastante baja y quiero saber si el problema es mi forma de usarlo
    • Me pregunto qué harness usan para lograr este nivel de caché de tokens
    • Me pregunto si no tiene muchas alucinaciones y, si las tiene, cómo afectan el flujo de trabajo
    • La calidad no es sobresaliente, y con la mayoría de los LLM pasa lo mismo
  • Ahora ejecuto casi todo dentro de pi con Flash. Si tienes el servidor MCP adecuado, herramientas para reducir contexto y buenas skills, puedes implementar cualquier tarea
    Algunas sesiones toman más de 30 turnos, pero es tan rápido y barato que incluso trabajando una hora completa basta con unos 0.5 dólares. Aun así, en flujos de trabajo con múltiples subagentes también uso modelos más caros para roles de planificación, revisión y oráculo
    Llevo semanas sin usar la suscripción lenta de Opus. También monté un chat autoalojado en OpenWebUI que funciona en el teléfono y soporta MCP y skills, con lo que reemplacé por completo a Perplexity; entre hosting y suscripciones gasto unos 18 dólares al mes

    • Yo también uso la combinación pi + DeepSeek con muchas herramientas personalizadas para seguimiento de tareas y ahorro de tokens, y solo uso modelos de punta para tareas muy difíciles. Esta configuración cubre todo lo que necesito
    • Me gustaría recibir recomendaciones de extensiones útiles para pi
    • Me pregunto si en esta actualización se nota alguna mejora
    • Me gustaría saber cómo configurar top_p y temperature en pi
  • Si los benchmarks reflejan bien el rendimiento en uso real, es un modelo sorprendente. El modelo de 300B supera el rendimiento del modelo preliminar anterior DS4 Pro de 1.8T parámetros e incluso parece mejor que GPT 5.6 Luna
    Sigue siendo más barato que Luna incluso después de la baja de precio

    • En DeepSWE, DeepSeek marca 54.4% y Luna 67%
  • Es bastante impresionante que el modelo de 200B compita con GLM-5.2 y se acerque a Opus 4.8
    Si estas cifras también se traducen en rendimiento general y además se suma el excelente caché de DeepSeek, parece que va a tener muchísimo uso

    • No solo es un modelo de 200B, sino que además su tamaño es de apenas 160GiB
  • Me pregunto por qué no podían llamarlo v4.1-Flash para distinguirlo con más claridad

  • Si supera el rendimiento de deepseek-v4-pro, que ya era suficientemente útil, manteniendo la velocidad y el bajo precio, entonces es muy prometedor
    deepseek-v4-flash ya era el modelo con mejor relación precio/rendimiento, así que parece que la brecha en la métrica inteligencia/costo se ampliará aún más. Aunque el bajo costo del API de DeepSeek también implica entregar información del codebase a China

    • Dicen que al menos en un benchmark supera a GLM 5.2
  • Me pregunto si tiene sentido una configuración que use Kimi K3 en tareas caras en lugar de Opus, y DSV4 Flash para tareas generales en lugar de Sonnet

    • Parece que pronto saldrá una versión actualizada de deepseek-v4-pro, y viendo la gran mejora de DSV4 Flash, es muy posible que supere a Kimi K3 tanto en inteligencia como en costo
    • Tiene bastante sentido. Incluso haciendo programación o revisión de servidores durante una hora con DSV4 Flash, el costo puro de API es de unos 0.30 dólares, y eso me sigue sorprendiendo cada vez
    • Puedes usar mi router de modelos para cambiar entre los dos en segundo plano
  • Me interesan casos de uso de DSv4 en agentes para fines distintos a programación. En particular, me gustaría saber cómo usan DSv4 quienes antes hacían clasificación o categorización y tareas similares con GPT-5.4 mini