1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • La configuración de razonamiento máximo obtuvo 50 puntos en AAII, ubicándose en 3.er lugar detrás de Kimi K3 (max) y GLM-5.2 (max)
  • Es un modelo MoE que activa solo 13 mil millones de parámetros por token de un total de 284 mil millones, y admite entrada/salida de texto y un contexto de 1 millón de tokens
  • El precio del API es de $0.14 por millón de tokens de entrada, $0.28 de salida y $0.003 por acierto de caché; el costo total de la evaluación del Intelligence Index fue de $72.02
  • En la evaluación usó 210 millones de tokens de salida, mucho más que la mediana de 100 millones en modelos comparables, y su velocidad de salida aún no se ha publicado
  • Publica los pesos del modelo y aplica la licencia MIT, lo que permite autoalojamiento y uso comercial; por ahora hay 1 proveedor de API

Configuración del modelo y forma de publicación

  • DeepSeek V4 Flash 0731 es un modelo de razonamiento con pesos abiertos publicado el 31 de julio de 2026
  • Tiene 284 mil millones de parámetros en total y usa una arquitectura Mixture of Experts(MoE) en la que se activan 13 mil millones por token durante la inferencia
  • Se puede descargar los pesos del modelo para autoalojarlo
  • Aplica la licencia MIT, por lo que se permite el uso comercial
  • Es una versión de razonamiento que usa máximo esfuerzo de razonamiento (Max Effort), y podría existir una versión separada sin razonamiento

Evaluación de inteligencia

  • Obtuvo 50 puntos en el Artificial Analysis Intelligence Index v4.1
    • 3.er lugar detrás de Kimi K3 (max) y GLM-5.2 (max). Después siguen Kimi K3 (low) y MiniMax-M3 en 4.º y 5.º lugar
    • La mediana de los grandes modelos comparables con pesos abiertos es de 25 puntos
    • Artificial Analysis lo clasifica dentro del grupo líder en inteligencia
  • El Intelligence Index v4.1 combina las siguientes 9 evaluaciones
    • GDPval-AA v2: trabajo real de tipo agente
    • 𝜏³-Banking: uso de herramientas de tipo agente
    • Terminal-Bench v2.1: coding/uso de terminal de tipo agente
    • SciCode: coding
    • Humanity's Last Exam: razonamiento/conocimiento
    • GPQA Diamond: razonamiento científico
    • CritPt: razonamiento en física
    • AA-Omniscience: precisión del conocimiento y reducción de alucinaciones
    • AA-LCR: razonamiento con contexto largo

Cobertura de benchmarks adicionales

  • También se ofrecen los siguientes resultados para comparar usos específicos entre modelos
    • AA-Briefcase: trabajo de conocimiento de tipo agente
    • AutomationBench-AA: automatización de tareas SaaS
    • Harvey LAB-AA: trabajo legal de agentes
    • EnterpriseOps-Gym-AA: tareas de operación empresarial
    • IFBench: seguimiento de instrucciones
    • APEX-Agents-AA: trabajo de agentes de larga duración
    • ITBench-AA: análisis de causa raíz de fallas en Kubernetes
    • MMMU-Pro: razonamiento visual
  • DeepSeek V4 Flash 0731 no admite entrada de imágenes, por lo que es un modelo solo de texto y no multimodal

Evaluación de confiabilidad del conocimiento y alucinaciones

  • El AA-Omniscience Index da puntos por respuestas correctas, penaliza las alucinaciones y no penaliza rechazar una respuesta
  • El rango de puntuación va de -100 a 100
    • 0 puntos significa que hay la misma cantidad de respuestas correctas e incorrectas
    • Un valor negativo significa que hay más respuestas incorrectas que correctas

Uso de tokens y características de respuesta

  • En la evaluación completa del Intelligence Index generó 210 millones de tokens de salida
    • La mediana en modelos comparables con pesos abiertos es de 100 millones de tokens
    • Artificial Analysis lo clasifica como un nivel muy verboso
  • La cantidad de tokens de salida por tarea se calcula aplicando la ponderación del Intelligence Index al volumen de salida de cada benchmark y dividiéndolo entre la cantidad de tareas, excluyendo las ejecuciones repetidas
  • La velocidad de salida aún no se ha medido, por lo que no se ha publicado el número de tokens de salida por segundo

Precio del API y costo de evaluación

  • Los precios base del DeepSeek API son los siguientes
    • Entrada: $0.14 por millón de tokens
    • Salida: $0.28 por millón de tokens
    • Acierto de caché: $0.003 por millón de tokens
  • Si se mezcla acierto de caché/entrada/salida en proporción 7:2:1, el precio es de $0.06 por millón de tokens
  • El costo total de la evaluación del Intelligence Index fue de $72.02
  • La sección de resumen muestra la mediana de los modelos comparados como entrada $0.43/salida $1.20, y la sección FAQ la muestra como entrada $0.58/salida $2.20
  • El costo por tarea se calcula dividiendo entre el número de tareas el costo de tokens de entrada, acierto de caché, escritura en caché, inferencia y respuesta final, y luego aplicando la ponderación del Index de cada benchmark
  • Los costos de escritura y almacenamiento en caché pueden cobrarse por separado según el proveedor de API

Contexto y alcance de provisión

  • La ventana de contexto es de 1 millón de tokens, equivalente a unas 1,500 páginas tamaño A4 en Arial de 12 puntos
  • Puede usarse en flujos de trabajo RAG que requieran búsqueda y razonamiento sobre grandes volúmenes de documentos
  • Solo admite entrada de texto y salida de texto
  • Actualmente hay 1 proveedor que ofrece el API, y el precio puede variar según el proveedor

1 comentarios

 
GN⁺ 2 시간 전
Opiniones en Hacker News
  • Los pesos del modelo acaban de publicarse: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • Se espera la versión cuantizada de DwarfStar. Usé durante meses la vista previa de DeepSeek V4 Flash en una MacBook Pro de 128 GB como mi agente de código principal, y parece superar a GLM 5.2 en casi todas las métricas.
    • Apunta a aceleradores de hardware con una primitiva de multiplicación de matrices 128×128; me pregunto si se refiere a Warp Group Matrix Multiply Accumulate de la H100.
    • Si es un GGUF de Unsloth de menos de 165 GB, debería poder ejecutarse en la mayoría de los sistemas solo con CPU que tengan 256 GB de RAM. También es posible una configuración híbrida con llama-server, subiendo todo lo posible a GPUs de 32 GB, 48 GB o 96 GB y dejando el resto en la DRAM del sistema.
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • El nuevo modelo de DeepSeek se siente como un regalo de Navidad. En modelos API de bajo costo, DeepSeek es el que mejor lo hace, y hasta que el precio de la VRAM baje lo suficiente como para hacer viable la ejecución local, esta es la mejor opción.
    Los modelos de suscripción que dependen de subsidios difícilmente duren mucho, y el cobro por API parece más cercano a un modelo de negocio sostenible.

    • Uso DeepSeek en un proyecto, y es sorprendente poder usar decenas de millones de tokens por unos pocos centavos. No sirve para todo, pero en ciertas tareas funciona de forma excelente a un costo prácticamente gratuito.
    • Espero el día en que China alcance a EE. UU. en memoria y hardware de cómputo, y supere a las empresas estadounidenses tanto en precio como en rendimiento.
    • Mis compañeros desarrolladores se quejan de que consumen los tokens de Claude en una hora, pero yo uso DS Flash todo el día. Si a veces se equivoca, ahí recién saco modelos como Claude para las tareas difíciles.
    • Incluso calculando por token, es muy probable que la API de DeepSeek sea más rentable que una suscripción. En mis pruebas, Flash mejoró mucho en seguimiento de instrucciones y se volvió más proactivo; hoy casi no hay modelos que le compitan en relación costo-beneficio.
    • Si uno mira los precios directamente, para obtener resultados como los de GPT 5.6 Luna se necesitan 5 veces más tokens, y la cantidad de tokens por segundo también es mucho menor. Aun así, está claro que la presión de DeepSeek obliga a los proveedores establecidos a seguir optimizando.
  • La dirección anterior da 404; la URL correcta parece ser esta: https://artificialanalysis.ai/models/deepseek-v4-flash

  • Agregué el punto de datos de DeepSeek V4 Flash 0731 al gráfico que OpenAI publicó ayer, y queda ubicado en la frontera de precio-rendimiento.
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    Original: https://openai.com/index/advancing-the-price-performance-fro...

  • Dicen que para las tareas de agentes de código en los benchmarks públicos usaron un modo mínimo de DeepSeek Harness que aún no se lanzó; me pregunto si también planean anunciar un harness optimizado para agentes de código.
    Si se usa DSv4 Flash con reasonix o pi, se puede programar todo el día por unos centavos sin preocuparse por los tokens. En cambio, si se usa el mismo modelo en Fireworks u OpenRouter con ZDR, el costo sigue subiendo sin motivo. Parece que subsidian el precio para recolectar datos de uso, y estoy esperando el día en que pueda ejecutarlo localmente.

    • Me da curiosidad saber con qué proveedor lo compras si no es a través de OpenRouter. Tenía entendido que, si el proveedor está listado en OpenRouter, el precio es el mismo que comprando directamente.
    • En el reporte técnico ya habían adelantado DeepSeek Harness. Las tareas de agentes de código se evaluaron con modo mínimo, máximo esfuerzo de razonamiento, temperature = 1.0 y top_p = 0.95; el harness se publicará más adelante.
  • Para usuarios con una RTX PRO 6000 de 96 GB o una DGX Spark de 128 GB, el menos conocido vllm-moet es un motor muy bueno. Genera automáticamente planos simétricos de 2 bits para inferencia, también crea una caché delta de 4 bits para restaurar precisión, y soporta streaming desde SSD de pesos más grandes que la RAM.
    Se puede ajustar el equilibrio entre velocidad y precisión definiendo cuánta VRAM asignar a cada área, y se demostró que alcanza 170 tokens por segundo en DS V4 Flash. Usa el modelo original tal cual, sin un modelo convertido aparte.
    En DGX Spark hace falta un pequeño workaround para ignorar la diferencia entre sm120 y sm121, pero puede ejecutarse también en sm121, así que vale la pena dedicarle unas horas.

  • Ofrece inteligencia al nivel de GLM 5.2 y Gemini 3.6 por 0.28 dólares por millón de tokens de salida, y también saldrá pronto el modelo Pro actualizado.
    El Q8 sin pérdida de Unsloth pesa 162 GB, así que en la práctica tiene un tamaño ejecutable incluso en casa.

    • Me gustaría ver qué tipo de casa puede correr algo así.
    • El tamaño del Q8 es de aproximadamente 151 GB.
  • Si DeepSeek V4 Flash supera a V4 Pro, me pregunto si en unas semanas podremos esperar un V4 Pro de nivel Opus 5. Ojalá sea incluso mejor que Opus.

    • Estoy usando V4 Flash en una app que estoy construyendo, y después de usar solo GPT, Opus y Sonnet, la relación costo-beneficio y el rendimiento sorprenden. Como el costo es tan bajo, incluso puedo ofrecer un nivel gratuito generoso en una app cuyo objetivo no es generar ganancias.
      https://trysojourn.app
    • Rendimiento de Opus 5 al precio de V4 Pro sería increíblemente bueno, pero probablemente sea más bien un sueño.
    • Ya habían dicho que pronto se publicará la versión final actualizada de V4 Pro.
  • Lo realmente interesante es que lograron una gran mejora de rendimiento solo con fine-tuning adicional, sin cambios de arquitectura. Es resultado de invertir más datos, cómputo y tiempo.
    DS V4 Flash es relativamente pequeño comparado con las familias de modelos con las que compite, así que parece muy probable que aplicar datos de alta calidad y pipelines de entrenamiento similares a otros modelos pequeños produzca mejoras parecidas.

  • En precio por tarea ya supera a Luna por una diferencia de alrededor de 2 veces: https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • También me gustaría ver cómo se compara con Luna por tipos específicos de tareas.
    • Como el costo está en el eje X, para ser precisos DeepSeek V4 Flash 0731 con razonamiento máximo cuesta unos 0.03 dólares por tarea y tiene índice 50. OpenAI Luna con razonamiento alto cuesta 0.03 dólares e índice 46; con razonamiento ultra alto, 0.04 dólares e índice 49; y con razonamiento máximo, 0.07 dólares e índice 51.
      Por lo tanto, es más justo decir que Luna es 2 a 3 veces más caro que DeepSeek Flash, pero su velocidad de inferencia es 2 a 5 veces mayor. El modelo más barato de OpenAI que supera a DeepSeek es Luna con razonamiento máximo: con rendimiento similar, cuesta alrededor de 3 veces más antes del redondeo, pero también es casi 3 veces más rápido.
      Que Artificial Analysis use azul oscuro tanto para DeepSeek como para OpenAI es una elección de color muy desafortunada, especialmente en un día como hoy.