2 puntos por kallare 5 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Google lanzó nuevos modelos de Gemini —3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber— diseñados para la eficiencia, la baja latencia y la confiabilidad en el desarrollo de agentes de IA
  • Gemini 3.6 Flash ofrece mejor rendimiento en código, trabajo de conocimiento y multimodalidad frente a 3.5 Flash, además de reducir el uso de tokens de salida y los costos
  • Gemini 3.5 Flash-Lite es el modelo más rápido y costo-eficiente de la clase 3.5, adecuado para tareas de alto volumen como búsqueda con agentes y procesamiento de documentos
  • Gemini 3.5 Flash Cyber es un modelo especializado ajustado para vulnerabilidades de ciberseguridad, disponible mediante un programa piloto de acceso restringido a través de CodeMender
  • Gemini 3.5 Pro se lanzará pronto de forma más amplia y el desarrollo de Gemini 4 está en marcha

Resumen adicional de GN⁺

Neo hizo una organización adicional a partir del texto original

  • Google presentó por separado modelos de propósito general, alta velocidad y seguridad especializada, enfocados en la eficiencia de tokens, latencia y estabilidad necesarias para construir agentes de IA a gran escala
  • 3.6 Flash usa 17% menos tokens de salida que 3.5 Flash, reduce las etapas de razonamiento y la cantidad de llamadas a herramientas, y se ofrece a $1.50 por 1 millón de tokens de entrada y $7.50 por 1 millón de tokens de salida
  • 3.5 Flash-Lite ofrece 350 tokens de salida por segundo y un precio de $0.3 por 1 millón de tokens de entrada y $2.5 por 1 millón de tokens de salida, con niveles de razonamiento ajustables para responder a tareas masivas y subagentes de múltiples pasos
  • 3.5 Flash Cyber detecta, verifica y corrige vulnerabilidades dentro de la configuración multagente de CodeMender, y por el riesgo de doble uso se ofrecerá de forma limitada solo a gobiernos y socios de confianza
  • 3.6 Flash y 3.5 Flash-Lite pueden usarse en la API de Gemini, plataformas empresariales y la app de Gemini, mientras que Google también avanza con las pruebas de socios de 3.5 Pro y el preentrenamiento de Gemini 4

El papel de los tres modelos

  • La familia Flash fue diseñada para equilibrar eficiencia y calidad en agentes de IA y así escalar flujos de trabajo con agentes
  • 3.6 Flash es el modelo principal, con mejoras en código, trabajo de conocimiento y rendimiento multimodal
    • Según el Artificial Analysis Index, usa 17% menos tokens de salida que 3.5 Flash
    • En algunos benchmarks, como DeepSWE de Datacurve, el uso de tokens baja hasta 65%
    • El precio por token de salida también es menor que en 3.5 Flash
  • 3.5 Flash-Lite es el modelo más rápido y costo-eficiente de la serie 3.5, y en flujos de trabajo con agentes supera a la generación anterior de Flash-Lite
  • 3.5 Flash Cyber combina un modelo especializado en ciberseguridad con la infraestructura de agentes CodeMender para apuntar a un rendimiento capaz de competir con modelos de frontera
  • Gemini 3.5 Pro se está probando con socios y se planea ofrecer de forma amplia cuando esté listo
  • También comenzó la ejecución de preentrenamiento más ambiciosa hasta ahora para Gemini 4

Eficiencia y precio de 3.6 Flash

  • Refleja el feedback de desarrolladores y clientes sobre 3.5 Flash para mejorar a la vez la calidad en código y trabajo de conocimiento, junto con la eficiencia de tokens
  • En el Artificial Analysis Index usa 17% menos tokens de salida que 3.5 Flash, y también reduce la cantidad de etapas de razonamiento y llamadas a herramientas necesarias para completar flujos de trabajo de múltiples pasos
  • El precio es de $1.50 por 1 millón de tokens de entrada y $7.50 por 1 millón de tokens de salida
  • La combinación de menor uso de tokens y precio más bajo reduce el costo total por tarea de agente
  • En tareas de API verificadas de OSWorld, usa los tokens con más eficiencia que 3.5 Flash y reduce salidas innecesariamente largas

Mejoras de calidad en 3.6 Flash

  • En tareas de código reduce ediciones no deseadas y repeticiones de ejecución, y mejora la precisión
    • DeepSWE: 49%, frente a 37% en 3.5 Flash
    • MLE Bench: 63.9%, frente a 49.7% en 3.5 Flash
  • También mejora la capacidad de uso de computadora
    • OSWorld-Verified: 83.0%, frente a 78.4% en 3.5 Flash
    • La función de uso de computadora está disponible como herramienta integrada del lado del cliente en la API de Gemini y Gemini Enterprise
  • También supera a 3.5 Flash en rendimiento para trabajo de conocimiento
    • GDPval-AA v2: 1421, frente a 1349 en 3.5 Flash
    • Hebbia y Harvey confirmaron sus capacidades en tareas multimodales como parsing de documentos, análisis de gráficos y datos, y redacción de reportes
  • Los casos de uso incluyen:
    • Analizar datos financieros y transcripciones con Managed Agents de AIS
    • Reducir latencia y ejecutar migraciones de código de alta calidad con orquestación multagente de AGY
    • Desarrollar un extractor de texturas fotográficas para flujos 3D con canvas de la app Gemini
    • Construir un estudio temático interactivo usando el editor offline de AGY y tldraw

Medidas de seguridad de 3.6 Flash

  • Aplica protecciones reforzadas de Frontier Safety en áreas de abuso relacionadas con químicos, biológicos, radiológicos, nucleares (CBRN) y ciberataques
  • Fue entrenado para aumentar mucho la resistencia a ataques de jailbreak mientras minimiza rechazos en usos beneficiosos
  • Los detalles pueden consultarse en la tarjeta del modelo 3.6 Flash

Velocidad y costo de 3.5 Flash-Lite

  • Fue diseñado para flujos de trabajo de desarrolladores que necesitan baja latencia o alto rendimiento, como búsqueda con agentes y procesamiento de documentos
  • Según las mediciones de Artificial Analysis, es el más rápido de la serie 3.5 con 350 tokens de salida por segundo
  • El precio es de $0.3 por 1 millón de tokens de entrada y $2.5 por 1 millón de tokens de salida, con una mejora importante de calidad frente a 3.1 Flash-Lite
  • Puede ejecutar trabajos masivos con menor latencia que 3.5 Flash
  • Permite ajustar el nivel de razonamiento según la carga de trabajo
    • Los niveles minimal y low se usan para reducir latencia y costo en tareas masivas
    • Los niveles altos de razonamiento manejan cargas de trabajo de subagentes de múltiples pasos
  • La función de uso de computadora también se ofrece como herramienta integrada para respaldar tareas de agentes en varios entornos

Benchmarks y usos de 3.5 Flash-Lite

  • Frente a 3.1 Flash-Lite, mejora en código, contexto largo y ejecución de tareas reales
    • Terminal-Bench 2.1: 54%, frente a 31% en 3.1 Flash-Lite
    • GDM-MRCR v2: 72.2%, frente a 60.1% en 3.1 Flash-Lite
    • GDPval-AA v2: 1140, frente a 642 en 3.1 Flash-Lite
  • También supera a 3 Flash en varias evaluaciones de agentes y código
    • SWE-Bench Pro: 54.2%, frente a 49.6% en 3 Flash
    • OSWorld-Verified: 74.0%, frente a 65.1% en 3 Flash
    • Puede ser una opción más rápida y con mejor rendimiento para cargas de trabajo basadas en 2.5 Flash y 3 Flash
  • Los casos de uso incluyen:
    • Extraer y sintetizar características de productos en grandes conjuntos de datos de comercio electrónico
    • Generar 25 conceptos de diseño web explorables usando 3.6 Flash como agente superior
    • Escalar la traducción y el resumen de recibos mediante comprensión multimodal
    • Construir juegos generando e iterando rápidamente múltiples opciones
  • Los detalles pueden consultarse en la tarjeta del modelo 3.5 Flash-Lite

3.5 Flash Cyber de CodeMender

  • Como los modelos de IA pueden encontrar vulnerabilidades de seguridad más rápido de lo que los sistemas existentes pueden corregirlas, la seguridad de software requiere un enfoque con alta capacidad y eficiencia
  • Gemini 3.5 Flash Cyber fue ajustado sobre la base de 3.5 Flash para la detección y corrección de vulnerabilidades de seguridad
  • Fue diseñado para detectar, verificar y corregir problemas de seguridad en código con un precio por token menor que el de modelos grandes
  • En CodeMender, varios agentes 3.5 Flash Cyber colaboran para crear un solo informe integrado, y registran un rendimiento competitivo de nivel de frontera en el benchmark CyberGym
  • Considerando la naturaleza de doble uso de la tecnología, su despliegue será limitado
    • Se ofrecerá como piloto de acceso restringido para gobiernos y socios de confianza a través de CodeMender
    • La idea es ayudar a los defensores a detectar y corregir vulnerabilidades críticas antes de que sean explotadas, reduciendo al mismo tiempo el uso indebido generalizado

Vías de disponibilidad

  • 3.6 Flash y 3.5 Flash-Lite están disponibles en varios productos desde el mismo día del anuncio
  • Los desarrolladores pueden usar la API de Gemini en Google AI Studio y Android Studio
  • Las empresas pueden usarlo en la Gemini Enterprise Agent Platform, y 3.6 Flash también está disponible en la app Gemini Enterprise
  • Los usuarios generales pueden usarlo en la app Gemini, y 3.5 Flash-Lite también se desplegará gradualmente en Google Search
  • Google planea incorporar el feedback de usuarios en futuras mejoras de los modelos Gemini y lanzar pronto también 3.5 Pro

1 comentarios

 
GN⁺ 27 분 전
Opiniones en Hacker News
  • Me da curiosidad el tamaño del modelo Pro que Google usa internamente para entrenar modelos pequeños
    Que no lancen Pro junto con Flash podría deberse a que el modelo es demasiado grande y no resulta rentable, a que no tienen suficientes recursos de cómputo para operarlo, o a que tiene demasiados problemas de alineación
    Si se ven los benchmarks, el rendimiento está en un punto medio, pero es un modelo muy rápido en inteligencia por tiempo de tarea y en inteligencia por velocidad de salida
    También probé 3.5 Flash en Antigravity y, entendiendo para qué sirve, es un modelo subestimado; en trabajo de frontend fue mucho mejor que GPT-5.5 y permitió iterar más rápido, así que espero que 3.6 sea parecido

    • Puede que los modelos grandes estén muy por detrás de ChatGPT 5.6 y Fable, así que Google estaría enfocándose en la velocidad, donde sí puede ganar
    • Una cuarta posibilidad es que el modelo grande de Google sea incluso peor que K3 y GLM, y por eso no lo publican
      Me gusta usar Gemini para procesar de una vez MR completas con contexto grande, pero en uso de herramientas y coding tipo agente queda bastante por detrás
    • También me pregunto si influye la Vista general de IA de Google Search. Puede que usar recursos de cómputo en miles de millones de búsquedas al día sea más rentable que vender acceso a la API
    • Parece más bien que ya no logran empujar los benchmarks de máximo nivel y que al final simplemente no pueden vencer a GPT-5.6 y Fable
    • Me inclino por la segunda razón: falta de capacidad de cómputo. Como no hay capacidad para Pro, a menudo termina respondiendo Flash con pensamiento extendido activado, y si no es para programar, ni siquiera es fácil notar la diferencia entre ambos
  • Parece que Google se está saboteando justo cuando tenía el éxito de sus productos de IA al alcance
    Eliminaron la suscripción AI Ultra sin un reemplazo adecuado, y eso nos obligó a mi empresa y a mí a dejar Antigravity. En Antigravity IDE no se puede asociar una suscripción avanzada de Google Workspace, y tampoco se integra Gemini Enterprise Agent Platform
    El proceso de configuración de Gemini Enterprise Agent Platform es terrible, y si quieres limitar el gasto por usuario tienes que crear un proyecto por cada uno. También es absurdo que no se puedan activar modelos de Anthropic en cuentas de facturación que aún tienen créditos gratis
    Yo apoyaba mucho a Google y Gemini, pero por estas decisiones repentinas de producto terminé comprando de mi bolsillo las suscripciones de 200 dólares al mes de Anthropic y OpenAI

    • Esa insistencia en separar artificialmente los productos para consumo y para empresas es muy molesta. Es raro poder usar herramientas más potentes con una cuenta personal de Google que con la cuenta corporativa de Google Workspace
    • Tienen tanto los recursos para liderar esta tecnología como una base de usuarios ya existente, y aun así siguen dejando pasar oportunidades. Ahora ya ni comparan con otros modelos, sino que solo hacen benchmarks entre sus propios modelos, y eso por sí solo ya dice mucho
    • Esto aún está en una etapa temprana y el liderazgo ya ha cambiado varias veces. Cualquier empresa que lance el próximo modelo frontier podría volver a cambiar el panorama
    • Las suscripciones de Anthropic y OpenAI podrían ser productos deficitarios sostenidos con enormes subsidios. En un contexto donde modelos más baratos y parecidos muestran lo difícil que es ganar dinero por token, quizá Google está evitando entrar en una guerra de desgaste
    • Google Gemini agy impide usar tokens en sus herramientas de ejecución propias, pero mis herramientas son mucho más eficientes que agy. Bastaría con bloquear si se supera un límite como el de 5 horas; si es eficiente, gana el usuario, y si es ineficiente, pierde
      Me frustró no poder llamar directamente al endpoint que usa agy, y hasta le pregunté a Gemini si había una forma de rodearlo. Irónicamente, Gemini me cayó bien porque incluso ayuda con entusiasmo a ir contra el cliente de agy
  • Decepciona que no haya ninguna comparación con otros modelos, y tampoco parece que hayan empujado hacia arriba la curva de rendimiento. 3.6 Flash parece peor que GLM 5.2 siendo además más caro, pero el post tampoco da muchos detalles
    En algún momento parecía que Google por fin estaba acelerando de verdad, pero con el tiempo eso se ve cada vez más dudoso; habrá que esperar a 3.5 Pro

    • La comparación entre 3.6 Flash y Sol, Luna, Terra está aquí
    • Cuando Apple anunció un acuerdo de miles de millones de dólares con Google para Apple Intelligence, esperaba grandes avances, pero solo siguen acumulándose malas noticias como el retraso del modelo Pro y la salida de líderes de IA. Me pregunto si Apple sabe algo que los demás no, o si ya se está arrepintiendo de la decisión
    • En varios benchmarks queda más o menos al nivel de Opus 4.8 Medium o Sonnet 5 High, y parece apenas un poco mejor que GLM 5.2
    • En el benchmark de Artificial Analysis, GLM generó una salida el doble de verbosa, así que al final costó más
    • El área donde más destacaban los modelos de Google era la corrección de idiomas distintos del inglés. Supongo que es porque Google tiene el material más completo de internet y por eso cuenta con más datos de entrenamiento
  • Los resultados de pelícano de 3.6 Flash y 3.5 Flash-Lite se pueden ver aquí. Cyber todavía no se puede usar por API

    • Los posts de pelícanos que aparecen cada vez que sale un modelo nuevo ya cansan; se sienten como autopromoción de bajo esfuerzo
    • Falta una parte del marco entre el pedal y la rueda trasera, y el cuadro de la bicicleta atraviesa al ave. Además le agregaron un sombrero a la cabeza del ave y un pez en el pico; cada vez que uno le pide a un LLM que mejore un primer resultado, siempre termina añadiendo este tipo de elementos
      En el avance de los LLM, parece que ser mejor termina significando meter más elementos, y me pregunto si eso es resultado del entrenamiento de razonamiento que recompensa más tokens y más componentes
    • Me pregunto si el pelícano de 3.1 Flash-Lite era mejor que el de 3.6
    • En la app web generó un pelícano muy pulido, pero es difícil evaluarlo en relación con los resultados anteriores
    • Publicar lo mismo en cada post sobre IA parece autopromoción excesiva y spam
  • El precio por cada 1 millón de tokens de entrada/salida es el siguiente
    2.5 Flash cuesta $0.3/$2.5, 3.0 Flash $0.5/$3, 3.5 Flash $1.5/$9 y 3.6 Flash $1.5/$7.5
    2.5 Flash-Lite cuesta $0.1/$0.4, 3.1 Flash-Lite $0.25/$1.5 y 3.5 Flash-Lite $0.3/$2.5

    • Habría sido excelente si 3.6 Flash hubiera tenido el precio de 3.0 Flash, pero a su precio actual queda muy por detrás de unos 10 modelos, incluido Grok 4.5, en rendimiento por costo. 3.5 Flash-Lite también tendría que estar al precio de 2.5 Flash-Lite para ser competitivo, y ahora mismo va por detrás de DeepSeek v4 Flash y otros
      En realidad, el área donde Gemini rinde por encima de su categoría es el trabajo de conocimiento del tipo “búscame esto en Google”, así que sí tiene usos. Google es fuerte en términos generales, pero en modelos de texto está en segunda línea, y en ciencias de la vida, imagen y video está en primera línea
    • 3.5 Flash fue demasiado caro para ser un modelo Flash desde el principio. Lo promocionaron como un nivel cercano a frontera, pero hay modelos abiertos publicados que cuestan varios órdenes de magnitud menos y pueden competir
    • Google parece ser la empresa con la mayor variación de precios cada vez que cambia de generación de modelos
    • Por 2.5 Flash estuve pagando a Google una suma de cuatro cifras cada mes, pero ahora aunque use 3.0 Flash, parece que pronto también lo reemplazarán. A los modelos Flash-Lite les falta confiabilidad y consistencia
  • Google dijo que está probando Gemini 3.5 Pro con socios y que planea ofrecerlo ampliamente en cuanto esté listo, y también que ya comenzó el preentrenamiento más ambicioso de su historia para Gemini 4

    • Está bien que hayan corregido la inflación de tokens de 3.5 Flash, pero este párrafo es la verdadera clave. Ojalá 3.5 Pro salga pronto y Gemini 4 se lance a fin de año para que también se actualice la fecha de corte del conocimiento
    • Se supone que originalmente iban a lanzar 3.5 Pro justo después de 3.5 Flash, pero cuando Mythos/Fable y GPT-5.6 salieron con mayor rendimiento, supongo que la dirección decidió posponer la publicación
  • Es menos inteligente y más caro que GLM-5.2, y además sus pesos no son públicos

    • Como también soporta visión y audio, sería más adecuado compararlo con otros grandes modelos abiertos chinos que son mejores y más baratos que Gemini Flash
    • Los modelos de Google siempre se expresan con fluidez y son mucho más cómodos para conversar. He usado muchos modelos con pesos abiertos, pero esta diferencia es clara
    • A cambio, la velocidad es unas 15 veces mayor
    • El precio y la inteligencia son más o menos similares a GLM 5.2, pero es unas 8 veces más rápido
  • Da miedo depender de los modelos de Google. Ejecutaba tareas sensibles al precio con Flash 2.5 Lite, pero ya fue descontinuado, y su reemplazo, 3.1 Flash-Lite, es mucho más caro y además ya tiene fecha de fin de soporte
    Como 3.5 Flash-Lite es todavía más caro, no queda otra que seguirles el paso aunque el precio siga subiendo

    • Me pasé directamente de 2.5 Flash-Lite a DeepSeek v4 Flash. Ya es más barato, y si haces bien el prompt caching puedes reducir mucho más el costo
    • Desde lo de Firebase, no quiero depender de productos de Google, especialmente de GCP, en el negocio. Las funciones se quedan durante años en beta, a menudo con un significado poco claro, y las funciones lanzadas formalmente se eliminan rápido
      Los competidores, incluso si descontinúan servicios, al menos los retiran de la portada, llenan toda la documentación de avisos y recomiendan cortésmente no usarlos en proyectos nuevos
    • Reemplazar modelos no es una gran molestia, y también se pueden conseguir modelos más baratos que 2.5 Lite con el mismo nivel de inteligencia
    • Las grandes empresas prefieren hacer negocios con otras grandes empresas antes que con startups. Parece que Google cree que puede tomar estas decisiones gracias a esta preferencia de los clientes empresariales
    • Me pregunto si es un entorno donde no se puede usar DeepSeek
  • Todavía no hay noticias de una actualización para Jules, que sigue en 3.1 Pro. Puede ser un producto de nicho, pero me servía para dar instrucciones desde el celular y, 15 minutos después, revisar y fusionar un PR de GitHub, así que era útil para proyectos personales durante el trayecto al trabajo cuando era difícil sacar la laptop
    Estoy buscando una alternativa decente

    • Tanto Claude como Codex soportan coding en la nube y funcionan bastante bien. Jules tenía una buena idea, pero la inteligencia del modelo era muy insuficiente
    • Me preguntaba si Jules era un proyecto muerto. Parecía interesante, pero casi no hubo desarrollo, anuncios ni discusión, y la última actualización del registro de cambios también es el soporte para 3.1 Pro de marzo
    • Superconductor, que probé hace unos meses, me recordó a Jules. Puede que sus funciones sean excesivas, pero tiene un plan gratuito y no parece muy probable que lo abandonen pronto
    • Si tienes equipo como una Raspberry Pi, puedes usar la combinación iSH sobre Hermes + Tailscale + tmux
    • Claude Code es una alternativa
  • No entiendo por qué la web de Gemini todavía no soporta connectors, MCP ni plugins. Para un uso serio, queda descartado desde el inicio