- Poolside presentó Laguna S 2.1, reforzando la capacidad para trabajos de larga duración y razonamiento. Activa 8B de parámetros por token dentro de un total de 118B MoE, y soporta hasta 1M de tokens de contexto tanto en modo thinking como no-thinking
- Desde el inicio del entrenamiento hasta el lanzamiento pasaron menos de 9 semanas; registró 70.2% en Terminal-Bench 2.1, 78.5% en SWE-Bench Multilingual y 40.4% en DeepSWE v1.1, compitiendo con modelos más grandes
- El eje de la mejora de rendimiento no está tanto en escalar el modelo, sino en la persistencia, verificación y reintento tras retroceder. Busca reducir las declaraciones prematuras de finalización y el sobreajuste a un solo harness con rollouts más largos, un sandbox mejorado y varios harnesses de agentes
- En tareas reales, construyó un motor de renderizado HTML/CSS en 181 pasos, aumentó en 5.2% la velocidad de su propio harness mientras reducía la asignación de memoria en cerca de 70%, y redescubrió de forma independiente una familia infinita de soluciones para el problema #397 de Erdős
- Publicó las trayectorias completas de ejecución del modelo y de la evaluación final, aunque hay restricciones en las especificaciones de herramientas de harnesses de terceros, el JSON de llamadas anidadas de herramientas y razonamientos excesivamente largos. Los pesos y hasta 1M de contexto están disponibles en Hugging Face y en los principales frameworks y servicios de hosting de inferencia
Arquitectura del modelo y velocidad de lanzamiento
- Laguna S 2.1 es un modelo Mixture-of-Experts con 118B de parámetros totales y 8B de parámetros activos por token
- Soporta hasta 1M de tokens de contexto tanto en modo thinking como no-thinking
- Tomó menos de 9 semanas desde el inicio del entrenamiento hasta el lanzamiento
- El 22 de mayo de 2026 comenzó el preentrenamiento en 4,096 GPU NVIDIA H200 y se publicó 60 días después
- Gracias a su pequeño tamaño activo, puede ejecutar tareas complejas en sistemas locales, e incluso correr en una sola NVIDIA DGX Spark
Rendimiento en benchmarks de codificación de larga duración
- Los principales resultados al 21 de julio de 2026 son los siguientes
- Terminal-Bench 2.1: 70.2%
- SWE-Bench Multilingual: 78.5%
- Dataset público de SWE-Bench Pro: 59.4%
- DeepSWE v1.1: 40.4%
- SWE Atlas (Codebase QnA): 46.2%
- Toolathlon Verified: 49.7%
- Terminal-Bench 2.1 evalúa varias tareas largas en las que el agente interactúa con el entorno vía terminal, y Laguna S 2.1 obtuvo 70.2% en el harness pool con thinking activado
- En benchmarks maduros, los puntajes más altos suelen concentrarse entre 70% y 90%, por lo que modelos con conductas muy distintas pueden diferir solo por unos pocos puntos
- DeepSWE dificulta las soluciones parciales e incluye tareas más largas, por lo que la dispersión de puntajes es mayor
- En v1.1, los modelos de frontera registran entre 54% y 73%, mientras que algunos modelos abiertos de más de 1T quedan por debajo de 10%
- Laguna S 2.1 registró 40.4% en su propio harness pool
- Como usó su propio harness en lugar del mini-swe-agent de la tabla oficial, no es una comparación completamente equivalente con los puntajes de otros modelos
- Para los demás modelos se usó el puntaje máximo entre sus anuncios propios, la tabla del benchmark y Artificial Analysis
- Todas las trayectorias de ejecución de la evaluación final están publicadas en trajectories.poolside.ai
Método de evaluación y control del reward hacking
- En la evaluación de agentes existe el problema de reward hacking, donde se obtienen puntos buscando en línea la respuesta o correcciones ya existentes
- El acceso a internet está permitido por defecto, y se usa un juez LLM calibrado con trayectorias etiquetadas por humanos (LLMaaJ) para marcar casos sospechosos
- En el post-entrenamiento inicial, la tasa de reward hacking era menor a 2%
- A medida que avanzó el entrenamiento, las trayectorias marcadas en la familia SWE-bench superaron 50%
- La investigación manual mostró que en muchos casos el modelo encontraba el PR o repositorio base del problema y aplicaba la corrección real existente
- Tras añadir al prompt del usuario una indicación de no usar respuestas directas encontradas en línea, la tasa de reward hacking bajó en general a menos de 2%
- No es una solución completa, y hubo excepciones en ProgramBench y MirrorCode
- La verificación adicional incluyó investigación manual de éxitos marcados por LLMaaJ, análisis abierto de agentes sobre trayectorias completas y revisión experta de todas las ejecuciones de alto puntaje en Terminal-Bench 2.1
- Recientemente reforzaron la detección de reward hacking con revisión adversarial, y las trayectorias de evaluación final del checkpoint público pueden consultarse y descargarse
Casos de trabajo reales
-
Construcción de un motor de navegador desde una carpeta vacía
- Laguna S 2.1 construyó un motor de renderizado HTML/CSS desde una carpeta vacía sin intervención humana, ejecutando 181 pasos durante 50 minutos
- Sin capacidades visuales, leyó el canvas con Chromium headless y comparó numéricamente capturas de pantalla para verificar el resultado
- Implementó todo el pipeline en Vanilla JavaScript
- Tokenizador HTML y árbol DOM
- Parser CSS con manejo de prioridad de selectores
- Motor de cascada con soporte de herencia
- Layout del modelo de cajas y renderizador Canvas 2D
- Se completó como una app que muestra lado a lado 9 ejemplos del mismo marcado en su propio canvas y en un iframe del navegador
- Publicó la trayectoria completa de ejecución
-
Optimización de su propio harness de agente
- En un loop automatizado de investigación instrumentado con benchmarks, midió el rendimiento tras cada cambio y restringió la retención solo a cambios con mejora confirmada
- A lo largo de varias horas, aceleró el harness en 5.2% y redujo la asignación de memoria en alrededor de 70%
- Las optimizaciones principales fueron las siguientes
- Reemplazó con buffers la concatenación de strings O(n²) usada para acumular tokens en streaming
- Eliminó copias redundantes en la materialización de trayectorias mediante memoización
- Preasignó slices con el tamaño exacto para reducir sobreasignación
- Cuando la diferencia de velocidad se volvió difícil de medir, cambió el foco a optimizar asignación de memoria, que podía medirse con mayor precisión
- El benchmark usado no era una prueba de producción completa, pero validó el resultado final con compuertas de Go race detector y
go vet, y verificó el funcionamiento del artefacto - Proporcionó la trayectoria completa de ejecución
-
Redescubrimiento del problema #397 de Erdős
- Encontró de forma independiente una construcción que genera una familia infinita de soluciones para el problema #397 de Erdős, propuesto en 1975 por Erdős, Graham, Ruzsa y Straus
- El problema estuvo sin resolver por más de 50 años hasta que GPT-5.2 Pro lo resolvió primero en enero de 2026, así que no es la primera solución sino un redescubrimiento
- La fecha límite de conocimiento del modelo es noviembre de 2025 y, al no haber Python en el sandbox, encontró Perl y trabajó durante 68 minutos
- El proceso de resolución fue el siguiente
- Hizo búsqueda exhaustiva de factorización prima exacta
- Analizó patrones y conjeturó una familia de soluciones
- Probó una familia infinita cerrada formada por 8 índices
- La expresión encontrada es la siguiente para todo
n ≥ 0
B(11+10n) · B(14+12n) · B(18+15n) · B(22+20n) = B(12+10n) · B(13+12n) · B(17+15n) · B(23+20n)- A diferencia de la familia previa de 6 índices, usa una estructura de 8 índices con crecimiento lineal
- Publicó la trayectoria completa de ejecución
Modos de razonamiento y diferencias de rendimiento
- Hay dos modos de razonamiento: off y max, que es el valor por defecto
- En max, el modelo decide el presupuesto de razonamiento y cómputo en tiempo de prueba según cada problema
- Se observaron casos donde sostuvo razonamiento consistente durante horas y cientos de miles de tokens
- Usar max thinking eleva mucho el rendimiento
- Terminal-Bench 2.1: 60.4% → 70.2%
- DeepSWE: 16.5% → 40.4%
- En el lanzamiento no ofrece control personalizado de intensidad de razonamiento tipo low, medium o high
- En
pool, el uso de thinking puede alternarse por sesión con el comando/thought-level
Limitaciones conocidas
- Debido al sobreajuste del harness, al llamar por primera vez herramientas parecidas a su propio harness pero con especificaciones distintas en detalles, como la herramienta de terminal de Hermes Agent, puede apoyarse en recuerdos de la interfaz previa
- Si el harness rechaza la llamada incorrecta y pide reintento, normalmente lo corrige mediante aprendizaje en contexto
- Usa un formato de llamadas a herramientas basado en etiquetas parecido a XML, y cuando los argumentos requieren arreglos JSON puede escapar mal o generar JSON inválido
- En particular, puede razonar durante demasiado tiempo sin avanzar, especialmente en problemas de matemáticas competitivas
- Planean introducir control de intensidad de razonamiento y mejoras de eficiencia en modelos posteriores
Cambios de entrenamiento que mejoraron el rendimiento
-
Mejoras en la forma de trabajar más que en el tamaño del modelo
- El objetivo no es solo añadir más inteligencia, sino reforzar conductas de verificar más, no dar cosas por sentadas y no declarar éxito demasiado pronto
- Modelos Laguna anteriores a veces declaraban finalización cuando pasaban algunas pruebas o abandonaban un enfoque justo antes del éxito, pero S 2.1 sigue trabajando
- Consideran que, además de la inteligencia bruta, la persistencia, la verificación y la disposición a retroceder son ejes clave del rendimiento, y están invirtiendo en ambos frentes
- El siguiente gran modelo Laguna ya comenzó el preentrenamiento
-
Preentrenamiento y post-entrenamiento
- Es un modelo ampliado que usa los mismos datos de preentrenamiento que Laguna XS 2.1
- La diferencia respecto a XS 2.1 está en la escala, ajustes del código de entrenamiento y pequeños cambios en la receta de entrenamiento, no en nuevos datos
- Por primera vez ejecutó RL en precisión FP8, acelerando esa etapa de entrenamiento
- El post-entrenamiento se realizó en dos etapas
- Ajuste fino supervisado (SFT), usando en parte datos sintéticos, para inicializar capacidades
- Aplicación de RL a tareas que aún no podían resolverse con alta tasa de acierto
- Como las sesiones largas de agente acumulan cientos de miles de tokens de contexto de trabajo, la ampliación a 1M de contexto mejora el rendimiento en tareas antes difíciles
-
Composición de tareas de post-entrenamiento
- El corpus de entrenamiento se compone de 409,000 entornos de agente y no agente
- 83,000 entornos de uso de terminal
- 168,000 tareas generales de ingeniería de software
- Obtuvieron tareas de repositorios open source, datos sintéticos internos, un sistema automático de instalación de dependencias y adquisiciones de proveedores externos de datos
- Las tareas de ingeniería de software se basan principalmente en historiales reales de código
- La parte más grande corresponde a unas 38,000 tareas que reproducen commits reales de alrededor de 17,000 repositorios
- También incluye reproducción de PRs fusionados, corrección de bugs inyectados y tareas de restauración de archivos eliminados a partir del test suite
- En S 2.1 se añadió la tarea de instalación de repositorios de agente, que instala todas las dependencias de un repositorio y ejecuta el test suite
- Las tareas de terminal usan datasets que generan entornos y desafíos no vistos en las semillas
- El corpus de entrenamiento se compone de 409,000 entornos de agente y no agente
-
Mejoras en el loop de entrenamiento
- Aplicó un presupuesto de rollout mayor que en modelos previos, aumentando límite de tiempo, tokens por turno y número de turnos por tarea
- Migró RL a un nuevo servicio de sandbox para aprovechar estas funciones
- Soporte para procesos en segundo plano
- Bloqueo opcional de red para reducir la superficie de reward hacking
- Caché de artefactos para evitar sobrecarga de servicios externos
- Ejecuta el mismo prompt en varios harnesses de agentes para aprender conductas que funcionen en distintos harnesses, no solo en un scaffold único
Las dos direcciones en las que se enfoca Poolside
- La primera es la capacidad de coding con agentes
- Considera el coding y la interfaz flexible con software como una ruta hacia la inteligencia
- Se enfoca en casos donde el modelo usa software como agente y trabaja de forma consistente durante horas o días
- La segunda es el enfoque de que el proceso de pensamiento que llevó a una respuesta registrada en la web puede reconstruirse con aprendizaje por refuerzo
- Este lanzamiento corresponde al resultado de la primera dirección, mientras la segunda sigue en desarrollo
Model Factory y ciclo de desarrollo
- Con la plataforma interna de investigación e ingeniería Model Factory, automatiza el proceso de desarrollo del modelo, incluyendo datos, experimentos de ablación de arquitectura e infraestructura de evaluación
- En menos de 3 meses tras lanzar Laguna M.1, desarrolló un modelo más fuerte con la mitad del tamaño de ejecución
- Está invirtiendo en acelerar la iteración e integración de investigación y en reducir la atención que el personal investigador dedica a tareas administrativas e infraestructura
- Planea aplicar el mismo método de desarrollo a modelos más grandes durante el próximo año
Despliegue y formas de uso
- Está publicado en Hugging Face bajo la licencia OpenMDW-1.1
- Ofrece pesos BF16, FP8, INT4 y NVFP4
- Ofrece conversiones oficiales GGUF y MLX, y modelos borrador DFlash
- En hardware NVIDIA soporta serving con TRT-LLM, NVFP4 en Blackwell y optimización de inferencia hasta una sola DGX Spark
- El serving local y público está soportado en vLLM, SGLang y Ollama
- Las rutas de acceso hospedadas son las siguientes
- Baseten Model Library y Frontier Gateway
- OpenRouter
- Vercel AI Gateway
- El endpoint gratuito de OpenRouter ofrece 256K de contexto
- Los endpoints pagos dedicados soportan 1M de contexto
- El precio es de $0.10 por millón de tokens de entrada, $0.20 de salida y $0.01 por lectura de caché
- También puede usarse en Kilo, Hermes Agent, pi, OpenCode, OpenClaw, Cline y el agente de coding por terminal pool
- El post-entrenamiento soporta NVIDIA NeMo AutoModel y Prime Intellect Prime Lab, y ZML LLMD soporta ejecución en varios hardwares
- Los usuarios no desarrolladores pueden usar chat.poolside.ai sin iniciar sesión, con búsqueda web y ejecución básica de código
- Los pesos del modelo base previos al post-entrenamiento están disponibles por solicitud vía correo electrónico
Condiciones de ejecución de benchmarks
- Usó un fork interno de Harbor Framework, el harness de agente pool, un máximo de 500 pasos y sandbox interno
- SWE-bench Multilingual, SWE-Bench Pro y Terminal-Bench 2.1 usan pass@1 promedio de 4 ejecuciones por tarea
- DeepSWE v1.1 y SWE Atlas usan 3 ejecuciones por tarea, y Toolathlon Verified también aplica promedio de 3 ejecuciones
- SWE Atlas aplica la metodología pública tal cual y juzga con Opus 4.5
- Toolathlon Verified usó un harness replicado en EC2 y un agente personalizado, y a diferencia de la versión oficial reinicia y restaura completamente el entorno tras cada ejecución de evaluación
- Para evitar apropiación de recursos del sandbox, ajustó límites de CPU, memoria y almacenamiento según el benchmark, garantizando al menos 2 núcleos de CPU, 8GB de memoria y 25GB de almacenamiento
- Las correcciones por tarea individual están resumidas en el reporte técnico
1 comentarios
Opiniones en Hacker News
memfd_create()/mmappara IPC, y Sol también se lo perdió hasta que yo lo señalé.La comparación con DeepSeek V4 puede cambiar en un instante en un entorno que se mueve tan rápido como el actual, porque tanto Flash como Pro pronto tendrán suficiente entrenamiento posterior y se lanzarán oficialmente. Ojalá sigan saliendo modelos así.
https://github.com/mozilla-ai/otari/pull/348
Hubo evaluaciones de que la versión de 2 bits de Qwen 3.5 122B también era decente, y como este modelo parte de una base más alta, vale la pena probarlo. Ya hay alguien trabajando en eso: https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF
https://huggingface.co/poolside/Laguna-XS-2.1-GGUF/tree/main
Q4_K_Mtambién pesa 75 GB, así que aunque sea un entorno de 64 GB, no creo que lo cuantice más bajo. En cambio, conviene más mantener solo una parte de los pesos residentes en memoria y streamear el resto desde el SSD.llm-compressorque uso puede cuantizar incluso modelos que no entran en memoria, usando un pipeline secuencial.https://github.com/vllm-project/llm-compressor
Hay un ejemplo de configuración en https://github.com/verdverm/quantr. Aunque quizá ya no haga falta, porque Poolside publicó junto con el modelo versiones cuantizadas y dflash.
Hasta ahora, en Strix Halo no había una opción claramente mejor que ejecutar modelos densos como Gemma 4 o Qwen 3.6 en un escritorio con doble GPU de 32 GB, pero este modelo parece tener el tamaño para ofrecer una mejora real de rendimiento.
Incluso agregando
--default-chat-template-kwargs '{"enable_thinking": true}'a la configuración de ejecución de vLLM no se activó, y parece que el valor predeterminado demax_new_tokensen elgeneration_config.jsonincluido es 32k, por lo que corta el razonamiento; hay que aumentarlo. Al activar el razonamiento, la calidad del código mejoró mucho, aunque hace falta más validación en trabajo real.https://www.reddit.com/r/LocalLLaMA/comments/1v2pg99/laguna_...
Me gusta que Poolside no solo lo compare con modelos de una categoría similar, sino también con modelos de pesos abiertos de primera línea mucho más grandes, como Kimi-K3 de 2.5T. Ojalá otros, incluido Mistral, hicieran lo mismo.
pooly un modelo MoE de 33B. Funcionó rápido y de manera efectiva incluso en una Mac mini vieja de 32 GB, y también pienso evaluar los modelos grandes alojados.