- Un modelo open source de 9B para revisión de catálogos de comercio electrónico, ajustado con aprendizaje por refuerzo por unos 500 dólares, obtuvo una puntuación superior a la de todas las configuraciones de modelos frontier usando las mismas herramientas, imágenes y evaluador
- En un gemelo digital creado con 177,767 episodios de revisión, repitió clasificación de productos, verificación de marca, extracción de atributos y decisión de políticas, haciendo que el modelo aprendiera en sus pesos la taxonomía y los criterios de decisión propios de la empresa
- El modelo entrenado con GRPO logró 87.3% de la puntuación máxima alcanzable, un 13.5% relativo por encima del 76.9% de la mejor configuración frontier, y una mejora del 36% frente al 64.2% del modelo base sin entrenamiento
- El costo fue de unos 0.50 dólares por cada 1,000 productos, 40 veces más barato que la configuración frontier más económica y unas 340 veces más barato que la más costosa; a escala de 40 millones de casos al día, la diferencia anual es de unos 7 millones frente a 500 millones de dólares
- Esto encaja en trabajos masivos y repetitivos cuyos resultados pueden validarse con reglas, pruebas y rúbricas; los hechos cambiantes deben quedarse en herramientas de búsqueda, mientras que la forma de decidir propia de la empresa debe aprenderse en el modelo
La forma de operar que define el retorno de inversión en IA
- Desde el lanzamiento de ChatGPT, el uso de IA se ha expandido desde tareas de bajo riesgo como resumir documentos o redactar correos, hacia desarrollo de software, generación de contenido y la idea de un company brain que conecte conocimiento, datos y herramientas internas
- En datos de clientes de Ramp, las empresas en el 25% superior de gasto en IA duplicaron sus ingresos entre noviembre de 2022 y diciembre de 2025, mientras que las empresas sin gasto en IA crecieron alrededor de 15% en el mismo periodo
- En las organizaciones que sí obtienen resultados, se repiten los siguientes modos de operación
- Rediseño del flujo de trabajo: no basta con añadir un modelo al proceso existente; hay que rediseñar aprobaciones, revisiones, traspasos y puntos de intervención humana
- En la encuesta de McKinsey de 2025 sobre organizaciones que usan IA generativa, el rediseño del flujo de trabajo mostró la correlación más alta con el impacto en EBIT, pero solo 21% de las organizaciones había rediseñado al menos un proceso
- Fomentar la experimentación: como los modelos, herramientas y mejores prácticas cambian rápido, hay que recompensar no solo los lanzamientos exitosos, sino también compartir experimentos y fracasos
- Contexto de trabajo personalizado: el acceso a datos, el control de acceso por solicitud, la búsqueda de evidencia relevante y la gestión de ventanas de contexto cuyo uso se vuelve desigual mientras más crecen, se convierten en retos de ingeniería aparte
- Medir uso e impacto: sin evaluaciones calificadas sobre datos propios, es difícil demostrar rendimiento, costo de decisión e impacto en eficiencia, y las cifras de ahorro de tiempo reportadas por los usuarios también pueden ser inexactas
- Rediseño del flujo de trabajo: no basta con añadir un modelo al proceso existente; hay que rediseñar aprobaciones, revisiones, traspasos y puntos de intervención humana
El modelo de despliegue para “poseer la inteligencia”
- La configuración que más se repite usa modelos open source, datos de trabajo propios de la empresa y aprendizaje por refuerzo sobre flujos de trabajo calificables
- Los modelos frontier se usan para verificar el potencial de automatización y establecer una línea base inicial
- Durante las llamadas se acumulan registros de entradas, decisiones y correcciones, que luego se convierten en datos de entrenamiento para modelos especializados
- Una vez que se supera la etapa de prototipo y se entra en operación a gran escala, el costo por llamada y el rendimiento pasan a ser la prioridad
- Los modelos frontier y los especializados no son sustitutos completos entre sí
- Modelos generales como ChatGPT o Claude pueden delegar en modelos especializados las partes que requieren conocimiento interno
- Los modelos especializados también pueden llamar a modelos frontier en tareas que exigen capacidades generales más altas
- El modelo trabaja con las herramientas y datos de la empresa, la rúbrica (rubric) califica el resultado y la señal de recompensa actualiza el modelo
- Al repetir decenas de miles de tareas, los criterios de decisión del trabajo quedan fijados en los pesos
- Los hechos cambiantes, como precio, inventario o documentos de políticas, se mantienen en herramientas
Casos reales de despliegue de modelos especializados
- Bridgewater Associates entrenó un modelo open source con etiquetas de inversionistas expertos para decidir si artículos, divulgaciones y correos estaban relacionados con una tesis de inversión y dónde empezaban las frases trilladas
- Solo con prompts no pudo reflejar de forma estable los criterios internos de juicio
- El modelo entrenado tuvo cerca de 30% menos errores que el mejor modelo frontier, además de menor costo de inferencia
- Harvey aplicó modelos de pesos abiertos y aprendizaje por refuerzo a tareas como due diligence de transacciones y redacción de memorandos legales, donde los errores se acumulan a lo largo de varias etapas
- En su propia rúbrica, el agente legal superó a GPT-5.5 y Claude Opus 4.8
- Intercom Fin Apex fue afinado posteriormente con miles de millones de interacciones de servicio al cliente para mejorar el costo por llamada y la tasa de resolución a una escala de unos 2 millones de problemas de clientes por semana
- Intercom afirma que resuelve más problemas que el mejor modelo frontier y con menor costo operativo
- El proceso de despliegue común consiste en crear primero una línea base con un modelo frontier optimizado con prompts y contexto, y luego trasladar los registros de ejecución y lo aprendido a un modelo pequeño cuyos datos de entrenamiento pertenecen a la empresa
Integridad del catálogo y problema de costos
- Los catálogos de comercio electrónico deben ubicar cada producto en la taxonomía correcta y extraer con precisión, desde imágenes y descripciones, los atributos que se usan en búsqueda, filtros, recomendaciones y operaciones posteriores
- Las decisiones incorrectas reducen la capacidad de encontrar productos, empeoran la calidad de las recomendaciones y hacen que se pasen por alto violaciones de políticas
- Si se dejan pasar productos falsificados, clientes y marcas quedan expuestos a fraude
- Si se marca en exceso producto legítimo, aumentan la cola de revisión y la fricción para los vendedores
- La escala del trabajo también es grande
- eBay tiene unos 2.5 mil millones de productos activos
- El catálogo de Shopify recibe más de 10 millones de actualizaciones de productos al día
- Walmart estima que realizar trabajo de catálogo asistido por IA solo con personas habría requerido unas 100 veces más personal
- 71% de los consumidores dice haber devuelto un producto porque el artículo real no coincidía con el listado
- Si un marketplace mediano procesa alrededor de 10 millones de creaciones o modificaciones de productos al día, la revisión basada en modelos frontier se estima en unos 500 millones de dólares al año, mientras que un modelo especializado ajustado rondaría los 10 millones de dólares
- Shopify usa un modelo abierto ajustado para realizar cerca de 40 millones de inferencias de clasificación de productos al día, porque hacerlo con APIs comerciales no resulta económicamente viable
Tareas del agente de revisión de catálogo
- Mientras revisa un producto, el agente busca la taxonomía, verifica la marca, obtiene el esquema de atributos de esa categoría y luego confirma una decisión estructurada
- Si la evidencia es insuficiente o el riesgo es alto, lo envía a revisión humana
- En el caso de guantes de trabajo, el proceso sigue esta secuencia
- Busca la categoría
Safety Work Glovesconsearch_taxonomy - Confirma con
lookup_brandque AmazonBasics está registrada, pero no es una marca protegida - Consulta con
get_attribute_schemalos atributos de marca, color, material y talla - Confirma la categoría y atributos junto con una decisión
allowed
- Busca la categoría
- El costo de omitir una infracción real se fijó 7 veces más alto que el de un falso positivo, para entrenar ambos errores de manera asimétrica
Gemelo digital para entrenamiento
- Usando imágenes y listados de productos reales de Amazon Berkeley Objects, se construyeron 177,767 episodios de revisión
- Cada episodio incluye imagen, título, descripción, marca declarada y región
- Se insertaron como casos negativos difíciles violaciones de políticas controladas, imágenes que no coinciden, afirmaciones de marca en conflicto y también afirmaciones legítimas
- Todos los episodios tienen una respuesta correcta calificable
- El entorno que usa el modelo reproduce el trabajo de un analista real
- Busca en unas 13,000 categorías
- Verifica si una marca está registrada o protegida
- Recupera los atributos requeridos para la categoría elegida
- Confirma la categoría final, los atributos y la decisión de política
- El evaluador recompensa respuestas correctas y penaliza omitir infracciones, atributos sin sustento, categorías incorrectas y llamadas innecesarias a herramientas
- Para que el aprendizaje por refuerzo funcione, debe existir un entorno que replique listas, herramientas y costos de decisión del trabajo real, y permita repetir fallos y reintentos
Línea base con modelos frontier
- Se compararon GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8 y Claude Fable 5 en 200 episodios de validación estratificados
- A todos los modelos se les aplicaron las mismas herramientas, imágenes, evaluador y presupuesto de turnos
- Se probaron por separado un prompt base y un prompt optimizado con 2,800 caracteres de reglas de extracción, procedimiento de consulta y ejemplos
- La mejor configuración frontier logró 76.9% de la puntuación alcanzable, mientras que el modelo de 9B entrenado con GRPO alcanzó 87.3%
- En cada episodio, los modelos frontier tenían que reconstruir desde el prompt la taxonomía de la tienda, las convenciones de inventario, los valores de atributos soportados y el manejo de excepciones
- Con instrucciones optimizadas se podía comprimir parte del conocimiento, pero no era posible enumerar todas las excepciones que definían la puntuación
- Las configuraciones frontier optimizadas convergieron dentro de 0.1 puntos porcentuales entre sí
- Gemini, que tenía el mejor rendimiento de extracción zero-shot, empeoró tras aplicar instrucciones optimizadas
- Según el modelo, las instrucciones adicionales aumentaron el costo de tokens de entrada por llamada entre 28% y 55%
- El conocimiento del trabajo incluido en el prompt cuesta en cada llamada; el conocimiento aprendido se mantiene en los pesos
Entrenamiento GRPO de 500 dólares
- Para el entrenamiento se rentaron dos GPU RTX PRO 6000: una para generar rollouts y otra para actualizar gradientes
- La infraestructura se montó con prime-rl, de código abierto
- El entrenamiento completo tomó 1,000 pasos de optimización, alrededor de 3.5 días y unos 500 dólares en costo de GPU
- Con solo unos 250 pasos y alrededor de un día de entrenamiento, ya superaba el rango de los modelos frontier
- Los pasos restantes se usaron para extraer el máximo rendimiento
- La puntuación final en el benchmark estricto fue 0.626, equivalente al 87.3% del límite superior alcanzable, unos 10 puntos porcentuales por encima de la mejor configuración frontier
- En el monitor de entrenamiento de W&B, subió desde cerca de 0.50 hasta 0.671 en 1,000 pasos
- Ese monitor usa 2 rollouts de muestra por episodio, por eso puntúa un poco más alto que el harness estricto del benchmark
- El modelo base de 9B sin entrenamiento estaba en 64.2% de la puntuación máxima, y tras el ajuste subió a 87.3%, una mejora relativa de alrededor de 36%
- El modelo especializado aprende la relación entre taxonomía, herramientas, políticas y recompensas, concentrando su capacidad en el comportamiento de un entorno específico, a costa de sacrificar capacidad general
- Cuando aparezcan modelos open source base más fuertes, se podrá transferir el mismo método de entrenamiento, y las decisiones registradas en producción también podrán destilarse como datos de ajuste supervisado para reentrenamientos posteriores
Comparación de costo y calidad
- El costo de inferencia del modelo especializado es de unos 0.50 dólares por cada 1,000 productos, y con el ajuste obtiene una puntuación unos 23 puntos porcentuales más alta que el modelo base de 9B al mismo costo
- La diferencia de costos frente a los comparados es la siguiente
- Gemini, la configuración frontier más barata, cuesta 19 dólares por cada 1,000 y es 40 veces más caro que el modelo especializado
- GPT-5.5-pro, la más costosa, cuesta 172 dólares por cada 1,000 y es unas 340 veces más caro
- La configuración con mejor puntuación frontier cuesta 34 dólares por cada 1,000 y es 68 veces más cara que el modelo especializado
- Las instrucciones de 2,800 caracteres aumentaron el costo medido de GPT-5.5 en alrededor de un tercio, y este impuesto de prompt se repite en todas las llamadas posteriores
- Si se procesan unos 40 millones de casos al día, una configuración de 34 dólares por cada 1,000 cuesta alrededor de 500 millones de dólares al año, mientras que el modelo especializado de 0.50 dólares cuesta unos 7 millones, una diferencia de costo de alrededor de 98%
Tareas adecuadas y áreas que conviene evitar
- Las tareas adecuadas son trabajos masivos y repetitivos donde se transforma información en una decisión
- Enrutamiento de tickets
- Extracción de campos de documentos
- Inspección de envíos según políticas
- Clasificación de productos
- Aprobación o marcado de transacciones
- La condición clave es si puede verificarse que cada decisión es correcta o incorrecta mediante reglas, esquemas, pruebas, rúbricas o juicio experto
- Las decisiones calificables permiten que el modelo practique
- Los resultados sobre los que solo se puede debatir sin acuerdo no pueden entrenarse con este enfoque
- La herramienta se elige según frecuencia y verificabilidad
- El ajuste es adecuado para tareas frecuentes y verificables
- Los modelos frontier optimizados con prompts son adecuados para tareas verificables pero poco frecuentes
- En resultados no verificables debe intervenir un humano
- Si el núcleo del problema no es el juicio sino los hechos cambiantes, entonces la búsqueda aumentada es lo adecuado sin importar la frecuencia
- Si se cumple una o más de las siguientes condiciones, puede ser un buen candidato para ajuste fino
- El costo por llamada y los errores se acumulan a escala suficiente como para convertirse en costo real
- Todos los resultados pueden verificarse sin humanos mediante reglas, pruebas o rúbricas
- Los expertos están de acuerdo sobre el criterio de respuesta correcta
- Un modelo competente tiene éxito parcial, pero no es lo bastante consistente para ser confiable
- La respuesta correcta no puede aparecer por adivinación casual
- La tarea se compone de varias etapas de razonamiento, llamadas a herramientas y decisión final
- Se ejecuta sobre herramientas, esquemas y políticas propias
- El costo varía según el tipo de error
- No se pueden enviar datos sensibles a una infraestructura fuera de control
- Si el modelo se ejecuta dentro de los propios límites de la organización, los prompts y registros no se envían a proveedores externos, y es posible poseer y mejorar conjuntamente modelo, evaluación y datos
Casos de modelos especializados en otras industrias
- Cognition afirma que su modelo para escribir y modificar software de producción supera a GPT-5.5 en benchmarks estándar de programación y transmite 1,000 tokens por segundo
- AT&T resume 900,000 llamadas de soporte al día y marca información personal
- Tiene 17% mejor desempeño que GPT-4o en detección de datos personales
- Revisa casos de fraude 12 veces más rápido con precisión de nivel GPT-4o y ahorra millones de dólares al año
- LinkedIn afirma que su modelo de emparejamiento entre candidatos y vacantes es 4% más preciso que el modelo GPT que reemplazó
- Es 75 veces más barato que GPT-4 y 6 veces más barato que GPT-4o
- Ambience Healthcare afirma que su modelo para códigos de facturación médica es más preciso que 18 médicos especialistas en una prueba con panel dorado
- Supera por 12 puntos porcentuales al enfoque base con prompts o4-mini
- Phonely afirma que su modelo de atención telefónica alcanzó 99.2% de precisión, por encima del 94.7% de GPT-4o
- Respondió 73% más rápido que su configuración anterior con GPT-4o, y un cliente reemplazó 350 agentes humanos en un mes
- OpenPipe afirma que su modelo para correos y tickets de soporte logró 93% en QA de soporte, por encima del 50% de OpenAI o3
- Es 64 veces más barato y 5 veces más rápido que o3
- Perplexity Sonar afirma que en respuestas de búsqueda con fuentes incluidas está a la par de GPT-4o en pruebas ciegas con usuarios
- Es 10 veces más rápido y también más barato que GPT-4o
- Checkr afirma que su modelo de clasificación de antecedentes penales supera a GPT-4 en los casos más difíciles
- Es 5 veces más barato y 30 veces más rápido que su configuración previa con GPT-4
- Todas estas cifras son resultados reportados por las propias empresas tomando como referencia los modelos frontier que reemplazaron o contra los que compitieron
2 comentarios
Es parte de la psicología humana querer dárselo todo a una sola persona para que se encargue bien de todo, en vez de buscar un experto para cada caso y asignarle solo su parte del trabajo.
¿No será que, con los LLM, la función de recompensa inevitablemente termina diseñada para que acepten cualquier cosa que les tires?
Comentarios en Hacker News
El punto clave que los grandes laboratorios de investigación pasan por alto es que, para la mayoría de los casos de uso, no se necesita conocimiento al nivel de 50 doctores y dominio de 12 idiomas, mientras que las restricciones de costo importan mucho más
Si los modelos de pesos abiertos y el ajuste fino barato se vuelven algo común, la viabilidad económica de los modelos gigantes y de la infraestructura masiva financiada con deuda se derrumba
La política o el discurso de la amenaza china son solo pretextos superficiales; si los modelos pequeños de pesos abiertos se vuelven el estándar, será difícil que los grandes laboratorios sobrevivan
La parte realmente cara del ajuste fino es reunir un buen dataset, y aun con datos limpios hace falta capacidad para ejecutar evaluaciones y medir la calidad
Si se suman los costos de ingeniería, etiquetado de datos y revisión continua de calidad, en muchos casos sale más barato seguir usando modelos de laboratorios de punta que ya funcionan bien desde el inicio
Se parece a cuando hace unos 10 años se hicieron públicas las entrevistas de FAANG y todos empezaron a copiarlas tal cual
La idea es que seguir aumentando pesos y metiendo hardware, como ahora, es un callejón sin salida, y que al final se volverá a algoritmos adaptados al objetivo, como siempre ha pasado en la historia de la IA
Estoy creando TinyToT para demostrar que no hacen falta tantos parámetros
Cada vez que veo este tipo de historias, hay dos cosas que me hacen ruido
Primero, he visto varias veces que aprovechar mejor el modelo existente o simplemente no hacer nada y esperar da mejores resultados que reentrenar. La comparación no debería ser contra el modelo de punta actual, sino contra el siguiente modelo que saldrá mientras mantienes el modelo ajustado
Segundo, 500 dólares de entrenamiento es la partida más barata; generar los datos y luego mantener el modelo cuesta mucho más. Dudo cuántos casos de uso realmente pueden producir 177 mil episodios puntuados
Aquí hubo que sintetizarlos con Amazon Berkeley Objects, y si esos datos hubieran existido de forma natural, ni siquiera habría hecho falta crearlos; ese mismo dataset muestra mejor que nada la dificultad de aplicar ajuste fino
Igual que hardware especializado como las GPU sigue usándose después del avance de las CPU, es muy probable que los modelos especializados sigan siendo superiores a los generales en costo o en resultados
Si el entrenamiento inicial cuesta 500 dólares, el reentrenamiento continuo en sí es relativamente barato. Generar nuevos ejemplos según cambian los datos cuesta más, pero puede reutilizarse para entrenar el siguiente modelo, y de todos modos hace falta cierto nivel de eso para evaluar cambios de modelo y de prompts
En última instancia, no siempre tiene sentido por el costo de generar datos, entrenar o por la falta de datos; como muestra la tabla del artículo, solo encaja en tareas frecuentes y verificables. Quizá solo sea realista para grandes empresas que procesan millones de decisiones
Los costos de mantener datasets y modelos también se están volviendo servicios genéricos a través de startups como Braintrust o Hugging Face
Los modelos de punta son muy buenos para eliminar sus propios empleos
Incluso ya en GPT, Luna cubre el 90% del uso de Sol. La razón por la que China sigue invirtiendo esfuerzo en la destilación de modelos es la generación de datos de entrenamiento precisos, y OpenAI y Anthropic pasaron años reuniéndolos mientras evitaban problemas legales
Cuanto más inteligentes se vuelven los modelos, más se migra a alternativas baratas que hacen el trabajo suficientemente bien. Si la precisión ya es de 99%, casi no hay beneficio real en usar un modelo de punta, y ese parece ser el mayor riesgo para los laboratorios de EE. UU.
Para otras tareas, basta con usar modelos más baratos
Igual que no pienso cambiar una TV LCD que compré alrededor de 2018, otras tecnologías son parecidas
La tecnología tiende a reemplazar tecnologías nuevas o a entrar en espacios vacíos, pero rara vez reemplaza ámbitos no tecnológicos como la interacción humana. Incluso las actividades de ocio frente a una pantalla en general apuntan a relaciones parasociales
Me interesa mucho el ajuste fino de modelos abiertos, así que estoy buscando materiales que pueda recomendar personalmente, y guardé este texto para leerlo con detalle
Ejecuté Nemotron-3-Nano 30B en local y apunto a modelos de 30 mil a 120 mil millones de parámetros. Incluso el modelo base ya puede generar valor real, pero creo que el entrenamiento puede cerrar la última brecha en tareas especializadas
Me gusta especialmente que el autor piense en todo el proceso, y pude confirmar el mismo caso de uso y la misma estrategia de creación de valor. Como es un proyecto de largo plazo, también planeo comprar hardware para ajuste fino
No leí el artículo de Ramp, pero parece un sesgo de supervivencia/post hoc. Puede que una empresa con el doble de ingresos sí tenga dinero para gastar en IA, mientras que una con 1.15 veces no.
Afinar LLM pequeños o modelos de lenguaje más chicos como BERT se ha recomendado desde los primeros días del auge de los LLM. Tiene ventajas claras: se ejecuta rápido, permite controlar toda la pila tecnológica y se adapta mejor a dominios personalizados.
Pero en la práctica no se afina tanto, porque las API de modelos de lenguaje grandes siguen siendo baratas, suficientemente rápidas y continúan mejorando. Apenas inviertes tiempo y dinero en lanzar un modelo especializado, puede aparecer un nuevo modelo generalista que lo supere.
Algún día, si el avance de los LLM se desacelera o los precios de las API se vuelven difíciles de sostener, volverá la era del fine-tuning y los modelos pequeños.
Me gusta la matriz 2×2 que muestra cuándo conviene afinar un modelo y cuándo usar uno de frontera.
Aun así, no queda claro cómo el evaluador asignó la puntuación de cada episodio. Si un modelo de frontera hizo la calificación, me pregunto si la evaluación seguiría siendo válida incluso después de que el modelo afinado terminara haciendo la tarea mejor que ese modelo.
Ayuda primero destilar la distribución de probabilidad completa del flujo de trabajo especializado por dominio desde un modelo abierto más grande como Kimi K3, y luego aplicar al resultado un pipeline propio y privado de aprendizaje por refuerzo. Nosotros usamos GLM 5.2 para crear un modelo privado de 27B para inglés→SQL y obtuvimos mejores resultados que Fable, aunque se perdió la capacidad de explicación.
En áreas altamente especializadas, no es tan difícil superar a un modelo de frontera con una fracción mínima del costo. Incluso sin un pipeline propio de aprendizaje por refuerzo, solo con destilación se puede ahorrar mucho dinero, y un modelo de 27B puede acercarse a uno de 3T en esa tarea.
Pero es muy probable que esto no funcione para tareas demasiado ambiciosas para encajar en un modelo experto.
Últimamente he estado obsesionado con investigación automatizada para llevar el 3B Foundation Model de Apple al nivel de Sonnet 4.6 en una tarea muy específica.
Combinando adaptadores de fine-tuning con un paso determinista, lo llevé hasta alrededor del 90%.
Todo el proceso, incluidas preguntas y respuestas, 96 experimentos y su linaje, está resumido en https://alexisrondeau.me/tada/research/FMDiscovery/dashboard...
El cuello de botella no estaba en el tamaño del modelo, sino en que alguien que realmente entendiera el problema definiera la función de recompensa.
Hay muchos buenos lenguajes de programación para definir soluciones, pero me pregunto dónde está el lenguaje para definir claramente los problemas.