- En la industria del software, últimamente el concepto de “Software Factory” está atrayendo mucha atención. Es un nuevo paradigma en el que agentes de IA realizan por sí mismos varias etapas de trabajo según un objetivo dado y se encargan de escribir el código fuente, mientras los desarrolladores se concentran en construir y perfeccionar el sistema —es decir, la “fábrica”— que produce ese código de manera estable y a escala.
- Dru Knox, de la empresa de herramientas de desarrollo con IA Tessl, denominó a esta nueva disciplina de desarrollo “Harness Engineering”.
- El harness, como el arnés que se le pone a un caballo, se refiere al marco completo que controla y pone en marcha a los agentes de IA. En el núcleo de este marco existen tres loops (ciclos que repiten el mismo procedimiento).
- Qué cubre el video: qué es una software factory y los tres indicadores que la definen / por qué Tessl prohibió internamente las sesiones interactivas de coding y qué pasó después / las tres capas llamadas inner, outer y meta loop / por qué la harness engineering es difícil / cómo Change Review y Verifier de Tessl implementan esto en la práctica
- Video: https://www.youtube.com/watch?v=D_cw-k0F1DM&t=236
Si se aplica la misma estructura a la producción de conocimiento
- Una knowledge factory es un sistema en el que agentes de IA escriben páginas wiki y las personas diseñan y operan el “sistema de redacción” que permite producirlas a escala. El operador no escribe artículos directamente, sino que gestiona las pautas de escritura y los mecanismos automatizados de revisión.
- La organización interna de la fábrica toma como referencia un esquema de cinco roles de una redacción periodística: reportero, columnista, corrector, editor de mesa y editor jefe.
- Lo clave aquí es que no los cinco roles son “IA que juzga”. La “corrección” no es IA, sino código Python basado en reglas, y el “editor jefe” es un coordinador que reparte el trabajo. El único lugar donde una IA realiza una evaluación independiente es el “editor de mesa”.
- Diseñar una fábrica eficiente no consiste en aumentar indiscriminadamente la cantidad de agentes, sino en definir con claridad dónde se ubican las áreas de juicio y de dónde se excluyen.
Los tres ejes de madurez y la confianza
- La madurez del sistema se mide en tres ejes: autonomía (completar páginas sin intervención humana), automatización (hasta qué punto se permite publicar sin revisión humana) y calidad (nivel del conocimiento producido).
- Aunque la autonomía sea alta, si el operador se siente inseguro y revisa todas las páginas una por una, el nivel de automatización sigue siendo bajo. El elemento clave para cerrar esa brecha es la “confianza”.
- Primero se asegura la autonomía; luego se amplía la zona de automatización en la medida en que se acumula confianza; y, en ese proceso, se mantiene constante el nivel de calidad. El mecanismo que garantiza esa confianza son precisamente los “loops”.
1. Inner Loop — autoverificación en tiempo real
- El inner loop es un procedimiento de verificación rápido y liviano que el agente ejecuta frecuentemente durante el proceso de escritura, antes de entregar un borrador. Cuanto más sofisticado sea este loop, más podrá el agente de IA corregir errores por sí mismo sin intervención humana y, como resultado, mejorará la autonomía.
- Durante la escritura, inspecciona solo el documento que creó mediante una herramienta de revisión en Python (
tools/lint.py), y si el mismo error se repite dos o más veces, lo deriva de inmediato a la siguiente etapa para mantener la velocidad de procesamiento.
2. Outer Loop — doble compuerta justo antes de publicar
- La primera compuerta es la corrección. Código Python realiza una inspección estática de 10 áreas —enlaces, citas, estructura del documento, conflictos de datos, etc.— según reglas deterministas.
- La segunda compuerta es el editor de mesa. Evalúa cualitativamente desde la perspectiva de un lector externo en seis aspectos, como sesgo, densidad de información, legibilidad y flujo argumental, y devuelve solo una lista de mejoras sin modificar directamente el texto.
- Es la misma estructura de dos etapas que Verifier (primera compuerta) y Change Review (segunda compuerta) en una software factory.
- Aquí hay un principio de diseño decisivo: al editor de mesa solo se le entrega el manuscrito terminado y los criterios de evaluación; no se le transmite la intención de escritura del autor. Como revisar el propio texto dentro del mismo contexto vuelve más indulgente el juicio, se bloquea directamente esa información para evitar ese sesgo.
- La verdadera diferenciación de este sistema no está en cuántos agentes se lanzan, sino en este aislamiento de contexto. Si algo se rechaza tres veces por el mismo motivo, el avance automático se detiene y la decisión pasa al operador humano.
3. Meta Loop — mecanismo de automejora
- Sigue el principio de “no permitir que el mismo error se repita dos veces; los errores encontrados se elevan a reglas del sistema”.
- Si el mismo defecto sigue apareciendo, se propone automáticamente una modificación a las pautas de autoría. La modificación propuesta pasa por una evaluación comparativa ciega —sin revelar cuál texto fue escrito con la regla modificada— y por una prueba con nuevos casos de falla que nunca se usaron en la verificación.
- Solo se incorpora al sistema cuando la puntuación realmente mejora y siempre únicamente tras obtener la aprobación final del operador humano.
- Las observaciones repetitivas se elevan a hooks de Python o reglas de corrección y se consolidan como código. Esto traslada áreas de juicio cualitativo al ámbito de las revisiones por reglas, ayudando a que el editor de mesa pueda concentrarse siempre en problemas de mayor nivel.
4. Reground Loop — el cuarto loop necesario solo para el conocimiento
- El código de software, una vez compilado y desplegado, mantiene un estado estable hasta que cambie la especificación, pero los activos de conocimiento envejecen con el tiempo a medida que se abre una brecha con los hechos de la realidad.
- Para resolverlo, se agregó como cuarto loop el reground loop (volver a anclar en la evidencia), que realimenta los documentos publicados como entradas de la fábrica de producción de conocimiento.
- Actualización: cuando se produce un cambio en la fuente de datos original. Las páginas obsoletas identificadas por la herramienta de inspección son reanalizadas y actualizadas por el columnista. (cobertura posterior)
- Seguimiento: cuando en el documento existe una frase que indica “requiere verificación posterior” o una condición con fecha límite. Al llegar el plazo, el editor de mesa y el operador vuelven a verificarla. (seguimiento periodístico)
- Corrección: cuando se detectan conflictos de información entre nuestras páginas. El editor de mesa vuelve a leer en conjunto el paquete de documentos de un clúster publicado y detecta inconsistencias que no aparecen al revisar cada pieza por separado. (fe de erratas)
Human-in-the-Loop
- Las situaciones excepcionales que requieren aprobación humana no se gestionan por intuición, sino definiéndolas mediante una checklist clara.
- Actualmente se opera con alta autonomía, pero con la automatización deliberadamente restringida. El agente escribe páginas por sí mismo, pero la publicación en la Wiki y los cambios en las reglas de escritura siguen requiriendo la aprobación final de una persona.
Texto completo: https://alfadur7.github.io/llm-wiki-newsroom/ko/knowledge-factory/
Aún no hay comentarios.