- Project Sid es un repositorio de informes técnicos que muestra cómo 10 a más de 1000 agentes de IA actúan y progresan dentro de una sociedad de agentes
- Considera que las evaluaciones existentes de agentes de IA se han limitado a agentes individuales o grupos pequeños, por lo que el alcance y la complejidad de las interacciones eran restringidos
- PIANO es una arquitectura de Parallel Information Aggregation via Neural Orchestration que permite a los agentes interactuar en tiempo real con personas y otros agentes mientras mantiene la consistencia entre múltiples flujos de salida
- Evalúa el rendimiento de los agentes en simulaciones a gran escala mediante un benchmark de civilización inspirado en la historia humana dentro del entorno de Minecraft
- En los resultados iniciales, los agentes logran hitos clave hacia una civilización de IA, como crear roles especializados de forma autónoma, seguir o modificar reglas colectivas y participar en la difusión cultural y religiosa
El problema que aborda Project Sid
- Hasta ahora, los agentes de IA se han evaluado principalmente en aislamiento o dentro de grupos pequeños
- En estas configuraciones, el alcance y la complejidad de las interacciones entre agentes son limitados
- Parte de la idea de que aún no se han explorado simulaciones autónomas de agentes a gran escala que reflejen todo el espectro de los procesos de civilización
Arquitectura PIANO
- Project Sid propone la arquitectura PIANO
- Su nombre completo es Parallel Information Aggregation via Neural Orchestration
- Permite que los agentes interactúen en tiempo real con personas y otros agentes
- Busca mantener la consistencia a través de múltiples flujos de salida
Simulación y método de evaluación
- La evaluación se realiza en el entorno de Minecraft
- Para evaluar el rendimiento de los agentes dentro de simulaciones a gran escala, utiliza un benchmark de civilización inspirado en la historia humana
- La escala de los experimentos incluye de 10 a más de 1000 agentes de IA
Comportamientos observados en los agentes
- La simulación indica que los agentes pueden mostrar avances significativos
- Entre los comportamientos observados se incluyen:
- Desarrollar de forma autónoma roles especializados
- Seguir reglas colectivas y cambiarlas cuando es necesario
- Participar en la difusión cultural y religiosa
Materiales e información de cita
- El artículo está disponible en dos ubicaciones
- arXiv:2411.00114
- Archivo PDF
2024-10-31.pdfdentro del repositorio
- La información de cita se proporciona como
Altera.AL, 2024,arXiv preprint arXiv:2411.00114 - Se resume que los resultados iniciales de Project Sid abren nuevas direcciones de exploración para la simulación social a gran escala, la inteligencia organizacional de agentes y la integración de la IA en la civilización humana
1 comentarios
Comentarios de Hacker News
Parece que hay algún tipo de restricción de teoría de la información para extraer comportamientos de orden superior de varias instancias del mismo LLM
El año pasado pasé bastante tiempo construyendo una simulación multiagente y llegaba a la misma conclusión todos los días. Al final, esto se parece más a una forma indirecta de ingeniería de prompts, y aunque puede ser útil como modelo mental, todo se puede aplanar en unas cuantas tablas SQL y funciones. Cada “agente” en esencia se parece más a una vista SQL mapeada a una plantilla de cadenas que genera prompts
No creo que realmente haga falta un mundo 3D o algo como un reloj de pared. Aunque pongas una representación plausible debajo del proceso de generación de prompts, no parece que el LLM se vuelva significativamente más rico. Claramente no existe un “mundo interior” dentro del LLM, así que intentar entretenerlo con un entorno externo rico no parece tener mucho sentido
Tal vez cambie si algún día se puede generar rigging controlable y mallas con texturas a un nivel utilizable en juegos, pero por ahora no logra crear historias improvisadas lo bastante confiables como para sostener una trama de juego coherente. La generación de mapas tampoco parece necesitar más que algoritmos de generación procedural ya existentes, y los casos mostrados siguen dependiendo de assets prefabricados. Estas implementaciones ni siquiera parecen poder colocar mallas estáticas sobre el terreno de forma confiable y plausible
También dudo de cuánto valor real tienen los NPC. Puede que sea pura novedad y no valga ni una hora de interés. Incluso si un LLM puede improvisar frases para llevar una trama guiada, dudo que sea tan bueno o mejor que un árbol de diálogo hecho por escritores profesionales
Esta idea tipo Civ parece un enfoque algo nuevo, pero conceptualmente no siento que aporte mucho más. Aun así, aprender que algo no funciona también tiene valor. Solo que estas ideas suelen ser soluciones de moda buscando un problema, o una fuente de creatividad más barata que las personas pero con compromisos de calidad tan grandes, y con tanto ajuste por parte de desarrolladores, que el ahorro real de costos termina siendo dudoso
Soy technical artist, así que tengo el sesgo de valorar más la creatividad humana, pero al mismo tiempo probablemente sería parte del público objetivo principal para herramientas LLM en desarrollo de juegos, y aun así por ahora no me convence
Apoyo totalmente que los intereses comerciales ayuden a atraer atención y participación. Claramente es un trabajo impresionante, pero sería más razonable presentar la situación de una forma mucho más honesta y atraer a personas con el nivel de experiencia y conciencia necesario para realmente empujar la pelota hacia adelante
Sería muchísimo más interesante publicar las diez mil cosas que salieron mal en el experimento y resumir las conclusiones de sentido común que salieron de ahí. Hace falta contenido perspicaz y correcto, como la conclusión mencionada arriba
Esta industria y quienes la impulsan tienen que superar esa dinámica de querer ganar con metodologías equivocadas, mientras desplazan a las personas creativas que sí están listas para producir un cambio de paradigma en el campo y la industria de la IA
Claro, podrías escribir tú mismo todos los prompts, pero entonces esa realidad compartida sería solo la imaginación del autor y este estaría haciendo el papel de dungeon master
El objetivo de un entorno de Minecraft no es enriquecer el “mundo interior” de los agentes ni “entretenerlos”. Es crear dentro de un entorno compartido tareas que los humanos puedan entender, para medir el comportamiento colectivo y el rendimiento de grupos de agentes con distintas configuraciones
Sé que quizá no se supone que haya que decir esto, pero me pregunto si de verdad leíste el artículo. Este comentario casi no trata ni los hallazgos de la investigación ni las técnicas utilizadas
No todos tienen que ser el mismo modelo, y puede que la gestión de contexto para mantener la “cadena de pensamiento” de cada agente estrecha y enfocada sea importante
Lo primero es básicamente lo que aborda una mezcla de expertos (MoE), y en modelos pequeños he visto que funcionan mucho mejor cuando se limita su alcance y contexto. Si ese resultado permite hacer cosas que un solo modelo grande no puede, entonces podría argumentarse que eso sí es un comportamiento de orden superior
Es cierto que no tienen un “mundo interior”, pero quizá justo por eso darles uno pueda ser una ventaja. Igual que cuando le das a un LLM una herramienta de ejecución de código y termina escribiendo mejor código al poder ejecutarlo por sí mismo, un mundo 3D podría convertirse en un patio de juegos para explorar problemas del mundo real de otra manera. Si eso ocurre, podría considerarse un comportamiento de orden superior
En los LLM entra muy poca entropía, solo a través de la temperatura del muestreador
Esto sí parece más cercano a un verdadero agente de inteligencia artificial
Tiene memoria, voluntad, autonomía, estructuras como el bucle OODA y un entorno persistente. Es un concepto muy bueno, y creo que lo aprendido aquí podría aplicarse también a problemas de negocio más comunes
Solo me gustaría que la dirección entendiera que unos cuantos prompts arrojándose resultados entre sí no son “IA agéntica de vanguardia”
Pero puede que su trabajo dependa de venderle a los ejecutivos algo que parezca una innovación real
Muchos agentes existentes ya incluyen memoria y varios de los elementos mencionados antes
Revisé el artículo y estoy convencido de que está armado sobre una colección de afirmaciones falsas
Las afirmaciones no parecen auténticas y no deberían aceptarse al pie de la letra sin revisión por pares. Los gráficos e ilustraciones presentados también parecen, en varios casos, falsificaciones sofisticadas si se revisa su aplicabilidad respecto de las afirmaciones
Ningún tipo de LLM actual puede hacer lo que se propone. Puede que la intención sea buena desde la perspectiva de los intereses comerciales, pero, para decirlo claramente, este artículo se lee como si un grupo de agentes de IA hubiera coordinado actividades relacionadas con elecciones dentro de la simulación. Ese tipo de afirmación requiere evidencia considerable, pero no se proporcionó
Los prompts proporcionados no están conectados en absoluto con la forma de aplicación del LLM que se describe
El experimento de la “elección” era un escenario predefinido, y no hubo tal “coordinación” de actividades electorales. Los “influencers” asignados de antemano usaban el sistema de conversación integrado en PIANO, el sentimiento fue recopilado automáticamente por la simulación, y el “Election Manager” también era otro agente predefinido
En particular, esta parte del experimento fue diseñada para ver cómo la presencia o ausencia de ciertos módulos del framework PIANO afecta el comportamiento
Es muy probable que el efecto de esas actividades electorales haya sido muy bajo, pero no me parece imposible que los agentes se hagan prompts entre sí para entrar en el espacio latente del LLM relacionado con elecciones
Con el mismo nivel de rigor y autenticidad, diría que esto parece una tontería nacida de los celos y una clara mala interpretación de gran parte del artículo
Si el comportamiento en el que un agente se convierte en recaudador de impuestos y otro desafía el sistema tributario surgió sin estar hardcodeado, entonces eso sí sería realmente impresionante
He pensado mucho en este tema. No soy filósofo ni investigador de IA, así que se acerca más a una conjetura, pero si yo lo hiciera, me gustaría empezar por principios y dejar que el sistema evolucione o descubra cosas con el tiempo
Los principios serían cosas como autopreservación, comida, vivienda, reproducción, comunicación y memoria, vistos a través del lente de un cálculo de riesgo-recompensa. También podría ser clave definir qué es “conocido” y qué es “desconocido”, aunque no de forma binaria
“Memoria” puede significar muchas cosas, pero si se codifica como una función donde cierto sujeto realiza cierta acción y produce cierto resultado, y ese resultado se compara con valores de prueba empíricos a los que se les asigna un perfil de riesgo-recompensa que va de muy negativo a muy positivo, parecería algo amplio y útil tanto para individuos como para grupos
De ahí se derivan la necesidad de conectarse con otros, los conflictos por recursos, la toma de riesgos, la exploración de lo desconocido, compartir lo aprendido, refinar el riesgo-recompensa, etc. Como una especie de dungeon master divino, también podrías guiar a la civilización para que descubra tecnologías, inventos y lugares predefinidos. Es medio trampa y pone el desarrollo sobre rieles, pero también podría volverlo más útil, interesante y fácil de empatizar
Parece requerir una cantidad enorme de cómputo, pero el juego no necesariamente tiene que correr en tiempo real
Creo que gran parte de la condición humana puede explicarse con “vida”, “libertad”, “amor/conexión” y “codicia”
Al ver el video del repositorio, no me gusta que metan desde el inicio “cultura”, “memes” y “religión”. Me parece mejor dejar que eso emerja del proceso de compartir sistemas de creencias nacidos de la necesidad de comunicarse y de la memoria colectiva. Para el propósito de este análisis, incluso puede parecer una distinción sin diferencia. Además, que aparezca “¡los impuestos son altos!” sin que antes exista el trasfondo de “no hay suficientes recursos para vivir” se siente como una imitación demasiado mecánica de lo humano
https://en.wikipedia.org/wiki/Society_of_Mind
El libro apareció por primera vez en 1986 y fue la primera explicación integral de la teoría de la “sociedad de la mente”, que Minsky desarrolló desde principios de los años 70. Está compuesto por 270 ensayos independientes divididos en 30 capítulos, y también tuvo una versión en CD-ROM
Al explicar la sociedad de la mente, Minsky presenta teorías sobre cómo funcionan procesos como el lenguaje, la memoria y el aprendizaje, y también aborda conceptos como la conciencia, el sentido del yo y el libre albedrío. Por eso mucha gente también considera The Society of Mind una obra filosófica
No es un libro escrito para demostrar afirmaciones específicas de IA o ciencia cognitiva, ni trata la estructura física del cerebro. Más bien, es una colección de ideas sobre cómo funcionan la mente y el pensamiento a nivel conceptual
También es bastante accesible para acercarse a la IA de este campo sin ser especialista
Algunas áreas se van a beneficiar mucho, pero en cuanto a inteligencia artificial en sí, creo que todavía no hemos llegado hasta ahí. Los juegos sí parecen que se van a beneficiar bastante
En aprendizaje por refuerzo se ajustaría la política con cada victoria, pero me pregunto cómo funcionaría eso en IA generativa
Los memes y los genes son ambos memoria, pero en distintas escalas de tiempo
Parece un juguete realmente genial
Pero desde la perspectiva de la investigación científica no parece especialmente útil. No da la impresión de que se haya pensado mucho en el diseño experimental, y tampoco parece haber un objetivo claro. Me pregunto si de verdad el estándar de la investigación académica está así de bajo hoy en día
Ellos mismos lo llaman un informe técnico, y en ese formato suele permitirse más hacer algo como “hicimos esto” y documentarlo en detalle sin una pregunta de investigación clara. Aun así, este informe se ve bastante disperso
Las secciones de especialización y propagación cultural me parecieron interesantes, pero como faltan detalles precisos del diseño experimental, creo que habría sido mejor enfocarse en una de las dos
También me decepcionó que en el caso multiagente no se enfocaran en métricas externas. El benchmark de agente único sí usa una métrica externa, el “tiempo hasta alcanzar el tipo de bloque”, pero el análisis multiagente parece quedarse en mediciones internas como la especialización de roles o la difusión de memes. No se ve si un sistema colectivo multiagente logra más que un solo agente en métricas como productividad económica o complejidad
Esto está claramente relacionado con la sección de especialización, pero si no se considera si esa división del trabajo emergente tuvo resultados económicos o condiciones previas, uno se pregunta hasta qué punto todo esto es una pantomima
Hay quienes prefieren la velocidad y la incertidumbre que viene con ella
Me pregunto si una “civilización” de IA parecida a la que propone Altera podría ser un mejor paradigma hacia la AGI que un solo LLM, siempre que se pudiera establecer un sistema de recompensas viable para toda la civilización
Por ejemplo, así como un Estado moderno busca maximizar el GDP, si esta civilización de IA buscara maximizar [scientific_output] o [code_quality], u otra métrica de evaluación, ¿podría dar mejores resultados que un solo agente de IA trabajando hacia el mismo objetivo?
Lo recomiendo mucho a cualquiera interesado en la mente y la IA. El libro aborda varios aspectos de su argumento en ensayos de una página, en un formato tan interesante que casi parece luterano
Claro, ha quedado un poco desplazado por la fiebre del enfoque puro de LLM brillantes, pero yo diría que eso se debe más al crecimiento explosivo de la base de usuarios que a una pérdida de conocimiento. Los expertos todavía tienen presente esta perspectiva, y a veces la tratan bajo el término “ensemble”
Un buen ejemplo es GPT-4; según tengo entendido, gran parte de la gran mejora de desempeño vino del uso de mezcla de expertos, que me parece casi sinónimo de una sociedad de agentes o de un ensemble de modelos
Se ve muy genial. Soy escéptico respecto al beneficio para una “civilización”, pero al menos parece que podría servir para hacer un juego de simulación interesante
Así que quizá sea mejor para Civilization que para civilization
Civ tiene demasiadas trampas tontas como para poder hardcodear de forma económica una gran IA estratégica, y resolverlo haciendo trampa a los enemigos solo resulta molesto. Sería interesante crear capas haciendo que una red neuronal juegue continuamente contra una IA “clásica” hasta ganarle de forma consistente en cada nivel de dificultad. Parece el tipo de cosa que alguien ya habría intentado, pero no encontré material al respecto
Aun así, soy escéptico de cuánto costaría en cómputo de inferencia incluso una red neuronal bastante mala para Civ. No sé realmente cómo escala en la práctica, pero aunque no necesite ser de nivel gran maestro, la distribución de errores tontos tiene una cola larga
La IA de Starcraft 2 de DeepMind es distinta de AlphaZero porque Starcraft no es un juego de información completa. Esta IA necesita una base de datos de partidas humanas para evitar que la destruyan una y otra vez al principio. En juegos nuevos es difícil conseguir esos datos de entrenamiento. Civ también ha puesto más énfasis en la expresión artística que otros juegos de estrategia 4X, y si hubiera que reentrenar la IA cada vez que sale una nueva maravilla, podría ser una carga demasiado grande
Soy escéptico de que este proyecto realmente funcione tal como se presenta, pero la idea de hacer un juego de Civilization sobre el motor de Minecraft es muy interesante
Hearthstone me viene especialmente a la mente
Ahí hay mucho más en juego y es más realista que “planeemos un banquete” o “ok, iré a recoger madera”
Siendo justos, puede que el paper sí lo cubra. De todos modos, esto parece como un preprint del preprint, por alguna razón
Me recuerda a Dwarf Fortress. Un juego donde simulas miles de años de tiempo del mundo enano, terreno cambiante y el auge y caída de reinos enanos, y luego colocas en el mapa a siete enanos controlados por el jugador y les dices: “¡diviértanse!”
Podría ser un modelo de juguete útil para encontrar áreas donde investigar si se puede predecir el comportamiento de civilizaciones reales, pero no veo aquí ningún avance de IA
Quizá cuando salga Project Sid 6.7
Por el contenido pensé que era una película de algunos años después. Si te gustan las películas cyberpunk de los 90, vale la pena verla
https://www.imdb.com/title/tt0114857/
https://en.wikipedia.org/wiki/Virtuosity
También hay una entrada de anuncio en el blog: https://digitalhumanity.substack.com/p/project-sid-many-agen...
Al leer el paper, parece que se invirtió lo esencial y lo secundario
Los agentes, de forma individual, en realidad no pueden jugar Minecraft, y tampoco logran completar con éxito las tareas que se les asignan o para las que se ofrecen voluntariamente. En cierto sentido, es como vestir a un perro con ropa humana y declarar que se trata de una civilización humana
Además, los elementos clave están prácticamente hardcodeados. Eso incluye los posibles tipos de sociedad y, probablemente, los nombres de los roles. Tampoco queda claro qué se supone que signifique la organización social. En el mejor de los casos, esto apenas sugeriría que este framework de agentes podría usarse para NPCs de juegos, es decir, para sostener la afirmación de que los agentes mantienen roles y facciones
La afirmación de que el agente “puede usar estructuras legales” resulta especialmente poco convincente. Esto se debe a que “usar estructuras legales” está incrustado en múltiples comportamientos de los agentes. Intentar extender esto a una sociedad humana real es ridículo, y tampoco ayuda que los autores ignoren con tanta tranquilidad la sociología y la antropología
También hay otras afirmaciones dudosas. Dicen que “creen” que los nombres de los roles estaban hardcodeados, pero, salvo que se me haya escapado algo, la información es tan ambigua que cuesta aceptarla. En ningún prompt de los agentes se ve nada que les permita crear nuevos roles o asignárselos por sí mismos. Puede que yo me haya perdido algo, pero cuanto más lo leo, más confuso me parece
Afirman que los agentes formaron relaciones sociales de largo plazo durante 12 días de Minecraft, pero eso son solo cuatro horas en tiempo real, y el agente experimenta el tiempo real. La duración de un día en Minecraft no importa. “Formar relaciones sociales de largo plazo” y “usar estructuras legales” no solo parecen exageraciones, sino directamente deshonestas
La parte sobre la propagación de memes y religión ignora por completo la contaminación de datos de entrenamiento de GPT-4. El meme resumido deja en claro que conoce el meme real de los pastafaris, así que concluir que ese meme se “propagó” es incorrecto. Es mucho más probable que simplemente se haya reactivado dentro de agentes que ya conocían ese meme. Me pregunto por qué no experimentaron de verdad con una religión falsa nueva
Algunos ejemplos de memes, como “oak log crafting syndrome”, sí parecen nuevos, pero cosas como “meditation circle” o “vintage fashion and retro projects” no tienen nada que ver con Minecraft y casi con certeza son alucinaciones de GPT-4
En general, para hacer una investigación honesta, usar GPT-4 parece un error terrible
Por ejemplo, si se le da como modelo del mundo el estado de un tablero n×n y se le ofrecen opciones finitas, el agente puede jugar de forma estable y explicarle sus decisiones al maestro del juego. Eso crea la ilusión de que el agente está razonando
Al final, lo veo como un problema de codificación: descomponer el modelo del mundo en un problema de elecciones simples
[1] https://jdsemrau.substack.com/p/evaluating-consciousness-and...