2 puntos por GN⁺ 2024-11-04 | 1 comentarios | Compartir por WhatsApp
  • Project Sid es un repositorio de informes técnicos que muestra cómo 10 a más de 1000 agentes de IA actúan y progresan dentro de una sociedad de agentes
  • Considera que las evaluaciones existentes de agentes de IA se han limitado a agentes individuales o grupos pequeños, por lo que el alcance y la complejidad de las interacciones eran restringidos
  • PIANO es una arquitectura de Parallel Information Aggregation via Neural Orchestration que permite a los agentes interactuar en tiempo real con personas y otros agentes mientras mantiene la consistencia entre múltiples flujos de salida
  • Evalúa el rendimiento de los agentes en simulaciones a gran escala mediante un benchmark de civilización inspirado en la historia humana dentro del entorno de Minecraft
  • En los resultados iniciales, los agentes logran hitos clave hacia una civilización de IA, como crear roles especializados de forma autónoma, seguir o modificar reglas colectivas y participar en la difusión cultural y religiosa

El problema que aborda Project Sid

  • Hasta ahora, los agentes de IA se han evaluado principalmente en aislamiento o dentro de grupos pequeños
  • En estas configuraciones, el alcance y la complejidad de las interacciones entre agentes son limitados
  • Parte de la idea de que aún no se han explorado simulaciones autónomas de agentes a gran escala que reflejen todo el espectro de los procesos de civilización

Arquitectura PIANO

  • Project Sid propone la arquitectura PIANO
    • Su nombre completo es Parallel Information Aggregation via Neural Orchestration
    • Permite que los agentes interactúen en tiempo real con personas y otros agentes
    • Busca mantener la consistencia a través de múltiples flujos de salida

Simulación y método de evaluación

  • La evaluación se realiza en el entorno de Minecraft
  • Para evaluar el rendimiento de los agentes dentro de simulaciones a gran escala, utiliza un benchmark de civilización inspirado en la historia humana
  • La escala de los experimentos incluye de 10 a más de 1000 agentes de IA

Comportamientos observados en los agentes

  • La simulación indica que los agentes pueden mostrar avances significativos
  • Entre los comportamientos observados se incluyen:
    • Desarrollar de forma autónoma roles especializados
    • Seguir reglas colectivas y cambiarlas cuando es necesario
    • Participar en la difusión cultural y religiosa

Materiales e información de cita

  • El artículo está disponible en dos ubicaciones
  • La información de cita se proporciona como Altera.AL, 2024, arXiv preprint arXiv:2411.00114
  • Se resume que los resultados iniciales de Project Sid abren nuevas direcciones de exploración para la simulación social a gran escala, la inteligencia organizacional de agentes y la integración de la IA en la civilización humana

1 comentarios

 
GN⁺ 2024-11-04
Comentarios de Hacker News
  • Parece que hay algún tipo de restricción de teoría de la información para extraer comportamientos de orden superior de varias instancias del mismo LLM
    El año pasado pasé bastante tiempo construyendo una simulación multiagente y llegaba a la misma conclusión todos los días. Al final, esto se parece más a una forma indirecta de ingeniería de prompts, y aunque puede ser útil como modelo mental, todo se puede aplanar en unas cuantas tablas SQL y funciones. Cada “agente” en esencia se parece más a una vista SQL mapeada a una plantilla de cadenas que genera prompts
    No creo que realmente haga falta un mundo 3D o algo como un reloj de pared. Aunque pongas una representación plausible debajo del proceso de generación de prompts, no parece que el LLM se vuelva significativamente más rico. Claramente no existe un “mundo interior” dentro del LLM, así que intentar entretenerlo con un entorno externo rico no parece tener mucho sentido

    • Todavía no he visto un caso en juegos donde un LLM se use mejor que un algoritmo tradicional, salvo quizá interacciones con NPC menos repetitivas
      Tal vez cambie si algún día se puede generar rigging controlable y mallas con texturas a un nivel utilizable en juegos, pero por ahora no logra crear historias improvisadas lo bastante confiables como para sostener una trama de juego coherente. La generación de mapas tampoco parece necesitar más que algoritmos de generación procedural ya existentes, y los casos mostrados siguen dependiendo de assets prefabricados. Estas implementaciones ni siquiera parecen poder colocar mallas estáticas sobre el terreno de forma confiable y plausible
      También dudo de cuánto valor real tienen los NPC. Puede que sea pura novedad y no valga ni una hora de interés. Incluso si un LLM puede improvisar frases para llevar una trama guiada, dudo que sea tan bueno o mejor que un árbol de diálogo hecho por escritores profesionales
      Esta idea tipo Civ parece un enfoque algo nuevo, pero conceptualmente no siento que aporte mucho más. Aun así, aprender que algo no funciona también tiene valor. Solo que estas ideas suelen ser soluciones de moda buscando un problema, o una fuente de creatividad más barata que las personas pero con compromisos de calidad tan grandes, y con tanto ajuste por parte de desarrolladores, que el ahorro real de costos termina siendo dudoso
      Soy technical artist, así que tengo el sesgo de valorar más la creatividad humana, pero al mismo tiempo probablemente sería parte del público objetivo principal para herramientas LLM en desarrollo de juegos, y aun así por ahora no me convence
    • Creo que este punto da exactamente en el blanco. Para avanzar en problemas tan difíciles, hay que ser honestos sobre qué tan lejos está el objetivo que se está vendiendo de la realidad
      Apoyo totalmente que los intereses comerciales ayuden a atraer atención y participación. Claramente es un trabajo impresionante, pero sería más razonable presentar la situación de una forma mucho más honesta y atraer a personas con el nivel de experiencia y conciencia necesario para realmente empujar la pelota hacia adelante
      Sería muchísimo más interesante publicar las diez mil cosas que salieron mal en el experimento y resumir las conclusiones de sentido común que salieron de ahí. Hace falta contenido perspicaz y correcto, como la conclusión mencionada arriba
      Esta industria y quienes la impulsan tienen que superar esa dinámica de querer ganar con metodologías equivocadas, mientras desplazan a las personas creativas que sí están listas para producir un cambio de paradigma en el campo y la industria de la IA
    • No entiendo cómo esperan que los agentes autoorganicen estructuras sociales si no tienen una realidad compartida
      Claro, podrías escribir tú mismo todos los prompts, pero entonces esa realidad compartida sería solo la imaginación del autor y este estaría haciendo el papel de dungeon master
      El objetivo de un entorno de Minecraft no es enriquecer el “mundo interior” de los agentes ni “entretenerlos”. Es crear dentro de un entorno compartido tareas que los humanos puedan entender, para medir el comportamiento colectivo y el rendimiento de grupos de agentes con distintas configuraciones
      Sé que quizá no se supone que haya que decir esto, pero me pregunto si de verdad leíste el artículo. Este comentario casi no trata ni los hallazgos de la investigación ni las técnicas utilizadas
    • Yo también tuve pensamientos parecidos sobre los comportamientos de orden superior al construir y jugar con sistemas de agentes simples, pero también tengo una objeción
      No todos tienen que ser el mismo modelo, y puede que la gestión de contexto para mantener la “cadena de pensamiento” de cada agente estrecha y enfocada sea importante
      Lo primero es básicamente lo que aborda una mezcla de expertos (MoE), y en modelos pequeños he visto que funcionan mucho mejor cuando se limita su alcance y contexto. Si ese resultado permite hacer cosas que un solo modelo grande no puede, entonces podría argumentarse que eso sí es un comportamiento de orden superior
      Es cierto que no tienen un “mundo interior”, pero quizá justo por eso darles uno pueda ser una ventaja. Igual que cuando le das a un LLM una herramienta de ejecución de código y termina escribiendo mejor código al poder ejecutarlo por sí mismo, un mundo 3D podría convertirse en un patio de juegos para explorar problemas del mundo real de otra manera. Si eso ocurre, podría considerarse un comportamiento de orden superior
    • Para producir comportamientos nuevos, hace falta exploración del lado del modelo, y la exploración requiere cierto grado de aleatoriedad, así que al final es un problema de entropía
      En los LLM entra muy poca entropía, solo a través de la temperatura del muestreador
  • Esto sí parece más cercano a un verdadero agente de inteligencia artificial
    Tiene memoria, voluntad, autonomía, estructuras como el bucle OODA y un entorno persistente. Es un concepto muy bueno, y creo que lo aprendido aquí podría aplicarse también a problemas de negocio más comunes
    Solo me gustaría que la dirección entendiera que unos cuantos prompts arrojándose resultados entre sí no son “IA agéntica de vanguardia”
    Pero puede que su trabajo dependa de venderle a los ejecutivos algo que parezca una innovación real

    • No me queda claro en qué se diferencia el proyecto enlazado de “unos cuantos prompts arrojándose resultados entre sí”
      Muchos agentes existentes ya incluyen memoria y varios de los elementos mencionados antes
    • Incluso en IA estrecha esto no debería hacerse así. Hace falta un marco de gobernanza para medir los resultados y detectar riesgos potenciales, por ejemplo alucinaciones, datos o enlaces incorrectos, y resúmenes erróneos
  • Revisé el artículo y estoy convencido de que está armado sobre una colección de afirmaciones falsas
    Las afirmaciones no parecen auténticas y no deberían aceptarse al pie de la letra sin revisión por pares. Los gráficos e ilustraciones presentados también parecen, en varios casos, falsificaciones sofisticadas si se revisa su aplicabilidad respecto de las afirmaciones
    Ningún tipo de LLM actual puede hacer lo que se propone. Puede que la intención sea buena desde la perspectiva de los intereses comerciales, pero, para decirlo claramente, este artículo se lee como si un grupo de agentes de IA hubiera coordinado actividades relacionadas con elecciones dentro de la simulación. Ese tipo de afirmación requiere evidencia considerable, pero no se proporcionó
    Los prompts proporcionados no están conectados en absoluto con la forma de aplicación del LLM que se describe

    • Parece que no entendiste bien el artículo
      El experimento de la “elección” era un escenario predefinido, y no hubo tal “coordinación” de actividades electorales. Los “influencers” asignados de antemano usaban el sistema de conversación integrado en PIANO, el sentimiento fue recopilado automáticamente por la simulación, y el “Election Manager” también era otro agente predefinido
      En particular, esta parte del experimento fue diseñada para ver cómo la presencia o ausencia de ciertos módulos del framework PIANO afecta el comportamiento
    • Es natural pensar que actividades relacionadas con elecciones estén dentro de los datos de entrenamiento del LLM
      Es muy probable que el efecto de esas actividades electorales haya sido muy bajo, pero no me parece imposible que los agentes se hagan prompts entre sí para entrar en el espacio latente del LLM relacionado con elecciones
    • Vale la pena señalar que esta cuenta tiene apenas como un día de creada, y que los autores del artículo tampoco dejaron un contacto para que se pudiera hacer una verificación posterior
      Con el mismo nivel de rigor y autenticidad, diría que esto parece una tontería nacida de los celos y una clara mala interpretación de gran parte del artículo
    • Aún no lo he revisado a fondo, pero soy muy escéptico respecto de las afirmaciones que se hacen aquí
      Si el comportamiento en el que un agente se convierte en recaudador de impuestos y otro desafía el sistema tributario surgió sin estar hardcodeado, entonces eso sí sería realmente impresionante
  • He pensado mucho en este tema. No soy filósofo ni investigador de IA, así que se acerca más a una conjetura, pero si yo lo hiciera, me gustaría empezar por principios y dejar que el sistema evolucione o descubra cosas con el tiempo
    Los principios serían cosas como autopreservación, comida, vivienda, reproducción, comunicación y memoria, vistos a través del lente de un cálculo de riesgo-recompensa. También podría ser clave definir qué es “conocido” y qué es “desconocido”, aunque no de forma binaria
    “Memoria” puede significar muchas cosas, pero si se codifica como una función donde cierto sujeto realiza cierta acción y produce cierto resultado, y ese resultado se compara con valores de prueba empíricos a los que se les asigna un perfil de riesgo-recompensa que va de muy negativo a muy positivo, parecería algo amplio y útil tanto para individuos como para grupos
    De ahí se derivan la necesidad de conectarse con otros, los conflictos por recursos, la toma de riesgos, la exploración de lo desconocido, compartir lo aprendido, refinar el riesgo-recompensa, etc. Como una especie de dungeon master divino, también podrías guiar a la civilización para que descubra tecnologías, inventos y lugares predefinidos. Es medio trampa y pone el desarrollo sobre rieles, pero también podría volverlo más útil, interesante y fácil de empatizar
    Parece requerir una cantidad enorme de cómputo, pero el juego no necesariamente tiene que correr en tiempo real
    Creo que gran parte de la condición humana puede explicarse con “vida”, “libertad”, “amor/conexión” y “codicia”
    Al ver el video del repositorio, no me gusta que metan desde el inicio “cultura”, “memes” y “religión”. Me parece mejor dejar que eso emerja del proceso de compartir sistemas de creencias nacidos de la necesidad de comunicarse y de la memoria colectiva. Para el propósito de este análisis, incluso puede parecer una distinción sin diferencia. Además, que aparezca “¡los impuestos son altos!” sin que antes exista el trasfondo de “no hay suficientes recursos para vivir” se siente como una imitación demasiado mecánica de lo humano

    • La “evolución” es otro monstruo, pero sobre esa parte de empezar por principios y dejar que el sistema evolucione o descubra cosas con el tiempo, podrías buscar The Society of Mind de Marvin Minsky
      https://en.wikipedia.org/wiki/Society_of_Mind
      El libro apareció por primera vez en 1986 y fue la primera explicación integral de la teoría de la “sociedad de la mente”, que Minsky desarrolló desde principios de los años 70. Está compuesto por 270 ensayos independientes divididos en 30 capítulos, y también tuvo una versión en CD-ROM
      Al explicar la sociedad de la mente, Minsky presenta teorías sobre cómo funcionan procesos como el lenguaje, la memoria y el aprendizaje, y también aborda conceptos como la conciencia, el sentido del yo y el libre albedrío. Por eso mucha gente también considera The Society of Mind una obra filosófica
      No es un libro escrito para demostrar afirmaciones específicas de IA o ciencia cognitiva, ni trata la estructura física del cerebro. Más bien, es una colección de ideas sobre cómo funcionan la mente y el pensamiento a nivel conceptual
      También es bastante accesible para acercarse a la IA de este campo sin ser especialista
    • Muchos de estos proyectos profundizan poco en la inteligencia y mucho en la tecnología actual
      Algunas áreas se van a beneficiar mucho, pero en cuanto a inteligencia artificial en sí, creo que todavía no hemos llegado hasta ahí. Los juegos sí parecen que se van a beneficiar bastante
    • La memoria es realmente interesante. Por ejemplo, si jugaras 100,000 partidas de tres en raya 5x5, ¿de verdad necesitarías recordar la partida número 51,247, o bastaría con reconocer y recordar patrones ganadores?
      En aprendizaje por refuerzo se ajustaría la política con cada victoria, pero me pregunto cómo funcionaría eso en IA generativa
    • Suena como un Spore modernizado
    • ¿Sí se reproduce el video de verdad? Aquí solo me aparece “No video with supported format and MIME type found”
      Los memes y los genes son ambos memoria, pero en distintas escalas de tiempo
  • Parece un juguete realmente genial
    Pero desde la perspectiva de la investigación científica no parece especialmente útil. No da la impresión de que se haya pensado mucho en el diseño experimental, y tampoco parece haber un objetivo claro. Me pregunto si de verdad el estándar de la investigación académica está así de bajo hoy en día

    • Hay que tener en cuenta que cualquiera puede subir algo a arXiv, y que haya llegado a la parte alta de HN no significa que sea por el valor de su contribución a la investigación
    • Es un grupo con mucha gente proveniente de la academia que usa parte del formato académico, pero no parece que lo presenten como un artículo de investigación formal
      Ellos mismos lo llaman un informe técnico, y en ese formato suele permitirse más hacer algo como “hicimos esto” y documentarlo en detalle sin una pregunta de investigación clara. Aun así, este informe se ve bastante disperso
      Las secciones de especialización y propagación cultural me parecieron interesantes, pero como faltan detalles precisos del diseño experimental, creo que habría sido mejor enfocarse en una de las dos
      También me decepcionó que en el caso multiagente no se enfocaran en métricas externas. El benchmark de agente único sí usa una métrica externa, el “tiempo hasta alcanzar el tipo de bloque”, pero el análisis multiagente parece quedarse en mediciones internas como la especialización de roles o la difusión de memes. No se ve si un sistema colectivo multiagente logra más que un solo agente en métricas como productividad económica o complejidad
      Esto está claramente relacionado con la sección de especialización, pero si no se considera si esa división del trabajo emergente tuvo resultados económicos o condiciones previas, uno se pregunta hasta qué punto todo esto es una pantomima
    • El método científico es útil, pero no es una condición previa para la utilidad
      Hay quienes prefieren la velocidad y la incertidumbre que viene con ella
  • Me pregunto si una “civilización” de IA parecida a la que propone Altera podría ser un mejor paradigma hacia la AGI que un solo LLM, siempre que se pudiera establecer un sistema de recompensas viable para toda la civilización
    Por ejemplo, así como un Estado moderno busca maximizar el GDP, si esta civilización de IA buscara maximizar [scientific_output] o [code_quality], u otra métrica de evaluación, ¿podría dar mejores resultados que un solo agente de IA trabajando hacia el mismo objetivo?

    • Esa dirección encaja muy bien con el progreso. Ha sido un elemento central de diseño en el trabajo serio de IA desde más o menos los años 90, y se volvió especialmente conocido por The Society of Mind de Marvin Minsky
      Lo recomiendo mucho a cualquiera interesado en la mente y la IA. El libro aborda varios aspectos de su argumento en ensayos de una página, en un formato tan interesante que casi parece luterano
      Claro, ha quedado un poco desplazado por la fiebre del enfoque puro de LLM brillantes, pero yo diría que eso se debe más al crecimiento explosivo de la base de usuarios que a una pérdida de conocimiento. Los expertos todavía tienen presente esta perspectiva, y a veces la tratan bajo el término “ensemble”
      Un buen ejemplo es GPT-4; según tengo entendido, gran parte de la gran mejora de desempeño vino del uso de mezcla de expertos, que me parece casi sinónimo de una sociedad de agentes o de un ensemble de modelos
    • ¿Producción de clips?
  • Se ve muy genial. Soy escéptico respecto al beneficio para una “civilización”, pero al menos parece que podría servir para hacer un juego de simulación interesante
    Así que quizá sea mejor para Civilization que para civilization

    • Creo que el Civilization de Firaxis necesita una IA al estilo AlphaZero más barata que un LLM
      Civ tiene demasiadas trampas tontas como para poder hardcodear de forma económica una gran IA estratégica, y resolverlo haciendo trampa a los enemigos solo resulta molesto. Sería interesante crear capas haciendo que una red neuronal juegue continuamente contra una IA “clásica” hasta ganarle de forma consistente en cada nivel de dificultad. Parece el tipo de cosa que alguien ya habría intentado, pero no encontré material al respecto
      Aun así, soy escéptico de cuánto costaría en cómputo de inferencia incluso una red neuronal bastante mala para Civ. No sé realmente cómo escala en la práctica, pero aunque no necesite ser de nivel gran maestro, la distribución de errores tontos tiene una cola larga
      La IA de Starcraft 2 de DeepMind es distinta de AlphaZero porque Starcraft no es un juego de información completa. Esta IA necesita una base de datos de partidas humanas para evitar que la destruyan una y otra vez al principio. En juegos nuevos es difícil conseguir esos datos de entrenamiento. Civ también ha puesto más énfasis en la expresión artística que otros juegos de estrategia 4X, y si hubiera que reentrenar la IA cada vez que sale una nueva maravilla, podría ser una carga demasiado grande
    • De verdad parece mejor para Civilization que para civilization. En el lado de los juegos podría ser bastante interesante
    • Me gusta que el nombre del proyecto haga pensar en Sid Meier
      Soy escéptico de que este proyecto realmente funcione tal como se presenta, pero la idea de hacer un juego de Civilization sobre el motor de Minecraft es muy interesante
    • Me sorprende un poco que las compañías que hacen juegos de estrategia no usen IA para probar cosas como cartas rotas antes del lanzamiento
      Hearthstone me viene especialmente a la mente
    • Da pena que no se haya implementado no en Minecraft sino en Civilization VI, Humankind o en los grandes juegos de gran estrategia de Paradox, especialmente Stellaris, Victoria, Crusader Kings y Europa Universalis, aunque desde la perspectiva de p(doom) eso también da cierto alivio
      Ahí hay mucho más en juego y es más realista que “planeemos un banquete” o “ok, iré a recoger madera”
      Siendo justos, puede que el paper sí lo cubra. De todos modos, esto parece como un preprint del preprint, por alguna razón
  • Me recuerda a Dwarf Fortress. Un juego donde simulas miles de años de tiempo del mundo enano, terreno cambiante y el auge y caída de reinos enanos, y luego colocas en el mapa a siete enanos controlados por el jugador y les dices: “¡diviértanse!”
    Podría ser un modelo de juguete útil para encontrar áreas donde investigar si se puede predecir el comportamiento de civilizaciones reales, pero no veo aquí ningún avance de IA
    Quizá cuando salga Project Sid 6.7

  • También hay una entrada de anuncio en el blog: https://digitalhumanity.substack.com/p/project-sid-many-agen...

  • Al leer el paper, parece que se invirtió lo esencial y lo secundario
    Los agentes, de forma individual, en realidad no pueden jugar Minecraft, y tampoco logran completar con éxito las tareas que se les asignan o para las que se ofrecen voluntariamente. En cierto sentido, es como vestir a un perro con ropa humana y declarar que se trata de una civilización humana
    Además, los elementos clave están prácticamente hardcodeados. Eso incluye los posibles tipos de sociedad y, probablemente, los nombres de los roles. Tampoco queda claro qué se supone que signifique la organización social. En el mejor de los casos, esto apenas sugeriría que este framework de agentes podría usarse para NPCs de juegos, es decir, para sostener la afirmación de que los agentes mantienen roles y facciones
    La afirmación de que el agente “puede usar estructuras legales” resulta especialmente poco convincente. Esto se debe a que “usar estructuras legales” está incrustado en múltiples comportamientos de los agentes. Intentar extender esto a una sociedad humana real es ridículo, y tampoco ayuda que los autores ignoren con tanta tranquilidad la sociología y la antropología
    También hay otras afirmaciones dudosas. Dicen que “creen” que los nombres de los roles estaban hardcodeados, pero, salvo que se me haya escapado algo, la información es tan ambigua que cuesta aceptarla. En ningún prompt de los agentes se ve nada que les permita crear nuevos roles o asignárselos por sí mismos. Puede que yo me haya perdido algo, pero cuanto más lo leo, más confuso me parece
    Afirman que los agentes formaron relaciones sociales de largo plazo durante 12 días de Minecraft, pero eso son solo cuatro horas en tiempo real, y el agente experimenta el tiempo real. La duración de un día en Minecraft no importa. “Formar relaciones sociales de largo plazo” y “usar estructuras legales” no solo parecen exageraciones, sino directamente deshonestas
    La parte sobre la propagación de memes y religión ignora por completo la contaminación de datos de entrenamiento de GPT-4. El meme resumido deja en claro que conoce el meme real de los pastafaris, así que concluir que ese meme se “propagó” es incorrecto. Es mucho más probable que simplemente se haya reactivado dentro de agentes que ya conocían ese meme. Me pregunto por qué no experimentaron de verdad con una religión falsa nueva
    Algunos ejemplos de memes, como “oak log crafting syndrome”, sí parecen nuevos, pero cosas como “meditation circle” o “vintage fashion and retro projects” no tienen nada que ver con Minecraft y casi con certeza son alucinaciones de GPT-4
    En general, para hacer una investigación honesta, usar GPT-4 parece un error terrible

    • Creo que la dirección es correcta. La clave está en hacer bien la codificación de la interfaz entre el juego y el agente para que el agente pueda tomar decisiones simples
      Por ejemplo, si se le da como modelo del mundo el estado de un tablero n×n y se le ofrecen opciones finitas, el agente puede jugar de forma estable y explicarle sus decisiones al maestro del juego. Eso crea la ilusión de que el agente está razonando
      Al final, lo veo como un problema de codificación: descomponer el modelo del mundo en un problema de elecciones simples
      [1] https://jdsemrau.substack.com/p/evaluating-consciousness-and...