- What if Eye...? es un proyecto que vuelve a ejecutar la evolución en un universo tipo videojuego para explorar computacionalmente los principios de la inteligencia visual biológica y nuevas formas de inteligencia artificial
- Los agentes empiezan con una sola célula sensible a la luz y un cerebro pequeño, y hacen evolucionar la inteligencia visual bajo física real, restricciones corporales y presión de supervivencia
- Al cambiar los objetivos, como navegación y detección, se puede comparar qué estructuras oculares y comportamientos aparecen de forma natural
- Cuando el cerebro y el ojo se escalan juntos, aparece un escalado de ley de potencia, pero si la visión es el cuello de botella, aumentar solo el cerebro deja de mejorar el comportamiento
- Al activar los genes ópticos, la óptica tipo lente aparece repetidamente y funciona resolviendo el trade-off fundamental entre recolección de luz y precisión espacial
Un entorno experimental para volver a ejecutar la evolución de la visión
- What if Eye...? parte de la idea de que “la evolución ocurrió una vez” y recrea computacionalmente la evolución visual en un universo tipo videojuego
- El objetivo no es una inteligencia visual diseñada con datasets fijos y sesgos humanos, sino hacer que el hardware de detección y el software de percepción, razonamiento y acción emerjan dentro del entorno
- Los agentes comienzan solo con una sola célula sensible a la luz y un cerebro pequeño
- Enfrentan condiciones físicas reales
- Están sujetos a restricciones corporales
- Hacen evolucionar la inteligencia visual bajo presión de supervivencia
- Cada experimento está planteado como una hipótesis
- Define preguntas tipo what-if o condiciones contrafactuales
- Hace evolucionar agentes con cuerpo dentro de un motor físico tipo videojuego
- Observa qué ojos y comportamientos aparecen
Condiciones en las que ojo y cerebro evolucionan juntos
- Cuando cambian los objetivos de la visión, los agentes evolucionan en un mundo con solo dos tareas
- NAVIGATION: el objetivo es moverse hacia la izquierda lo más rápido posible evitando las paredes del laberinto, que actúan como obstáculos
- DETECTION: el objetivo es detectar alimento y evitar veneno
- En condiciones donde el cerebro se mantiene pequeño durante toda la evolución, al escalar de forma sistemática el tamaño del ojo y del cerebro juntos aparece un escalado de ley de potencia entre capacidad neuronal y rendimiento en la tarea
- Esta relación solo se cumple cuando la resolución visual también escala al mismo tiempo
- Si la resolución visual es el cuello de botella, aumentar solo el cerebro no lleva a un mejor comportamiento
- En condiciones donde el ojo puede refractar la luz, se activan los genes ópticos
- Sin óptica, una estrategia de agujero estenopeico puede producir imágenes nítidas, pero sacrifica luz y llega a un límite
- Con óptica, las lentes emergen como una forma de resolver el trade-off entre recolección de luz y precisión espacial
- El genotipo integrado incluye tanto el hardware, es decir, el sensor visual físico, como el software, es decir, los componentes de aprendizaje
- Los genes morfológicos determinan características de muestreo espacial como la posición del ojo y el ángulo de visión
- Los genes ópticos manejan la interacción con la luz, como el número de fotorreceptores, los elementos ópticos y el tamaño de la pupila
- Los genes neuronales especifican la capacidad de aprendizaje
- Separar los tres clústeres de genes para que puedan mutar de forma independiente permite explorar trayectorias evolutivas realistas
Materiales públicos y presentaciones
- El proyecto ofrece artículos, una hoja de ruta, presentaciones, herramientas open source y una exhibición pública
- Las principales publicaciones son las siguientes
- Computationally Recreating Vision Evolution: artículo revisado por pares en Science Advances con la configuración experimental completa, los resultados y el análisis evolutivo
- A Roadmap for Generative Design of Visual Intelligence: texto de MIT Press que organiza por qué la inteligencia visual debe generarse en lugar de diseñarse a mano, junto con aplicaciones y enfoques
- Designing Imaging Systems with Reinforcement Learning: artículo de ICCV que propone un método para codiseñar sistemas de imagen y modelos perceptivos especializados por tarea a partir de retroalimentación del entorno
- Emergence of foveal image sampling from learning to attend in visual scene: artículo de NeurIPS sobre cómo el muestreo de imagen foveal emerge al aprender a prestar atención en una escena visual
- Designing neural network architectures using reinforcement learning: artículo de ICLR sobre el diseño de arquitecturas de redes neuronales con aprendizaje por refuerzo para mejorar el rendimiento en tareas visuales
- The First Signs of Vision: tesis del MIT de Cathy Chang sobre una simulación interactiva de la evolución de la visión animal desde la explosión cámbrica hasta hoy
- Las presentaciones públicas incluyen lo siguiente
- Presentación de Brian Cheung titulada "The Emergence of Convergence in Different Levels of Biology and AI" en Symposium on the Platonic Space
- Presentación de Kushagra Tiwary titulada "Embodied Eyes For Scientific Discovery: Generation and Verification Loops to ask the "why" questions in vision" en UC Berkeley's Redwood Center
- Presentación de Kushagra Tiwary titulada "What-If Machines for Vision: Evolving Eyes and Brains with AI" en Imagination in Action
- Una charla TEDx que explora las implicaciones más amplias de hacer evolucionar la inteligencia visual con agentes artificiales
- También se ofrecen elementos de código y exhibición
- Simulator: herramienta open source para ejecutar el simulador evolutivo, definir nuevas tareas y hacer evolucionar directamente agentes con cuerpo
- Colab Notebook: notebook interactivo para experimentar con agentes cambrian en el navegador, que todavía está pendiente de publicación
- Video Exhibition: exhibición participativa abierta al público que permite a los visitantes experimentar directamente la evolución de la visión
- Esta colaboración cuenta con apoyo de MIT GenAI Impacts of Generative AI Grant
1 comentarios
Opiniones de Hacker News
En la preparatoria, un profesor de ciencias de la computación nos dio una clase sobre los ojos de los cangrejos herradura.
Dijo que los ojos de los cangrejos herradura no pueden ver cosas más grandes que su campo visual, así que comen organismos pequeños e ignoran los grandes, y para explicarlo usó un modelo de red neuronal en Excel.
Era un gran profesor; nos enseñó a tener curiosidad e intuición en ciencias de la computación, y también nos presentó a Donald Knuth, TeX, etc.
Me pregunto si es como cuando una persona tiene frente a los ojos un objeto suficientemente grande y uniformemente luminoso, y resulta difícil decir que lo “ve”.
Dawkins también explica aquí de forma concisa la evolución del ojo: https://www.youtube.com/watch?v=2X1iwLqM2t0
Esa condición es tan básica que pasar de cero a “una capa de células sensibles a la luz” parece casi nada, pero en realidad no lo es.
Antes de eso hacen falta proteínas fotorreceptoras, un sistema nervioso funcional o vías de procesamiento de señales, un mecanismo que convierta la absorción de luz en señales eléctricas, y un sistema que coordine esas señales con otras partes del organismo.
Quizá sea una pregunta más de física/ciencias de la computación que de biología, pero me pregunto cuánto falta para tener un simulador físico lo bastante bueno como para hacer, con organismos completos, el experimento que hizo el MIT con los ojos.
Si algún día fuera posible y al introducir la física de la Tierra produjera organismos más o menos parecidos a los de la Tierra, parecería posible introducir la física de un exoplaneta para averiguar qué aspecto tendrían sus formas de vida.
Creo que todavía estamos bastante lejos de modelar la complejidad de un organismo completo. Pero si el objetivo es responder preguntas de investigación, incluso hoy se pueden modelar versiones más simples. Es posible, como hizo este equipo al abordar cómo evoluciona la visión.
Recientemente también se modeló en 3D a C. elegans, incluyendo todas sus neuronas y neurotransmisores, y respondió a estímulos virtuales como un gusano real (https://www.nature.com/articles/s43588-024-00738-w)
Un solo organismo ya es posible, pero creo que lograr que seres así evolucionen en 3D tomará más tiempo. Por cierto, no soy especialista en ciencias de la computación, solo un aficionado.
Depende de qué tan preciso quieras que sea el modelo, y si pensamos en un nivel de ensueño, creo que para que una simulación así tenga sentido haría falta computación cuántica.
La idea de leyes como las que se aplican en matemáticas quizá no encaje con los organismos vivos, porque los organismos se explican mediante teleología. El corazón no hace circular la sangre por accidente; late para hacer circular la sangre con el fin de suministrar oxígeno al cuerpo.
Además, que los organismos que viven en climas fríos suelan tener pelaje grueso no significa que el pelaje grueso implique un clima frío. Algunos mamíferos ocupan el nicho ecológico que en otros ecosistemas ocupan las aves, y en otros lugares ese papel lo cumplen los peces. En Nueva Zelanda, las aves llegan a ocupar nichos que en otros ecosistemas ocuparían los mamíferos.
No sé si la biología puede ser una ciencia puramente inductiva.
También hay una categoría bastante entretenida de videos relacionados en YouTube: https://www.google.com/search?q=simulating+evolution+muscles
Por lo general son en 2D o incluyen grandes simplificaciones. Si se intentara evolucionar organismos “reales”, creo que la complejidad explotaría muy rápido, incluso ignorando el “cerebro”.
Me recordó al “Autoverse” de Permutation City (1994), de Greg Egan. Si te gustó este artículo, lo recomiendo mucho.
Un dato interesante sobre la evolución de los ojos: el punto negro que se ve en los ojos de las libélulas no es una pupila que te siga ni un cambio en el ojo mismo.
En realidad estás mirando de frente la estructura columnar del ojo de la libélula. Captura la luz con muchísima eficiencia, por eso se ve negra, y en términos de eficiencia está muy cerca del límite físico.
Por mi experiencia creando simuladores de vida artificial en los 90, demasiadas partes del modelo dependen de los parámetros que introduce quien escribe la simulación.
Si empiezas con células sensibles a la luz y creas un algoritmo genético que recompensa a los agentes que atraviesan bien un laberinto, al final “evolucionarán” agentes que usan varias células fotosensibles como si fueran ojos.
La duda es si eso realmente nos dice algo sobre la evolución o la vida, o si solo nos dice algo sobre la simulación que configuramos.
Esto se parece más a un modelo que a una simulación, y es un modelo que intenta explicar un fenómeno real específico de la forma más enfocada y concisa posible.
Lo que se puede obtener aquí es que dos tipos de ojos, los compuestos y los de tipo cámara, pueden modelarse como un conjunto de 3 tareas específicas junto con un mínimo de factores de regulación anatómica.
Entonces sí puede ser útil comparar y contrastar la evidencia clara que sale del modelo, y ver cómo una explicación así encaja con las explicaciones menos concluyentes que se obtienen mediante los métodos de la biología evolutiva.
Una buena analogía sería ver si con compuertas, latches y relojes basta para explicar la “aparición” de las microarquitecturas superescalares modernas. Es decir, no hace falta modelar todo el caos analógico que surge al meter altas frecuencias en circuitos físicos.
La pregunta adecuada quizá sea si ese conocimiento es totalmente inútil o si podría servir para algo más adelante.
Para que el título dijera “desde cero”, esperaba ver cómo un fotorreceptor único también evolucionaba a partir de otra cosa.
Mientras lo resuelven del otro lado, dejé un espejo temporal del sitio web: https://cambrian.pages.dev/
Parece que el sitio web estaba roto (¿tal vez borraron el repositorio?), así que tuve que ir aquí en su lugar: https://eyes.mit.edu/ACI/
Y el paper que trata ese sitio web está aquí: https://arxiv.org/pdf/2501.15001
Soy el autor. Si tienen preguntas, las respondo.