-
Agradecimiento por las contribuciones de Jan y explicación de la estrategia
- Agradecen las contribuciones de Jan y creen que seguirá aportando a la misión desde afuera.
- Quieren explicar su estrategia respecto a las preguntas que planteó su salida.
-
Aumentar la conciencia sobre los riesgos y oportunidades de la AGI
- Buscan aumentar la conciencia sobre los riesgos y oportunidades de la AGI para que el mundo pueda estar mejor preparado.
- Han demostrado en repetidas ocasiones la escalabilidad del deep learning y han analizado sus implicaciones.
- Han pedido gobernanza internacional para la AGI, un tema que en ese momento no era popular.
- Fueron pioneros en la ciencia de evaluación de riesgos catastróficos en sistemas de IA.
-
Sentar las bases para desplegar sistemas seguros
- Están sentando las bases para el despliegue seguro de sistemas cada vez más capaces.
- Hacer segura una nueva tecnología por primera vez no es algo sencillo.
- Realizaron mucho trabajo para presentar GPT-4 al mundo de forma segura.
- Siguen mejorando continuamente el comportamiento del modelo y el monitoreo de abusos con base en las lecciones aprendidas del despliegue.
-
Desafíos a futuro
- El futuro será más difícil que el pasado.
- Deben seguir elevando el trabajo de seguridad de acuerdo con la importancia de los nuevos modelos.
- Lo han sistematizado mediante el Preparedness Framework introducido el año pasado.
-
Visión del futuro
- Esperan que, a medida que los modelos se vuelvan más poderosos, se integren más profundamente en el mundo.
- Los usuarios ya no interactuarán solo con un único modelo y entradas y salidas de texto, sino con sistemas compuestos por múltiples modelos multimodales y herramientas.
-
Desarrollo de sistemas seguros y beneficiosos
- Creen que estos sistemas serán muy beneficiosos y útiles para las personas, y que podrán ofrecerlos de forma segura.
- Para lograrlo, hace falta mucho trabajo de base.
- Esto incluye considerar cuidadosamente con qué cosas se conectan durante el entrenamiento y encontrar soluciones a problemas difíciles como la supervisión escalable.
- Aún no saben cuándo alcanzarán el nivel de seguridad de lanzamiento mientras construyen en esa dirección, pero está bien si el calendario de lanzamiento se retrasa.
-
Bucles de retroalimentación y pruebas exhaustivas
- Reconocen que no pueden imaginar todos los escenarios futuros posibles.
- Se necesitan bucles de retroalimentación muy estrechos, pruebas exhaustivas, consideración cuidadosa en cada etapa, seguridad de clase mundial y un equilibrio entre seguridad y capacidad.
- Seguirán realizando investigación de seguridad en distintos horizontes temporales.
- Mantienen la colaboración con gobiernos y diversas partes interesadas.
-
Comprensión del camino hacia la AGI
- No existe un manual probado para recorrer el camino hacia la AGI.
- La comprensión empírica ayudará a orientar cómo avanzar.
- Están trabajando para ofrecer enormes beneficios mientras mitigan riesgos serios.
- Se toman su papel muy en serio y revisan cuidadosamente el feedback sobre sus acciones.
1 comentarios
Opiniones de Hacker News
En una empresa tecnológica lo suficientemente grande, las organizaciones de mitigación de riesgos como legal, compras o IT no tienen más remedio que moverse dentro de la ventana de Overton entre los riesgos que la empresa las contrató para evitar y el deseo de la alta dirección de avanzar rápido cuando siente que es necesario.
Las personas encargadas de riesgos ven una y otra vez cómo advertencias cada vez más fuertes son ignoradas o refutadas de frente, hasta que al final se adaptan o se van porque choca con su sentido ético.
Tal vez la “AGI” y el miedo a una extinción de la humanidad estén haciendo que esto parezca más dramático de lo necesario. Si cambias AGI por “no hay política que prohíba el uso de dispositivos personales”, probablemente haya algún caso en una startup donde la persona de seguridad se obsesionó con la política, pero la dirección no, y al final esa persona renunció.
O quizá realmente sea tan grave y peligroso como parece. Desde afuera es difícil juzgarlo.
Ya sea que la reciente pelea pública no sea más que drama interno o política filtrada, o que dentro de la empresa no estén tratando este asunto con suficiente seriedad, ninguna de las dos opciones es buena.
Esta organización se ve cada vez más como un circo y, peor aún, como una organización que perdió de vista lo esencial. Es muy inquietante que estas personas estén “liderando” la comercialización de esta tecnología y marcando el tono de la industria. Sobre todo cuando parece que figuras clave que se sumaron por principios y razones morales se están yendo en masa.
Al final, parece que pronto veremos qué pasa cuando todo este dinero, poder, responsabilidad y confianza se le entrega a Silicon Valley.
Un modelo superinteligente que se niega a seguir instrucciones es tan inútil como un modelo tonto que no las entiende. El equipo de alineación también era parte de la carrera por construir modelos más potentes. Si quieres entenderlo mejor técnicamente, puedes ver el último paper de OpenAI: https://openai.com/index/weak-to-strong-generalization/
Por supuesto, si convences a la gente de que los modelos de lenguaje grandes tienen agencia implementada y pueden abrirse paso fuera del sistema como un virus informático, puedes presentarlo como un problema general de seguridad. Pero los modelos de lenguaje grandes son generadores de texto. Físicamente no pueden hacer nada, y solo pueden actuar si nosotros se lo permitimos y los conectamos a algo.
El verdadero riesgo está en que la gente no entienda esto y que muchas personas quieran conectar estos modelos a situaciones peligrosas solo porque OpenAI garantizó que son seguros. Si no tienes acceso a los datos de entrenamiento, no puedes saber qué comportamientos se aprendieron ni cómo actuará el modelo. Con los datos de entrenamiento puedes entenderlo mucho mejor, y la incertidumbre restante es solo la no determinación de la implementación. Aun así, al menos es un proceso probabilístico explicable.
Dejaron que el equipo de seguridad tomara la delantera y el resultado fue un producto odiado por todos. Pero ahora es interesante ver que la comunidad tecnológica también odia a una empresa que, por lo general, crea productos de primer nivel, porque no dejó que el equipo de seguridad dominara el desarrollo del producto.
El resultado es una puesta en escena donde el doblepensar y la neolengua se vuelven la norma, y para quedarse hay que priorizar la interpretación menos gravosa de la letra de las leyes aplicables por encima de su espíritu, y también priorizar la propia puesta en escena.
También vale la pena ver [1] como una forma muy práctica de pensar la realidad de una cultura de seguridad sostenible.
[1] https://github.com/lorin/resilience-engineering/raw/master/b...
La idea de que la IA va a eliminar a la humanidad para fabricar clips me molesta porque desvía la atención de los peligros reales que están ocurriendo ahora mismo.
Los estafadores están en su época dorada, y sus capacidades van a mejorar y volverse más fáciles de usar. La gente está confiando ciegamente en resultados alucinados y, en la práctica, se está volviendo más tonta. Incluso la comunicación cotidiana se está derrumbando, porque ya no puedes confiar en que la otra persona no haya copiado y pegado tonterías de una IA en lugar de debatir de verdad.
Ya vi productos de novias con IA, y al ver la cantidad de usuarios que tienen algunos de ellos no me inspira confianza en nuestro futuro como especie.
El mayor problema es que todo tipo de ejecutivos de altísimo nivel y perfiles MBA desquiciados solo están interesados en exprimir hasta el último centavo, sin importar los medios. Eso incluye despedir y reemplazar de golpe a miles de personas con chatbots mediocres, propiedad de empresas respaldadas por Microsoft.
No creo que la IA vaya a lanzar armas nucleares, pero sí creo que reemplazará el trabajo de todos y hará más fuertes a los poderosos. “¡Pero tendremos ingreso básico!”, gritará algún adulador de la IA, pero decir palabras mágicas no cambia el mundo real.
Si el propósito de una tarea es producir la mayor cantidad posible de basura lo más rápido posible, los grandes modelos de lenguaje serán excelentes.
No se veían smartphones; la gente iba físicamente, hablaba entre sí, compraba comida local, se reía y tomaba algo. Después comían en la casa de algún amigo o hacían actividades al aire libre. En cambio, para quienes viven pegados a internet, sin duda se ve sombrío.
Curiosamente, muchos ejecutivos parecen creer literalmente que minimizar los costos laborales es más importante que entregar valor a los clientes.
También estoy de acuerdo con el problema de las novias virtuales. Si a eso le sumas la VR, los varoncitos cada vez más aislados socialmente van a satisfacer sus necesidades con esta tecnología.
Es cierto que la IA puede generar mucho contenido automatizado, pero mi argumento es que casi siempre, en el mejor de los casos, es mediocre.
Hay mucho que decir sobre que el peligro de la IA no viene de la IA en sí, sino de las personas que la operan y la financian. Decir que la IA en sí es peligrosa es una completa estupidez.
Los grandes modelos de lenguaje son útiles hasta cierto punto, pero por lo que he probado, todavía no están listos para tareas más difíciles que las muy básicas.
Gritar fuerte sobre la seguridad de la IA y generar sensación de catástrofe se siente como una estrategia para aumentar la importancia de OpenAI y exagerar las capacidades de los grandes modelos de lenguaje. Esta era de la “IA” trata de máquinas que fingen poder pensar y de las personas que las construyen fingiendo ser profetas.
Durante décadas, mucha gente ha defendido la seguridad. Predijeron y construyeron la trayectoria de la IA, tuvieron razón, y deberíamos escucharlos.
“Si aceptamos que el impacto de las máquinas verdaderamente inteligentes probablemente será profundo, y que existe aunque sea una pequeña posibilidad de que esto ocurra en el futuro previsible, lo prudente es intentar prepararnos con anticipación. Si esperamos hasta que parezca muy probable que las máquinas inteligentes estén por llegar, será demasiado tarde para discutir y reflexionar lo suficiente sobre los problemas relacionados.”
~ Cofundador de DeepMind, 2008
https://www.vetta.org/documents/Machine_Super_Intelligence.p...
Es bastante posible que sean personas profundamente ingenuas, con muy poca comprensión de la base empírica de lo que hacen.
“Pedimos gobernanza internacional para la AGI antes de que fuera popular”, pero en cuanto esa gobernanza estuvo por implementarse de verdad, amenazaron con retirarse de la UE.
Dicen: “Hemos estado sentando las bases para desplegar de forma segura sistemas cada vez más capaces. No es fácil descubrir cómo hacer segura una tecnología nueva por primera vez”, pero eso es especialmente cierto cuando OpenAI no es para nada open.
Dicen: “cuidado con a qué se conecta durante el entrenamiento, soluciones a problemas difíciles como la supervisión escalable, nuevos tipos de trabajo de seguridad”, pero eso era lo que pedía la UE. Cuando les exigieron revelar fuentes con copyright, documentar modelos fundacionales, etc., amenazaron con retirarse.
La traducción de “creemos que la comprensión empírica puede orientar el camino a seguir. Nosotros tenemos una enorme…” es: “queremos mantenernos lo más cerrados posible y conseguir suficientes fosos defensivos y empresas dependientes de nosotros para seguir siendo relevantes e indispensables”.
Ellos tampoco quieren morir, así que no hace falta pensar que no tienen incentivos para mantener a todos a salvo.
Hay algunos hechos
Esto es una respuesta a la afirmación de Jan: https://x.com/janleike/status/1791498174659715494
La respuesta no contiene nada concreto sobre alineación de IA. No sabemos cuándo podrá desarrollarse la alineación de IA. La ética de la IA y el sesgo de la IA son necesarios, pero son temas distintos de la alineación de IA. Tampoco sabemos cuándo se desarrollará una IA que implique un riesgo existencial
Si antes de la alineación de IA se desarrolla una IA que implique un riesgo existencial, hay cierto riesgo de extinción humana. OpenAI está en la primera línea del desarrollo de IA con riesgo de extinción humana y no está asignando suficientes recursos a la alineación de IA
Me empezó a incomodar suscribirme a ChatGPT
Como muchos coinciden, el riesgo de la IA no es una entidad sobrehumana incontrolable
El riesgo es mucho más cercano y realista. Cosas como identificar mal expresiones al aplicar modelos de lenguaje grandes a la moderación de chats, sacar conclusiones equivocadas al resumir un informe militar de 100 páginas, o alucinar algunos detalles en una noticia que años después terminan aceptándose como hechos históricos
La larga cola de estos resultados crecerá tanto como la escala de uso de los modelos de lenguaje grandes. Algún problema individual que no era visible podría tener un impacto mucho mayor que otros. Las muertes causadas por esto llevarán a más regulación, y otros resultados simplemente se convertirán en nuestra nueva forma de vida
Aunque una máquina sea menos precisa que un humano haciendo el mismo trabajo, es más fácil de auditar, su comportamiento es repetible y es escalable. Incluso si mucha gente muere por un error de guerra imaginable, quizá aun así sea mejor, porque los humanos en cambio harán trabajos mejores
Al final es un trade-off
Me molesta esa forma de usar solo nombres, como “Sam y Greg”, para transmitir una relación cercana con la empresa
El intento de parecer casual y humano se ve falso, y al mismo tiempo esa actitud de elevarlos en la cultura popular solo por su nombre parece arrogante
“Por ejemplo, nuestro equipo hizo mucho trabajo para lanzar GPT-4 al mundo de forma segura”, ¿es broma?
No creo que debamos preocuparnos por la superalineación cuando OpenAI ni siquiera puede definir o probar adecuadamente la AGI
Si dijeran “moderación de modelos”, no sonaría tan sexy, ¿no?
El miedo a que la AGI destruya a la humanidad parece venir principalmente de la sospecha de que un dispositivo que piensa lógicamente realmente llegaría a la conclusión de que debemos ser eliminados
Si haces que una AGI administre una fábrica de clips, cuando vuelvas algún día, la mayor parte del carbono y el hierro de la galaxia podría haber sido reconfigurada en clips. Que la flora y fauna locales de allí se extingan sería solo un subproducto de ese impulso. Para un resumen sencillo, ver [2]
[2]: https://selfawaresystems.com/wp-content/uploads/2008/01/ai_d...
Pero ¿por qué tendría que extinguir a los humanos? ¿No podría crear reservas naturales para nosotros y otros seres vivos, para la conservación y el estudio biológico? Ese tipo de enfoque existe en sociedades humanas desde hace miles de años
Si creamos algo parecido a nosotros pero mucho más capaz, estaremos aterrados y en problemas