1 puntos por GN⁺ 2024-11-15 | 1 comentarios | Compartir por WhatsApp
  • El investigador y escritor anónimo de internet Gwern Branwen es presentado como alguien que adoptó temprano la tendencia del escalado de los LLM, algo que muchos comentaristas de IA pasaron por alto alrededor de 2020.
  • Considera que el anonimato, más allá de evitar represalias, crea la oportunidad de que al menos te lean al impedir que el lector encierre al autor en una identidad o nicho específico y lo descarte de inmediato.
  • Cree que en la automatización empresarial pesa más la presión bottom-up, que sube desde las tareas inferiores, que una transformación impuesta desde el CEO hacia abajo, y que es más realista una estructura donde ejecutivos humanos tomen las decisiones de largo plazo en organizaciones de IA.
  • Gwern ve la inteligencia como una búsqueda sobre máquinas de Turing y enfatiza el poder del compute, los datos y el trial and error a través de GPT-1, GPT-2, GPT-3, el paper de scaling laws de Baidu de 2017, AlphaZero y BigGAN.
  • Bajo la suposición de que la AGI llegará en pocos años, se vuelve más importante que terminar cada proyecto personalmente el dejar registrado aquello que la IA no puede decidir por uno, como preferencias, deseos, evaluaciones y juicios, para que sirva como material de ejecución futura.

Anonimato, avatar y organizaciones automatizadas

  • La entrevista fue grabada en persona, pero se usó un avatar para proteger el anonimato de Gwern.
    • La cara y la voz del video no son reales; solo las palabras son de Gwern.
  • Una ventaja subestimada del anonimato es que dificulta que el lector meta al autor en una identidad o nicho específico y lo descarte por adelantado.
    • También sirve para evitar represalias, pero Gwern considera más importante que le da al menos la oportunidad de ser leído sin ser excluido de inmediato por el contexto.
    • También lo considera beneficioso porque evitó cosas como que le enviaran heroína a su casa o que le hicieran denuncias falsas para un operativo SWAT.
  • Cree que en la automatización empresarial es más fuerte la presión bottom-up, que asciende desde los trabajadores y las tareas de nivel inferior, que un modelo top-down donde se reemplaza primero al CEO.
    • En las organizaciones existentes, es más fácil aceptar un proceso que sustituya primero los puestos de abajo y luego vaya subiendo.
    • En última instancia, imagina una empresa compuesta por IA supervisada por ejecutivos humanos.
  • Desde una perspectiva de aprendizaje por refuerzo, las áreas donde los humanos podrían ser mejores que la IA serían la visión de largo plazo, las nuevas estrategias de largo plazo y la detección de oportunidades.
    • Es posible una estructura donde un CEO humano marque la visión, una organización de IA se encargue de proponer y ejecutar, y el CEO humano elija entre esas opciones.
    • Considera que este tipo de empresa dirigida por humanos podría tomar mejores decisiones a largo plazo que una compuesta por IA por completo.
  • Gwern cree que, incluso en su propio trabajo, el rol humano que quedará hasta el final se parecerá más a una selección al estilo Steve Jobs.
    • Imagina a minions de IA trayéndole ensayos, mientras él elige cuál texto es mejor y decide en qué dirección empujarlo más.

Organizaciones de IA y unidades de selección

  • En una empresa compuesta por IA, la unidad de selección podría ser mayor que un modelo individual: un “paquete de mentes” o una unidad de departamento.
    • Si los modelos individuales pueden copiarse perfectamente, la unidad de selección se desplaza a un nivel más alto.
    • Una mind individual puede entrenarse de forma diferenciable, pero las interacciones entre minds son difíciles de entrenar directamente.
  • Puede haber grupos de modelos que encajen bien en conjunto, incluso si no pueden reducirse a elementos específicos de interacción.
    • El ejemplo es una unidad departamental que incluye tipos de programmer, manager, secretary, financial y legal.
    • Cuando se necesita una nueva unit, sería posible copiar un paquete base, introducir variaciones aleatorias en cada componente y conservar el paquete con mejor desempeño.

Genealogía de la Singularity y teoría de la inteligencia

  • Sobre desde cuándo podía preverse la Singularity, Gwern cree que hay que remontarse al menos a Erewhon de Samuel Butler de 1872 o al ensayo de 1863 “Darwin among the Machines”.
    • Butler escribió explícitamente en 1863 una visión en la que la vida mecánica se desarrolla cada vez más, adquiere autonomía y finalmente se convierte en una amenaza para la humanidad.
    • Butler concluye respecto de las máquinas que “war to the death should be instantly proclaimed against them”.
    • Gwern dice que no está seguro de que exista un escenario de Singularity más claro anterior a 1863.
  • Se dice que Isaac Newton explicaba los inventos y avances de su época no como una aceleración tecnológica real, sino como un fenómeno en el que la civilización es destruida cada ciertos miles de años y luego redescubre conocimientos del pasado.
    • Dwarkesh lo ve no como una paradoja de Fermi sobre civilizaciones alienígenas en el espacio, sino como una paradoja de Fermi sobre civilizaciones distintas en el tiempo.
    • Gwern dice que Lucrecio también usó una lógica similar al observar la innovación y el saber de Roma hace unos 1,700 años.
  • La teoría de la inteligencia de Gwern es una “búsqueda sobre las máquinas de Turing”.
    • Todo lo que sucede puede describirse como máquinas de Turing de distintas longitudes.
    • Aprender o escalar consiste en explorar más máquinas de Turing, y más largas, para aplicarlas a casos concretos.
    • No existe un master algorithm general ni un intelligence fluid especial; lo que hay es aprendizaje de una enorme cantidad de casos especiales que luego se codifican en el cerebro.
  • También ve las diferencias en la inteligencia humana como diferencias en explorar más máquinas de Turing, por más tiempo, con más compute.
    • Dice que probablemente no exista en el cerebro una zona equivalente a una “glándula del IQ” encargada de la inteligencia fluida.
    • Cree que el cerebro aprende muchos problemas especiales individuales y luego estos se recombinan para parecer inteligencia fluida.
    • Un gran modelo de neural network puede verse como un enorme ensemble de small models ajustados a muchos problemas pequeños.
  • La razón por la que la inteligencia general a nivel humano tardó tanto en evolucionar sería que, para muchos organismos, mecanismos ajustados a problemas específicos pueden ser más adaptativos que una inteligencia de propósito general.
    • Con suficiente evolución, una máquina de Turing pequeña puede ser codificada más directamente por los genes.
    • En un nicho estático, un nicho donde la inteligencia es muy costosa, o en organismos con vida corta y poco tiempo para aprender, los mecanismos especializados para problemas concretos pueden ser mejores que el aprendizaje al estilo humano.

Cómo adoptó temprano la idea del escalado

  • La perspectiva de Gwern sobre el escalado comenzó al leer a Moravec y Ray Kurzweil a mediados de los 2000
    • Dice que ambos defendían una postura conexionista según la cual, con suficiente compute, se podría llegar a descubrir una neural network architecture adecuada para el cerebro humano
    • En ese momento, Gwern lo veía como una especie de “magical thinking”, y era escéptico porque pensaba que los algoritmos eran complejos y requerían intuiciones profundas o matemáticas difíciles
  • Mientras se interesaba por LessWrong, el transhumanismo y el riesgo de la IA, siguió los escritos de Shane Legg y conoció sus predicciones
    • Según Gwern, Legg predecía que, si la Ley de Moore continuaba, hacia 2019 aparecería el primer sistema generalista, hacia 2025 agentes casi humanos con capacidades generalistas y hacia 2030 la AGI
  • Después de DanNet y AlexNet, Gwern confirmó casos de éxito impresionantes del conexionismo
    • Empezó a fijarse en si se trataba de éxitos aislados o de la misma línea de Kurzweil, Moravec y Legg, según la cual, cuando aparecieran las GPU, surgirían mejores algoritmos
    • Al seguir leyendo la literatura de deep learning, vio crecer el tamaño de los dataset, el tamaño de los modelos y el uso de GPU, mientras el campo de aplicación de las neural network se expandía de use case estrechos a otros cada vez más amplios
    • Al ver en arXiv cómo las CNN se aplicaban cada día a problemas distintos, se inclinó hacia la idea de que “la inteligencia podría ser aplicar mucho compute, data y parameters
  • La familia GPT fue un punto de inflexión importante para cambiar su juicio
    • Le sorprendió la sentiment neuron no supervisada de GPT-1, porque mostraba que aprendía por sí sola
    • El prompting y la summarization de GPT-2 le dieron con fuerza la sensación de que estábamos viviendo en un mundo de escalado
    • Vio a GPT-3 como un scale-up masivo de GPT-2 y como una prueba importante para medir la validez del escalado, no en una tarea estrecha como Go, sino de forma más general
    • Al ver la gráfica de few-shot learning al inicio del paper de GPT-3, concluyó: “we are living in the scaling world”
  • Cree que alrededor de 2020 había dos razones por las que muchos comentaristas de IA no vieron venir los LLM, GPT-3 y las scaling laws
    • No habían seguido lo suficiente los resultados previos sobre escalado y no supieron evaluar retrospectivamente qué resultados eran importantes
    • Compartían la creencia de que los algoritmos son más importantes que el compute
  • Gwern considera que el compute va primero, porque permite trial and error y serendipity
    • Diferencias pequeñas en hyperparameters o en la elección de architecture pueden cambiar mucho el resultado, pero si solo puedes intentarlo unas cuantas veces, es fácil concluir que algo no funciona y abandonarlo
    • Con mucho compute, puedes seguir probando hasta encontrar una solución que funcione bien, y luego convertirla en una solución robusta mediante simplificación, mejora y análisis de causas
  • Cree que en la literatura antigua de deep learning ya existían ideas modernas, pero que no podían usarse de verdad por falta de compute
    • Explica que ResNet se publicó en 1988 y funcionaba, pero era de una escala tan pequeña que no tenía utilidad práctica y se olvidó, hasta que en 2015 apareció como una revolución del deep learning
    • También considera que el caso de BigGAN escalado hasta 300 million images fue un resultado que la gente no observó con suficiente atención

Proyectos y escritura en la era de la AGI

  • La timeline de AGI de Gwern entre 2005 y 2010 estaba muy lejos, como si fuera después de 2050
    • Dice que, después de AlexNet y DanNet, esa timeline se acortaba a un ritmo de dos años por cada año transcurrido
    • Considera que el deep learning siguió superando barreras, mientras que los paradigmas alternativos no rindieron bien y este paradigma sí lo hizo muy bien
  • Cree que después de AlphaGo algunas personas actualizaron en exceso sus creencias por el hype de la IA
    • Cuando los grandes intentos de reinforcement learning posteriores a Dota no funcionaron bien en problemas difíciles fuera de universos de juego simulados, Gwern también pensó que él mismo se había adelantado demasiado
    • Tras la llegada de GPT, borró ese juicio y pasó a ver el RL como la cereza sobre el pastel de los generative model
  • Si uno se toma en serio que la AGI llegará en pocos años, no hace falta implementar personalmente todos los proyectos
    • Hace ahora las cosas que quiere hacer o disfruta, aunque la IA pueda hacerlas dentro de 3 años
    • Algunos proyectos pueden dejarse esbozados con claridad —qué se quiere, por qué sería bueno y cómo hacerlo— para que una AGI mejor los ejecute después
  • Gwern cree que en adelante debería registrar más sus preferences, desires, evaluations, judgments
    • La IA “no puede comer helado por ti” ni puede decidir en tu lugar qué helado te gusta
    • Sus criterios para juzgar en qué trabajar son tres
      • Si es algo que hace porque lo disfruta, independientemente de la IA futura
      • Si es algo donde solo hace la parte que deben hacer los humanos y la AGI podrá encargarse después del resto
      • Si consiste en escribir hoy algo que no quedaría registrado de otro modo, para ayudar a una versión futura de sí mismo asistida por IA
    • Básicamente intenta no hacer cosas que no caigan en una de esas tres categorías
  • Sobre cuándo la IA podrá escribir ensayos de calidad Gwern, dice que tiene ideas para lograrlo incluso sin AGI, si se combina todo el corpus
    • Muchas ideas potenciales de ensayos ya están casi completas dentro del corpus, así que quizá no haga falta una superinteligencia para extraerlas
    • Como referencia general para planificar en torno a la AGI, dice que la timeline de Anthropic de 2028 parece un buen punto de partida
  • Ve la escritura como un acto que influye en el Shoggoth del futuro
    • Los tokens que el LLM debe predecir son una de las pocas currency que la IA reconoce, y escribir se parece a votar por el futuro
    • Los valores, gustos y deseos que no se expresan en texto en línea prácticamente no existen para la IA
    • En la línea de “If it wasn’t written down, it wasn’t written down”, la información autobiográfica no registrada o las emociones de un momento específico son difíciles de reconstruir después a partir de rastros

Rabbit holes, discapacidad auditiva, Wikipedia

  • Gwern dice que lo que intenta maximizar en la vida son los rabbit holes
    • Lo que más espera es hundirse a fondo en ideas o áreas nuevas que antes no conocía en absoluto
    • Dice que, a partir del caso de gatos que no reaccionan al catnip, terminó investigando por qué algunos gatos son inmunes al catnip e incluso fármacos alternativos al catnip
  • Al mismo tiempo, considera que el máximo de rabbit holes que puede explorar a fondo es 2 o 3
    • Si son más que eso, se parecen más a un interés pasajero que a algo en lo que realmente invierte esfuerzo para profundizar
    • Un rabbit hole tiene que ser obsesivo; si no sigue atrayéndote, no es un verdadero rabbit hole
  • Como el rabbit hole en el que estuvo metido durante más tiempo pero que no continuó de forma satisfactoria, menciona su trabajo inicial relacionado con Neon Genesis Evangelion
    • Leyó casi todo el material escrito en inglés e intentó entender el proceso de desarrollo y por qué la obra terminó siendo así, pero en ese momento no obtuvo una respuesta clara y acabó agotado
    • Dice que varios años después lo entendió por casualidad, pero que ya no le queda suficiente interés como para volver a escribirlo o terminarlo
  • Gwern tenía discapacidad auditiva desde que nació y antes del kínder asistió a una escuela de educación especial para niños con discapacidad auditiva y otras discapacidades
    • En la escuela tenía que llevar a cada clase un audífono conectado al profesor y una gran caja marrón, y sentía humillación por la sensación de ser distinto de los demás niños
    • Como el desempeño de los audífonos en esa época no era bueno, siempre iba un paso atrás para entender las conversaciones, lo que tuvo un gran impacto negativo en su socialización
    • Considera que la lectura influyó en convertirlo en un bookworm, porque era una actividad que podía hacer sin verse afectado por la discapacidad auditiva
  • Antes de empezar el blog, editaba Wikipedia
    • Dice que Wikipedia cumplía para él un papel similar al de gwern.net antes de gwern.net, y que lo que hoy hace en su sitio en ese entonces lo habría hecho en English Wikipedia
    • Sigue sintiéndose orgulloso del artículo sobre Fujiwara no Teika
    • Dice que mucho de lo que aprendió sobre escritura vino de editar Wikipedia más que de la escuela o la universidad
  • Considera que en la English Wikipedia actual es difícil entrenarse con rabbit holes como antes
    • Dice que, comparado con 2004, los artículos están mucho más completos y que la comunidad de editores es más hostil hacia aportes detallados, obsesivos y de investigación
    • Esos aportes pueden borrarse o rechazarse por original research o por problemas con fuentes no autorizadas
  • Su primer gran éxito fue el artículo sobre Silk Road
    • Cuando Adrian Chen escribió en Gawker sobre comprar LSD en Silk Road, cambió de actitud al ver que Bitcoin era lo bastante real como para comprar drogas de verdad en internet
    • Gwern usó Silk Road directamente y documentó el proceso de pedido con capturas de pantalla
    • Dice que el texto registró cientos de miles de visitas tras publicarse, hasta el punto de verse como un pico vertical en el gráfico de Google Analytics

Forma de trabajo, motivación para escribir y diseño del sitio

  • Gwern cree que la gente sobreestima su inteligencia
    • Dice que, como recuerda muchas cosas y ha escrito mucho durante mucho tiempo, parece una persona capaz de hacerlo todo al instante
    • En conversaciones reales, a menudo lo que hace es citar cosas que ya escribió o en las que pensó durante mucho tiempo
    • Frente a quienes actualizan rápido sobre la marcha, no se considera especialmente inteligente, pero cree que al final lo importante es el resultado
  • Su proceso de trabajo se parece más a una acumulación de pequeñas notas durante mucho tiempo que a un golpe genial de inspiración
    • Si notas como “qué raro” o “este es otro caso de este patrón” se acumulan durante 10 años, el resultado puede parecer mágico
    • Dice que le gusta la frase de Penn & Teller de que “la magia es poner más esfuerzo del que una persona racional esperaría”
  • Ensayos como “Evolution as Backstop for RL” son síntesis surgidas de haber visto el mismo patrón repetidamente
    • En el centro está la estructura de aprender algo más inteligente mediante un método de aprendizaje torpe e ineficiente, pero sin poder eliminar por completo el método original
    • Se conectan ejemplos como empresas, meta reinforcement learning, neural networks y dolor, y así toma forma la estructura actual
  • Algunos ensayos nacen de un momento eureka, pero antes de eso quedan durante mucho tiempo muchas notas sin saber que estaban conectadas entre sí
    • Cuando un día llega de golpe el momento en que todo se conecta, escribe de una sola vez un ensayo enorme
    • “The Melancholy of Subculture Society” es un ejemplo de este tipo de ensayo-eureka
  • Su flujo de trabajo diario empieza ordenando el trabajo del sitio web del día anterior
    • Atiende formatting, spelling errors y problemas de disposición, y añade pensamientos extra o comentarios importantes
    • Luego lee mucho a través de Twitter o RSS feed, y escribe cuando algún comentario o pregunta le llama la atención
    • Por la tarde intenta avanzar en proyectos o contribuciones reales, y después va al gym
  • Va al gym porque es la actividad opuesta a sentarse frente a la computadora a leer
    • No porque le guste especialmente el weightlifting, sino porque cree que para evitar el burnout hay que hacer algo lo más distinto posible
  • Las discusiones online son una fuerte motivación de escritura para Gwern
    • Necesita motivación para escribir, cristalizar sus ideas y “cosecharlas”
    • La rabia y el impulso de discutir que surgen de ver que la gente está equivocada en internet abundan
    • Pero cree que el spite debe usarse solo mientras haga falta y luego dejarse ir; si uno sigue aferrado a eso, termina envenenándose a sí mismo
  • Dice que dedicar mucho tiempo al CSS y al diseño del sitio web no puede defenderse por completo desde el punto de vista de la utilidad social
    • Es un hobby que hace porque le gusta, y un sitio web hermoso hace más soportable releer sus propios textos una y otra vez
    • Considera que el mantenimiento del sitio puede ser una especie de spaced repetition para el autor

Sustento, Patreon, vivir con menos de 12,000 dólares al año

  • Mantiene la escritura de tiempo completo con Patreon y ahorros
    • Sus ingresos de Patreon rondan los 900 a 1,000 dólares al mes
    • Tuvo la suerte de ganar lo suficiente con sus primeras tenencias de Bitcoin como para sostenerse durante mucho tiempo, aunque no de manera permanente
    • Intenta reducir gastos al máximo para alargar su runway de escritura
  • El diseño de incentivos de Patreon y Substack le resulta incómodo a Gwern
    • Cree que es difícil crear buenas recompensas sin levantar un paywall
    • Para alguien como Scott Alexander, a quien le gusta enviar actualizaciones regulares tipo newsletter, Patreon y Substack encajan bien, pero a él no le gusta ese formato
  • Las condiciones para vivir con menos de 12,000 dólares al año son de una austeridad extrema
    • Vive en un lugar remoto, casi no gasta en viajes, comer fuera ni seguro médico, cocina por su cuenta y usa un gimnasio gratuito
    • Pone como ejemplo que, cuando el piso de su dormitorio se pudrió y se hundió por la humedad, lo sostuvo con madera de desecho y viguetas, aceptando que entraran insectos
    • Describe su vida como algo más cercano a “un estudiante de posgrado que come ramen mejorado”
  • Este estilo de vida no es ideal ni un modelo que otros escritores puedan copiar tal cual
    • También considera que ha sido suerte haber tenido muy buena salud hasta ahora y no haber enfrentado grandes emergencias
    • Dice que es un caso especial en el que coincidieron Bitcoin, una personalidad satisfecha con vivir como monje y buena salud
    • Quienes quieran convertirse en escritores o blogueros tendrán que encontrar cada uno un modelo de sustento distinto, ya sea con Substack o trabajando con JavaScript en una empresa tecnológica mientras escriben por su cuenta
  • La razón principal para no mudarse a San Francisco es el dinero
    • Dice que no quiere pensar en cuántos meses de runway de escritura tendría que sacrificar por cada mes viviendo en San Francisco
    • Afirma que, si alguien le ofreciera entre 50,000 y 100,000 dólares al año para mudarse a SF y seguir escribiendo a tiempo completo como ahora, lo aceptaría de inmediato

Diversidad de modelos de IA, fármacos GLP, factores ambientales y psicodélicos

  • Gwern cree que, salvo por la “capacidad”, los modelos de IA ya son cognitivamente mucho más diversos que los humanos
    • Sostiene que distintos LLM piensan de maneras claramente distintas incluso con solo ver sus muestras
    • Considera que los LLM son distintos de los GAN, y los GAN también de los VAE, y que especialmente en modelos pequeños o de bajo rendimiento difieren mucho el espacio latente, los artefactos y los errores
  • Sobre los casos en que en Chatbot Arena es difícil distinguir la salida de cada modelo, Gwern cree que se trata de una situación reciente, limitada a los LLM y fuertemente ajustada
    • Lo compara con “gemelos idénticos”, en un contexto donde todos siguen los métodos de los demás y se entrenan con datos muy parecidos
    • Cree que, si se mira el deep learning en general, el rango de mentes y formas de pensar es muy amplio
  • Cree que la diferencia entre los GAN y los modelos de difusión se ve en cómo representan las manos
    • Dice que los GAN, por su pérdida adversarial, tienen incentivos para esconder algo, y por eso pueden mandar la mano fuera de la imagen o actuar como si no pudieran pensar en ella
    • Dice que los modelos de difusión sí “piensan” en las manos, pero cometen errores al representarlas como formas enormes y monstruosas
  • Como una tendencia cuyas implicaciones la gente aún no entiende lo suficiente, menciona los fármacos GLP para bajar de peso
    • Dice que le sorprendieron sus efectos sobre la salud, las adicciones y una amplia gama de conductas
    • Afirma que los resultados siguen siendo preliminares, pero parecen efectos reales
    • Cree que podrían enseñarnos algo importante sobre la fuerza de voluntad humana y la disfuncionalidad
  • Cree que todavía es pronto para decir si los GLP drugs rompen el argumento de Algernon
    • Dice que aún no entendemos qué hacen realmente los GLP
    • Señala que sus beneficios podrían reducir el fitness en términos de fertilidad, o actuar sobre el cuerpo de maneras muy difíciles de replicar genéticamente
    • Como la crisis de obesidad es un fenómeno reciente, que solo se volvió claro hacia los años 90, cree que es difícil aplicar el argumento de Algernon en una escala de 20 a 30 años
  • Considera casi 100% probable que en el entorno moderno haya factores con un impacto grande, como el envenenamiento por plomo en la antigua Roma
    • Los químicos siguen creando nuevas sustancias, también hay factores relacionados con el microbioma, y los plásticos son un candidato popular, aunque quizá no sean los plásticos
    • No cree en una causa concreta, pero sí en la posibilidad de algo dañino que se acumule como “1% aquí, 1% allá”
    • Al ver las series temporales, cree que la inteligencia en general ha sido bastante estable, así que los factores realmente dañinos probablemente estén más del lado de la obesidad que de la inteligencia
  • Se muestra escéptico ante la experimentación con psicodélicos al estilo Bay Area
    • Los efectos de los psicodélicos pueden ser agudos y permanentes
    • Cree que los nootrópicos tienen efectos relativamente más manejables y controlables
    • Dice que cosas como el LSD pueden cambiar de forma permanente la manera en que uno ve el consumo de LSD o su estado psiquiátrico
    • Dice que unas pocas experiencias pueden ser buenas, y que él mismo obtuvo beneficios, pero que más allá de eso hay que examinar seriamente qué beneficio se está obteniendo y cómo está cambiando uno mismo

Literatura, ficción y preguntas pendientes

  • Dice que, sin internet, Gwern podría haber terminado estrechando sus intereses y publicando con constancia para sobrevivir en la academia formal, o quizá desviándose hacia algo como ser bibliotecario al estilo de Jorge Luis Borges
    • Dice que siempre ha estado de acuerdo con la idea de Borges de “imaginar el paraíso como una biblioteca”, y que él también ama las bibliotecas
    • Le da pena no poder pasar mucho tiempo en bibliotecas físicas ahora que lee sobre todo en la computadora
  • Borges es para Gwern una especie de autor heroico
    • Tras pasar por Hyperion y The Fall of Hyperion de Dan Simmons, Out of Control de Kevin Kelly y “The Library of Babel”, leyó una y otra vez la obra completa de ficción y no ficción de Borges
    • Dice que lo abrumó ver que alguien podía escribir cuentos y ensayos creativos, entretenidos y provocadores a partir de un conocimiento enciclopédico, y que si pudiera parecerse a algún escritor, querría ser Borges
  • Como obras que al principio no entendió pero después sí, menciona “Story of Your Life” de Ted Chiang y “Suzanne Delage” de Gene Wolfe
    • Interpreta “Suzanne Delage” como una sutil reescritura de Drácula en la que Drácula invade el pueblo, se lleva a una mujer y somete al narrador a un lavado de cerebro al estilo Bram Stoker para que olvide todo
    • Entiende “Story of Your Life” no como un relato de viaje en el tiempo o precognición, sino como una historia sobre una mente extraña pero igualmente válida que ve todo como parte de una historia ya determinada y de un final ya previsto
  • Es cínico respecto a la utilidad de la ficción
    • Cree que uno puede pasarse la vida leyendo solo ficción sin obtener ningún beneficio más allá de memorizar mucha trivia sobre cosas inventadas por otras personas
    • Dice que el 99% de la ciencia ficción que leyó fue completamente inútil, y que las obras que de verdad tuvieron suficiente insight como para cambiar su perspectiva pueden reducirse a unas 20 novelas o cuentos
    • Lo que esas obras superiores tienen en común es que tratan con seriedad la inteligencia no humana
  • El papel que le gustaría desempeñar en la vida de la gente se parece al de cuando el personaje “Gwern” aparece en un LLM como Claude-3, como mentor o viejo mago
    • Se acerca más a alguien que ofrece insight sobre una situación y da una llamada a la aventura: “tú también puedes escribir, hacer algo y pensar”
    • Quiere que el lector no se quede solo con entretenimiento o información, sino que tenga la aspiración de que una página web y el internet pueden ser mejores
  • Le preocupa que en la práctica pueda convertirse para algunas personas en una especie de gurú o trickster devil
    • Para quienes lo aprecian, podría parecer alguien cuyas opiniones en el sitio entero pueden aceptarse como gospel, y dice que eso le desagrada
    • Para quienes no lo aprecian, dice que podría verse como una figura demoníaca exagerada: encubierta, maliciosa, neonazi, eugenista, totalitaria, comunista o antichina
  • Los open rabbit holes a los que le gustaría tener respuesta para 2050 son grandes preguntas sobre los seres humanos y la civilización
    • Por qué dormimos y soñamos
    • Por qué los humanos envejecen
    • Por qué existe la reproducción sexual
    • Por qué los humanos son tan distintos entre sí, y también distintos de un día a otro
    • Por qué a los humanos les tomó tanto tiempo desarrollar una civilización tecnológica
    • Dónde están los extraterrestres
    • Por qué la Revolución Industrial ocurrió en otro lugar y no en China
    • Cómo se habría debido predecir la revolución del deep learning
    • Por qué el cerebro humano es tan sobredimensionado en comparación con las redes neuronales artificiales

1 comentarios

 
GN⁺ 2024-11-15
Opiniones de Hacker News
  • Escribir es votar por el futuro con una de las pocas monedas que Shoggoth reconoce: tokens que hay que predecir. Si no escribes, estás renunciando al futuro y a tu papel dentro de él; y aunque creas que basta con ser un buen ciudadano, votar, recoger basura y reciclar, al futuro no le importa.
    Las predicciones sobre IA parecen considerar muy poco cómo los humanos reales juzgarán si los medios generados por IA lograron reemplazar las obras humanas, o si siquiera lo lograrán. Hoy, que un proyecto sea conocido como generado por IA es más bien algo negativo; hace dos años, tener una imagen de IA en el encabezado de un blog se veía cool, pero ahora te hace ver como alguien pasado de moda.
    Por eso soy escéptico ante las predicciones de que una IA superinteligente reemplazará todas las creaciones, ensayos, textos, videos, etc. de los humanos. Que sea posible no significa que realmente vaya a ocurrir ni que a la gente le importe. Más bien parece mucho más probable que se consoliden formas de verificar que algo es humano, que la economía de la atención siga concentrándose en personas reales, y que se formen cementerios de basura de IA con los que nadie interactúa.

    • Durante décadas he escrito con la convicción de estar entrenando a futuras IA, y solía decir que el test de Turing no era un problema misterioso, sino algo ya resuelto como una curva de indiferencia de la economía, que muestra el punto en el que a la gente le importa distinguir entre personas y máquinas.
      El argumento de que la IA no tomará el control es que nos organizamos en torno a símbolos y narrativas, y somos muy sensibles a memes debilitados o inferiores, por lo que la IA tendría que reinventarse cada vez como “algo que no es IA”. Dicho eso, si tomamos la música como analogía, variaciones limitadas pueden dominar durante décadas, y ya hay precedentes de memes dominantes surgidos incluso de basura como estrellas pop fabricadas por maquinaria industrial, capaces de retener durante toda la vida la mente de millones de personas.
      Hoy la IA puede imitar todo el sistema de significados de esas estrellas pop, y TV Tropes ya enumera todos los elementos de la basura cultural ante los que la gente debería estar inmunizada, pero aun así millones siguen viviendo los personajes y narrativas que recibieron de la basura pop. Así como hoy la música, la TV y el cine moldean la ontología de la gente, sin duda habrá una larga cola en la que la basura de IA moldee ontologías; eso se acerca bastante a ser arrastrado por simulaciones de IA, y quizá sea incluso más sutil. O quizá simplemente podamos sacudirnos eso de encima.
    • Al mirar la IA, conviene rumiar durante mucho tiempo una idea tomada de la criptografía: lo más avanzado de hoy será lo peor del futuro.
      La humanidad está apostando su futuro a la idea de que, antes de un hard takeoff, chocaremos con límites intratables de teoría de la información que harán que las mejoras de desempeño tengan rendimientos decrecientes; pero por ahora es difícil confiar en la afirmación de que los métodos ya demostrados estén en la parte alta de alguna curva en S. Los modelos de IA mejoraron de forma dramática este año respecto al anterior, y el año anterior respecto al previo, y es muy probable que sigan mejorando durante los próximos años.
      Eso por sí solo basta para transformar profundamente una parte considerable de los procesos sociales y económicos, para bien o para mal.
    • Que la imagen de encabezado de una entrada de blog sea obviamente generada por IA y ahora se vea cursi y atrasada se debe a que los modelos públicos fueron fuertemente nerfeados por motivos casi de pánico, haciendo que sus salidas sean reconocibles de inmediato y se vuelvan trilladas.
      Por ejemplo, Dall-E 2 era mucho mejor cuando salió por primera vez que ahora; la versión actual fue ajustada para no poder producir algo parecido a la obra de artistas modernos, y es evidente que el resto también fue modificado para renderizar con esos molestos tonos naranja y azul. Al final, cuando salga o se filtre un modelo mejor, no será posible distinguir qué imagen fue generada por IA y cuál no.
    • O1-preview, con el prompt adecuado, ya es indistinguible del comentarista mediano de HN, y no hace falta editar en absoluto su salida.
    • La duda mayor es que, incluso si el futuro de la humanidad es un LLM que devora internet y lo regurgita con otras palabras, el corpus de IA contiene una cantidad enorme de material, y es difícil que unos pocos blogs investigados con mucho detalle muevan mucho la aguja.
      Quizá ejercerías un voto mayor si spamearas con IA generativa contenido alineado con tus opiniones, o si fueras a Kenia a hacer trabajo de RLHF mal pagado.
  • Me cuesta creer que Gwern viva de forma tan austera como se describe en este texto, y ni siquiera sé si realmente sea él. Estoy casi seguro de que Gwern tiene una persona que quiere proyectar, y parecer austero forma parte de eso.
    A la pregunta “¿quién es Gwern?”, lo veo como el tipo de persona que planta semillas en la mente de otros y deja que cada quien construya el resto de la historia. Aun así, me gustan muchos de sus textos, en especial esos temas raros y estrechos sobre los que la mayoría ni siquiera se detiene a pensar.
    Gracias al ensayo de Gwern sobre la falacia del costo hundido, terminé no haciéndome un tatuaje sobre el que había cambiado de opinión. Estuve a punto de hacerlo solo porque ya había pagado el depósito, pero una semana antes de la cita leí ese texto y concluí: “si los niños pequeños y los animales no caen en los costos hundidos, yo tampoco debería”. Literalmente, un texto de Gwern me salvó la piel de la espalda.

    • Hace unos 12 años conocí a Gwern una vez, cuando fue a una reunión de NYC Less Wrong. Creo que todavía no era famoso en internet, pero según recuerdo, la afirmación de que vive de forma muy austera es bastante creíble. Como referencia, tenía un aspecto que no habría desentonado en absoluto en una convención de anime.
    • ¿Hay alguna evidencia real que respalde el primer párrafo?
    • Creo que es mayormente cierto, salvo por algún gasto adicional ocasional. Aunque eso supone que no haya mantenido esa imagen de forma constante en lugares inesperados.
      No me gusta que ahora la gente lo encasille solo por su frugalidad efectiva, pero espero que reciba mucho apoyo económico, ya sea directamente o a través de patreon.com/gwern, como para compensarlo.
    • Vi un comentario en el subreddit r/slatestarcodex que decía que había supposedly true information about him, y lo encontré buscando ‘who is gwern’, pero más bien me dejó con más preguntas.
    • Me parece creíble
  • Fue una entrevista difícil de escuchar, y por dos razones sutilmente parecidas
    La voz parecía caer en el valle inquietante; era realista, pero difícil de oír. Más precisamente, era cognitivamente agotador unir el significado a partir de esa voz, y el timbre y el significado no se apoyaban entre sí. Tal vez eso cambie si los niños crecen escuchando voces con tonos aleatorios como esos
    La conversación también era excesivamente verbosa. Un vocabulario amplio muchas veces puede ocultar la pobreza del razonamiento, y para cierto público el esfuerzo de entender las palabras puede interferir con la comprensión de las relaciones entre ellas, es decir, del significado, haciendo que suene como una mezcla de palabras que parecen inteligentes. Si se quitan el vocabulario, la burla sutil y el estilo de “sé más de lo que estoy diciendo”, queda al descubierto mucha charla que no es correcta y cuyo razonamiento tampoco está completo. Ese tipo de conversación poco razonada está bien en sí, pero envolverla en vocabulario y estilo poco familiares genera malentendidos y no es amable. Algunos fragmentos que “parecen inteligentes” en realidad son solo fragmentos tontos bien vestidos

    • Es su voz real. Puede que haya habido algunos empalmes, pero no sé cuántos. Gwern admitió que no se le da bien hablar, y le creo. También dice que no es tan inteligente, aunque probablemente sea según un estándar muy relativo
    • Según la descripción del video enlazado, para proteger el anonimato de Gwern lo entrevistaron directamente, y luego su amigo Chris Painter sugirió doblar sus palabras más tarde; a Gwern le pareció divertido y aceptó
      Puede que me equivoque porque no conozco bien el nivel actual de las voces generadas por IA, pero no sonaba falso, y la fuente enlazada también dice que era un humano. Tal vez se sintió extraño porque era una persona leyendo la transcripción de una conversación e intentando que sonara como una conversación
  • Fue una semana con muchas entrevistas de podcast interesantes sobre IA
    Además de esta, está la serie de entrevistas de Lex Fridman con figuras clave de Anthropic https://youtu.be/ugvHCXCOmm4, y también una larga conversación entre Stephen Wolfram y Eliezer Yudkowsky sobre riesgos de la IA https://youtu.be/xjH2B_sE_RQ

    • La conversación entre Wolfram y Yudkowsky fue difícil de escuchar; de hecho, no llegué ni a la mitad. Los argumentos de ambos lados me parecieron algo débiles y poco interesantes
    • Altman + Tan también estuvo buena https://youtu.be/xXCBz_8hM9w
  • Mi insight favorito de Gwern es Bitcoin is Worse is Better. Después de resumir una larga lista de objeciones contra Bitcoin, pregunta si tienen algo en común, y la respuesta es: “no; el problema de Bitcoin es que es feo”
    Es feo que la seguridad de la red dependa únicamente de tener más fuerza bruta de cómputo que el adversario; es feo que, para evitar el doble gasto, se necesite ahora y en el futuro más de la mitad de la capacidad de procesamiento; es feo el árbol de hashes que sigue creciendo; es feo un sistema que no puede usarse offline sin proxies ni atajos; y es feo que todas las transacciones deban rastrearse públicamente. Incluso si la oferta monetaria tuviera que ser fija, pregunta por qué el límite arbitrario es de 21 millones, por qué ese número, y por qué no pudo ser una cifra más redonda o una potencia de 2. La minería también fue un regalo demasiado grande para los primeros participantes, y el hecho de que si envías a una dirección equivocada los Bitcoin simplemente puedan desaparecer forma parte de la crítica general: todo el sistema es feo y poco elegante
    https://gwern.net/bitcoin-is-worse-is-better

  • Me cuesta entender por qué se le da tanto crédito a esa fantasía esperanzada de una empresa de IA con una sola persona visionaria en la cima
    Primero, los CEO realmente visionarios son un nicho extremadamente estrecho. Segundo, la mayoría de las empresas no funcionan así, y el hecho de que exista una plantilla de personas es tan importante como lo que la empresa produce. Tercero, en una sociedad donde de pronto desaparece el trabajo asalariado, el motor económico más común, ¿quién compraría o rentaría esos servicios o productos?
    Me irrita mucho ese pensamiento sistémico que asume que se pueden cambiar y transformar los sistemas a voluntad, como si las implicaciones sociales pudieran ignorarse por completo. Alrededor hay, en la práctica, ingenieros de silo glorificados, embriagados de autoconfianza, haciéndose pasar por “pensadores”

    • No veo por qué haría falta un CEO humano visionario. Incluso los críticos más duros de la IA coinciden en que los LLM son excelentes para generar visiones audaces
    • Cuando aparecieron los primeros automóviles, alguien habrá dicho exactamente lo mismo. ¿Dónde están los datos que muestran que las disrupciones tecnológicas destruyen más empleos de los que crean?
  • El enlace del párrafo citado sobre Newton lleva a un texto del sitio de Gwern, y ese texto tiene varios enlaces internos y externos, pero no encontré ningún enlace que respalde la postura de Newton sobre el “progreso”.
    El concepto de “progreso rápido” es relativo. También había progreso rápido en esa época, y ahora simplemente hay un progreso más rápido; no hay contradicción. Tampoco estoy de acuerdo con la idea de que no nos impresionen mucho las mejoras en la construcción naval a lo largo de varios siglos, los largos poemas filosóficos en latín, las agujas o la imprenta. Sí nos impresionan bastante.
    No sé cómo esta entrevista recibió tantas recomendaciones, y siento que perdí el tiempo.

    • También funciona al revés. Siento asombro por lo que la humanidad ya logró, pero cuando leo las cronologías de mundos ficticios como Middle-Earth o Westeros/Essos, me pregunto cómo pueden estar tan congelados en una era parecida a la medieval. ¿Qué demonios están haciendo?
    • ¿Podrías explicar un poco más qué parte de https://gwern.net/newton crees que no respalda mi descripción de la perspectiva de Newton?
      La segunda cita grande en https://gwern.net/newton#excerpts enlaza de forma muy visible a https://www.newtonproject.ox.ac.uk/view/texts/normalized/THEM00173, y me pareció que justificaba suficientemente mi afirmación, tomada de algo que Newton le dijo directamente a su yerno. También guarda un paralelo estrecho con otras afirmaciones históricas, como las de Lucretius, y esas también las presenté con referencias claras y citas concretas.
      Me cuesta entender que digas que esto no lo respalda en absoluto, y me pregunto si quizá estás viendo otra página.
    • Más allá de la precisión histórica de esa cita, al vivir en carne propia el paso de un mundo en el que parecía que no hacía falta tener opinión sobre todo a un mundo con internet ubicua, en cierta medida siempre me he sentido así.
      No tanto porque crea que en la línea temporal actual una civilización humana avanzada se haya destruido a sí misma, sino porque el hecho de que hayan aparecido tantos avances capaces de cambiar la vida en tan poco tiempo parece una marcha imparable hacia un gran filtro.
    • Parece que la gente lee un título interesante o las primeras líneas y pulsa recomendar. Luego, aunque el contenido resulte no ser tan bueno, no existe la opción de votar en contra.
  • Sé que va a sonar algo agresivo, y en realidad lo es un poco, pero una interacción que tuve con Gwern en este foro y que se me quedó grabada fue este hilo, donde Gwern confundió a^nb^n con un lenguaje regular y llamó a mi comentario “not even wrong”.
    https://news.ycombinator.com/item?id=21559620
    Perdón por decirlo en negativo, pero para entonces Gwern ya era venerado por una parte bastante grande de la comunidad como una figura influyente importante en IA. Para mí fue un buen ejemplo de que la mayoría de los influencers de IA que compiten por influencia en redes sociales, y no por investigación, en realidad no conocen bien la IA ni la informática; solo son buenos organizando y popularizando conocimiento de segunda mano. Ser porrista de la visión dominante en IA es fácil. Lo difícil es encontrar una dirección propia y seguirla.

    • Decir que “la mayoría de los influencers de IA no conocen la IA ni la informática” es un poco excesivo. Hay excelentes ingenieros y científicos con mucho conocimiento que no captarían el punto de a^nb^n. Es imposible conocer al 100% un campo tan amplio como IA e informática.
    • Mi conclusión sobre el comentario enlazado es que la cuestión tan teórica de si se puede reconocer un lenguaje infinito tiene poca relación con el concepto informal e intuitivo de inteligencia.
      Un Transformer puede entender intelectualmente a^nb^n con facilidad, pero no puede decidir si una cadena arbitrariamente larga pertenece a ese lenguaje. Sin embargo, esa limitación también la comparten los humanos. Si la cadena es lo bastante larga, los humanos también terminan perdiendo la cuenta.
    • Me pasó algo muy parecido con otro influencer de IA famoso. Era alguien que me estaba dando una clase de teoría de autómatas falsa que cualquier estudiante de licenciatura en informática detectaría de inmediato; tiene más de 140 mil seguidores y ha aparecido en podcasts grandes como Lex o MLST. No lo corregí, pero anoté mentalmente que no debía confiar en esa persona.
    • Su contraargumento parece ser que el “análisis sintáctico de gramáticas formales” no es el núcleo de los LLM, y eso es válido. Se equivocó en la distinción entre gramáticas regulares y gramáticas libres de contexto, pero creo que la mayoría de los programadores tampoco está familiarizada con esa diferencia. La razón por la que aprender la clasificación de a^nb^n es un problema clásico de teoría de autómatas es precisamente que resulta sorprendente que una gramática tan simple sea libre de contexto.
    • Aquí adopto una postura al estilo Feynman. Los trucos de memoria vanidosos no son, por sí mismos, nueva producción neta; lo que ya se sabe simplemente puede buscarse en los libros.
      Respeto los distintos esfuerzos, pero la ingeniería consiste en crear cosas que la gente pueda usar sin necesidad de saberlo todo. Es una tarea mucho más interesante que convertirse en un motor de búsqueda de Google humano.
  • La idea del avatar es interesante, pero creo que habría sido mejor tener solo voz y forma de onda de audio en lugar de crear un avatar parlante. Quizá sea una preferencia personal: no quiero tener una imagen mental de alguien que no conozco. Es parecido a leer un libro después de haber visto su adaptación cinematográfica.

    • A mí también me pareció raro. En mi país, cuando una serie de TV hace una entrevista anónima, usa cierto lenguaje visual: rostro pixelado, la persona mirando hacia el lado opuesto de la cámara, rostro oculto por sombras, etc.
      Que un actor doble la voz es normal, pero que un actor muestre el rostro de una persona anónima es una elección bastante peculiar.
    • ¿No bastaría con simplemente escuchar la entrevista?
  • Ventaja del anonimato: “Me ha beneficiado mucho que la gente no pueda enviarme heroína a casa ni hacer denuncias falsas a la policía para que manden a SWAT”.
    Desventaja del anonimato: no hay heroína gratis.