1 comentarios

 
GN⁺ 2024-03-04
Opiniones en Hacker News
  • Cuando se menciona el teorema de no free lunch, también debería agregarse la salvedad de que, en la práctica, no es un obstáculo tan grande.
    Basta con asumir que los datos vienen del mundo real para que este teorema deje de ser un impedimento.
    El libro no trata ese punto en absoluto; hubiera sido bueno que explicara que aquí “todas las distribuciones” se parece más a una generalización, a un espacio de alta dimensión de funciones discontinuas, de todas las posibles cadenas de bits generadas por lanzamientos de moneda, y que las funciones continuas son apenas un subconjunto diminuto de eso.
    Al final, significa algo más cercano a que, si los datos vienen de una distribución uniforme aleatoria de “todas las posibilidades”, no se puede aprender para predecir algo como el resultado del próximo lanzamiento de moneda.

    • Correcto. Este tipo de teoremas de no free lunch o resultados basados en supuestos demasiado generales suelen parecer excesivamente pesimistas.
      Por ejemplo, mucha gente suele pensar ingenuamente que, por el problema de la detención o el teorema de Rice, el análisis estático de programas es imposible.
    • Es parecido al problema de la inducción de Hume. Sin supuestos, no se pueden conectar las observaciones pasadas con predicciones futuras.
      Que el sol haya salido mil mañanas no hace automáticamente que sea más o menos probable que salga mañana; hay que asumir algo como que, con el paso del tiempo, los eventos tienden a continuar de manera más o menos similar.
      Ese tipo de supuesto no puede extraerse de los datos. Aunque en el pasado hayan continuado de forma similar, eso no dice nada sobre el futuro.
      Aun así, la ciencia funciona bien a pesar de este problema, y el aprendizaje automático también sigue funcionando porque las personas usan experiencia y conocimiento previo al diseñar algoritmos.
      A estos supuestos se les llama sesgos inductivos, y hacen que el aprendizaje se incline hacia ciertos patrones, como “las cosas cercanas suelen ser parecidas”.
    • No entiendo bien cómo aplica esa salvedad. Entiendo que el teorema de no free lunch no significa que algunos problemas sean imposibles de aprender, sino que no existe un único algoritmo que funcione bien para todas las clases de problemas.
      Los ejemplos de la demostración pueden ser artificiales, pero en la práctica uno elige distintos algoritmos según los supuestos adicionales, ¿no?
  • La teoría del aprendizaje es un intento de formalizar las ciencias naturales hasta llegar a la toma de decisiones. El supuesto oculto de las ciencias naturales es que, con un modelo algorítmico del mundo suficientemente sofisticado, se pueden predecir observaciones futuras a partir de observaciones pasadas.
    Esto es el mismo supuesto que usó Solomonoff al demostrar la inferencia inductiva, así que se debería partir de una codificación Turing-completa, no de la llamada codificación “universal” de Rissanen.
    Al construir subteorías está bien apartarse de ese punto de partida, pero si no se empieza ahí, se termina en resultados basura como la confusión de los últimos 50 años sobre qué significa exactamente el “principio de longitud mínima de descripción”.
    Sin embargo, si se quiere construir un modelo causal, eso no está bien. Para modelar sistemas dinámicos no se puede abandonar el código Turing-completo.
    Un sistema dinámico puede verse como una máquina de estados finitos con muchísimos estados, pero para crear un código comprimido de forma óptima se necesita una semántica Turing-completa ejecutándose sobre un grafo cíclico dirigido de compuertas universales, como una cantidad enorme pero finita de flip-flops, NOR o NAND.

  • ¿Ya se descubrió cuál es la causa del double descent?

    • No sé si es un resultado generalizado, pero el equipo Circuits de Anthropic propuso una hipótesis bastante convincente. La primera fase de descenso sería cuando el modelo memoriza puntos de datos, y la segunda fase de descenso sería cuando se desplaza geométricamente hacia el aprendizaje de características.
      Aquí, las características pueden verse como un espacio vectorial abstracto y de muy alta dimensión.
      Este equipo está investigando a fondo la idea de superposición, donde una sola neurona codifica múltiples conceptos.
      Experimentaron con modelos de juguete y conjuntos de datos en los que representan explícitamente características latentes y luego las comprimen a un conjunto pequeño de dimensiones de datos para forzar la superposición, y muestran cómo se ve esa superposición según el tamaño de los datos de entrenamiento.
      Claramente es un modelo de juguete, pero al menos para modelos que experimentan superposición es una idea convincente.
      https://transformer-circuits.pub/2023/toy-double-descent/ind...
    • Hace muy poco hubo una entrada de blog que afirmaba que el double descent puede explicarse con mecánica estadística: https://calculatedcontent.com/2024/03/01/describing-double-d...
      Hay más detalles aquí: https://calculatedcontent.com/2019/12/03/towards-a-new-theor...
    • No soy experto, pero este paper explora el double descent con un modelo simple.
      La interpretación es esta: al expandirse hacia la región sobreparametrizada, se puede optimizar hacia pesos de norma pequeña, y esos pesos a su vez generalizan bien.
      Si esto explica el double descent en general, o si también aplica a otros modelos como las redes neuronales profundas, es otra cuestión.
      https://arxiv.org/pdf/2303.14151.pdf
    • Todavía no se sabe. Mi hipótesis favorita, personalmente, es que el descenso de gradiente estocástico es literalmente estocástico.
      Como optimiza sobre un subconjunto muy pequeño y no sobre todo el corpus de entrenamiento, el gradiente no es exacto.
      La idea es que el entrenamiento excesivo empuja los óptimos locales y, en vez de rodear charcos locales de sobreajuste, permite avanzar recursivamente hacia la distribución real.
  • En internet hay muchísimos PDFs excelentes de matemáticas escritos por académicos, educadores e ingenieros, disponibles gratis. El problema es que también hay una enorme duplicación de contenido.
    Me pregunto si se podría crear un modelo de IA que sintetice bien conjuntos de materiales superpuestos en un único PDF coherente y sin duplicaciones.

    • Quizá bastaría con elegir el libro que se usa en el curso correspondiente de esa universidad.
    • No hace falta un modelo de IA. Probabilistic Machine Learning de Murphy es un excelente libro de referencia y recurso.
  • Es una observación menor, pero el título confunde. La primera palabra debería cambiarse por Machine-Learning o Statistical-Learning.
    Ojalá el autor lo corrija algún día, si es posible.

  • Es bastante difícil de leer. Por ejemplo, en la primera página del capítulo 1 habla de minimizar formas cuadráticas y muestra algo que parece la fórmula de mínimos cuadrados lineales, pero no explica en absoluto si eso es correcto.
    Creo que ayudaría tener un poco más de explicación.
    Me gusta que tenga muchos ejercicios.

    • Este texto parece estar pensado para alguien con cierto bagaje matemático que quiere entender la teoría del aprendizaje.
      Además, ese capítulo dice claramente que es un repaso, así que asume que ese contenido ya se aprendió, o se va a aprender, en otro lado.
    • Que empiece desde primeros principios no significa que sea fácil de leer.
    • Como dice el comentario hermano, está claro que este material no está dirigido a quienes aprenden esto por primera vez.
      Aun así, la intuición es correcta. Si escribes la función objetivo de mínimos cuadrados ordinarios, se vuelve una forma cuadrática.
      La elección de la palabra “cuadrática” aquí no es casual: es una generalización matricial de una función cuadrática.
      Esa sección trata la versión vectorial de minimizar una función cuadrática.
    • Definitivamente no parece empezar desde primeros principios.
    • Mínimos cuadrados es una expresión cuadrática.
      Cuadrática significa que tiene términos al cuadrado.
  • Interesante. ¿Hay algún buen libro sobre este tema?

  • Interesante. Tendré que echarle un vistazo cuando tenga más tiempo.
    A primera vista, parece cubrir bastante contenido en común con este libro [1]. Me da curiosidad saber en qué se diferencian.
    [1]: https://www.cambridge.org/core/books/understanding-machine-l...

    • Un libro de machine learning de 2014; ahora ya se siente antiguo e histórico.
  • Espero con ganas el día en que pueda decirle a GPT-5: “Tengo una idea que quiero probar; lee este libro y dime si hay algo relevante para hacer que funcione mejor”.

    • Nunca he oído de un LLM que haya generado una idea nueva. ¿No sería posible solo cuando es una idea que alguien ya intentó antes?
    • Me estoy dando cuenta de que pasarle contexto sobre $this es la parte difícil.
      Como usuario, es muy difícil describir mi contexto con unas cuantas variables de baja dimensionalidad, y ni yo mismo entiendo mi situación dentro del universo lo suficiente como para explicársela a una IA.
      También me falta vocabulario compartido con la IA. Siento que internet logró intercambiar de forma consistente un estado acordado mediante un protocolo compartido llamado HTTP.
      Por ejemplo, dentro de Uber se puede transmitir estado en un mundo estrecho de solicitud-respuesta: número de teléfono, vehículo, GPS, hora actual, pago, etc.
      Pero, como estudiante que intenta aprender algoritmos, no sé cómo pasar información compleja como mi edad, mi entorno de uso de internet, dónde vivo, mi preferencia por explicaciones gráficas, mi historial de intimidación ante libros gruesos, hitos como CS50 o mi nivel de Python.
      Con las ideas de startup, decir solo “tiene poca tracción” tampoco basta; hay que transmitir estado como la red de VC, desarrolladores y ventas, evidencia de alianzas exitosas, número de asistentes, ingresos, etc.
      Incluso en el mundo real, el contexto de cada persona es tan distinto que este vocabulario solo existe dentro de pequeños bolsillos.
      También es un problema asumir que el conocimiento existe como una variable global y eterna. En algunas regiones mucha gente no tiene electricidad ni siquiera teléfonos básicos, así que que un PDF recomendado por una IA sea útil o no depende incluso de las estructuras de poder locales y la gobernanza.
      No sé cómo evolucionará esto, pero solo pensar en las posibilidades ya es interesante. Las computadoras pueden conversar fácilmente con nosotros y son como bebés inteligentes desde el primer día, pero quizá el verdadero cuello de botella para extraerles más utilidad sea, al final, no poder ingresar suficientes datos adecuados y baratos.
    • Si lees ese libro directamente, tu idea mejorará. Puede que también aprendas cosas nuevas en el proceso.