1 comentarios

 
GN⁺ 5 시간 전
Comentarios en Hacker News
  • Ya es la segunda conversación compartida de ChatGPT realmente interesante que veo hoy
    La primera fue un caso donde, al seguir diciéndole “continúa” a ChatGPT, encontró un contraejemplo para otra conjetura: https://x.com/DmitryRybin1/status/2079904005652893709

    • Para problemas en los que un agente podría rendirse, en la práctica “continúa” suele funcionar. Los LLM no saben de manera esencial cuándo algo es imposible
      En prompts difíciles, suelo escribir algo como: “repite este proceso hasta que converja y ya no tengas más ideas de optimización. Puedes seguir repitiéndolo”, lo cual también funciona como una condición normal de cierre
    • En particular, GPT parecía tener más tendencia que otros modelos a detenerse a mitad de una tarea, y la versión que usé recientemente probablemente era 4.X
      Era bastante molesto que repitiera respuestas del tipo: “he llegado hasta aquí y el siguiente paso está claro, pero para continuar envíame un mensaje sin contenido”
    • Escribir solo “continúa” sin contexto implica confiar bastante en que el LLM evitará errores lógicos sutiles y elegirá el enfoque correcto
      Incluso los modelos más recientes, en tareas simples de DevOps, a veces afirman que un paquete desplegado no lo está y, cuando el usuario los contradice, enseguida cambian de postura. Si eso pasa con frecuencia, me pregunto si en una prueba matemática compleja se puede obtener una conclusión válida repitiendo “continúa” sin verificar los resultados
    • En el pasado, el método con el que muchos matemáticos tuvieron éxito fue precisamente seguir adelante
    • Me impresionó la parte donde, al decirle “los resultados parciales bastan, así que terminemos con un contraejemplo completo e incondicional”, trabajó durante 88 minutos y 24 segundos y luego presentó un contraejemplo finito completo
  • Los registros de conversaciones con IA de expertos que van directo al punto son infinitamente interesantes y muestran cuánto se le puede sacar a un modelo
    Incluso Terence Tao guía con fuerza, en su propio campo, de una manera parecida a como yo uso LLM: preguntas breves y precisas que despliegan toda la terminología especializada y las herramientas teóricas. Da la impresión de que los LLM ajustan su tono y el nivel de sus respuestas al nivel del usuario

    • Al final, “aprender a usar IA” primero consiste en dominar el área del problema
      Puedo usar IA para programar porque llevo décadas desarrollando, pero me cuesta usarla en física teórica, donde no puedo evaluar las respuestas
    • No entendí el contenido matemático, pero los mensajes de Tao se parecían sorprendentemente a las conversaciones que yo tengo con los LLM
      En vez de intentar obtener el resultado de una sola vez, pasar por una exploración paso a paso permite corregir el rumbo continuamente, así que resulta más efectivo y satisfactorio. Pedir todo de una vez parece magia cuando funciona, pero si falla hay que rehacer el prompt desde el principio
    • Hace unos días me pasó algo parecido con Claude. Aunque le di los requisitos por encima y al principio funcionó bien, falló en lo importante; cuando adopté un enfoque más estricto, después de resolver el problema cambió su comportamiento dentro del proyecto: empezó a verificar varias veces por adelantado y a pedirme mis instrucciones con más frecuencia
      Es un poco molesto, pero si funciona, vale la pena tolerarlo
  • La conversación de Terence Tao con ChatGPT es interesante por dos razones. El contraejemplo no es una simple fuerza bruta, sino un polinomio con una estructura muy específica para producir el resultado deseado, y las preguntas de Tao también son tan precisas que sería difícil obtener la misma información sin una formación matemática avanzada
    Parece que Tao primero identifica parte de la estructura del problema y del contraejemplo, y luego usa la IA para empujar el resto de la búsqueda

    • Uno de los humanos más brillantes del mundo hace la pregunta, y el LLM responde como si dijera “si lo piensas, en realidad es muy simple”, así que da la impresión de estar viendo a un profesor enseñándole a un estudiante talentoso, y eso te vuelve humilde
    • Existe la broma de que si no obtienes buenos resultados del modelo es “falta de habilidad”, pero aquí también hay algo de verdad. La capacidad de aprovechar la IA no solo requiere saber crear prompts iterativos que el agente entienda, sino también un conocimiento profundo del dominio para saber qué explorar
      Si falta una de las dos cosas, eso puede llevar a frustración o, peor aún, a peores resultados
    • Durante los próximos años, la capacidad de discutir bien tu propia especialidad con un LLM será una habilidad humana útil, aunque al final probablemente eso también se diluya
  • Sorprende ver cómo Tao sigue proponiendo simplificaciones y guiando el proceso de descubrimiento. Usa la IA para entender algo, hacerlo encajar eficazmente dentro de su marco mental, y se interesa por hallar subresultados más simples que generalicen o expliquen el fenómeno
    Lo que más extrañaba de JPL y del entorno académico eran justo ese tipo de discusiones de “¿y si pasara esto?”

    • La simbiosis entre humanos e IA parece ser un valor nuevo que ha traído la IA. Mientras produce resultados como diferencias de código, puedo seguir evaluando qué tan sólido es mi propio marco mental sobre la etapa actual
      En particular, ahora puedo elegir con cierta precisión cuánto quiero entender por mí mismo el problema que estoy tratando, una opción que antes de la IA prácticamente no existía
    • Se parece al modo en que los profesores de matemáticas han aprovechado a los estudiantes de posgrado durante cientos de años
  • Las matemáticas tienen una densidad de terminología y notación casi increíble, y son muy difíciles. En otras áreas de ciencia e ingeniería normalmente puedes seguir el hilo con ayuda de Google o Wikipedia, pero las matemáticas avanzadas se alejan demasiado rápido de cualquier nivel de comprensión cotidiana
    Incluso alguien familiarizado con áreas técnicas probablemente sentiría que se pierde por completo al encontrarse con matemáticas difíciles

    • Esto también aplica a casi todos los campos, incluida la informática. Mucha gente opera a un nivel superficial sin darse cuenta del conocimiento de fondo que ha acumulado
      Incluso un ingeniero de software promedio necesita conocer muchísimos términos: caché, stack, heap, proceso, hilo, socket, TCP, HTTP, TLS, deadlock, race condition, atomicidad, event loop, coroutine, transacción, replicación, sharding, serialización, DNS, etc. Incluso “caché” por sí sola puede referirse a caché de CPU, de páginas, del navegador, de CDN o de Redis, y palabras cotidianas como sesión, handle, pool, buffer, stream o channel también cambian de significado según el contexto
    • En una clase de mecánica cuántica, cuando en el pizarrón apareció H Psi = E Psi, todos se rieron diciendo “se puede cancelar Psi”, pero de un lado era multiplicación y del otro un operador con multiplicación matricial, así que había que aprender una notación nueva
      También hubo una vez en que me confundí por no saber que una variable en negritas significaba una matriz
    • Lo que en matemáticas llaman madurez matemática se parece al proceso de aprender programación, música o cocina, donde tienes varias revelaciones y tu perspectiva va cambiando. En matemáticas hay más etapas de ese tipo que en otras actividades porque el principal límite está en el propio razonamiento abstracto
    • La abstracción es indispensable. La memoria de trabajo humana es muy pequeña, así que para razonar sobre varios problemas hay que construir una estructura jerárquica de múltiples capas, y eso está muy cerca de la esencia de las matemáticas
    • Las matemáticas intentan minimizar la ambigüedad más que otros campos. En áreas no matemáticas existe la tendencia a reutilizar palabras comunes dándoles significados técnicos, y especialmente en ciencias sociales y humanidades, como no hay símbolos extraños, a veces los no especialistas ni siquiera se dan cuenta de que no entienden lo suficiente
  • No puedo evaluar las matemáticas en sí, pero sí destacan varias cosas en el comportamiento del modelo. Algunas preguntas las razona y otras las responde de inmediato; a veces incluso rebate proponiendo condiciones o correcciones
    Además, mantuvo el tema mientras alternaba durante mucho tiempo entre preguntas y respuestas, lectura de PDF, escritura de código y razonamiento, y parece que Tao también lo consideró productivo. El avance de los modelos se parece más a esto que a una subida en cifras de benchmarks específicos

    • La expresión “pero hay que tener cuidado” es una respuesta hecha de esta generación de Codex y Claude
      En la práctica muchas veces dice cosas tan obvias que cuesta llamarlas advertencias, pero el usuario termina esperando que haya una condición importante. Igual que empezar siempre diciendo que responderá “honestamente”, distrae, así que es mejor frenarlo mediante AGENTS.md
  • Lo más sorprendente de esta conversación es que el agente de IA parece un interlocutor de igual a igual frente a Tao, uno de los mejores matemáticos contemporáneos
    Tao marca la dirección, pero al mismo tiempo aprende y se apoya en la explicación, el análisis y el razonamiento de la IA; se siente como una escena de discusión de resultados con un estudiante de doctorado u otro profesor. En un año, o tras dos lanzamientos más de modelos, la IA podría llegar a ser claramente más fuerte que Tao

    • Más bien esta conversación parece un contraejemplo de esa perspectiva. Aunque hubiera hablado con otra IA, es poco probable que hubiera sido tan productiva como la conversación con Tao
      No sé si eso cambiará dentro de un año, pero como ese horizonte se sigue aplazando, soy escéptico
    • Pensar en los LLM como un espejo reflector resulta útil. Si les hablas como un matemático experto, el modelo también responde así, pero el primer prompt de Tao, aunque parece simple, sería difícil de escribir al mismo nivel para un estudiante de primer año de universidad
      Es el fenómeno opuesto al prompt de la época de GPT-3.5 de “eres un matemático profesional”. Como a un experto real no se le habla así, esa frase más bien le revela al modelo que el usuario no es experto
    • Considerando que la misma IA puede ayudar con recetas, diagnosticar ruidos extraños en un auto, tareas de biología y traducción, ya podría decirse que es más fuerte que Tao
      Incluso solo en matemáticas, por el hecho de tener este nivel de profundidad en casi todos los subcampos, ya la considero superior
  • La petición “Ya activé Pro, ¿puedes seguir buscando una explicación geométrica de X_3 ~ A3 evitando coordenadas o construcciones forzadas?” es literalmente la imagen de un cliente satisfecho con una función de pago

    • Parece que en temas avanzados, hacer preguntas muy cortas induce respuestas sin relleno. Puede que eso haya mejorado aún más al sumar la activación de Pro
    • Sorprende que hasta Terence Tao tenga que pagar para conversar con ChatGPT. Más bien OpenAI debería pagarle a Tao
  • Así era una conversación que tuve con ChatGPT hace 4 años: https://i.imgur.com/WPaWgzZ.png
    Estamos en una época que hace preguntarse hasta dónde llegará dentro de otros 4 años

    • Podría ser un futuro asombroso, pero también vale la pena ver esto: https://x.com/pronounced_kyle/status/1768852493092680036
    • En el Reino Unido no se ve la imagen; tengo curiosidad por saber qué dice
    • Muestra lo rápido que envejecen afirmaciones tajantes como “los LLM no pueden razonar y solo repiten frases básicas, así que ni en 100 años podrán volverse inteligentes”
  • Hasta una sesión de ChatGPT de un supergenio resulta extrañamente tranquilizadora porque confirma que cuando un humano escribe una oración, el LLM responde con tres páginas