1 puntos por GN⁺ 3 시간 전 | 1 comentarios | Compartir por WhatsApp
  • La versión interna de Astra, el próximo gran modelo de OpenAI, generó nuevos resultados en 10 problemas abiertos que no habían tenido avances clave durante al menos 10 años, abarcando desde geometría de alta dimensión hasta complejidad cuántica y criptografía basada en retículas
  • En la búsqueda de soluciones se usaron tokens por un valor aproximado de 2,000 dólares según la tarifa de Sol API, y luego humanos prepararon artículos con el mismo modelo mientras el modelo formalizaba cada argumento como un certificado en Lean
  • Entre los principales logros están la demostración de la existencia de grupos no sofic, una refutación de la conjetura de rigidez de Connes, una cota inferior de n⁴/log n para fórmulas aritméticas que calculan el permanente y un teorema de repetición paralela exponencial para juegos cuánticos generales de 2 jugadores
  • También mejoró cotas para empaquetamiento de esferas y códigos binarios y esféricos, resolvió la dureza de aproximación por factor polinomial del problema del vector más cercano y la conjetura de volumen de Ehrhart, y respondió los problemas 146, 180 y 183 de Erdős
  • OpenAI señaló que, aunque los humanos son responsables de la preparación de los artículos, la formalización en Lean y la corrección, como los argumentos matemáticos fueron generados por IA, no deben presentarse como autoría humana y se debe atribuir honestamente la contribución de la IA

10 resultados generados por Astra

  • Para acelerar los descubrimientos de científicos y matemáticos, OpenAI ofrece gratis su mejor modelo de ChatGPT a 100 mil personas a través de ChatGPT for Academic Researchers, y durante el desarrollo también sigue evaluando sus modelos con problemas abiertos de investigación
  • En mayo dio a conocer una refutación generada por IA de la conjetura de distancia unitaria de Erdős hallada durante la evaluación de un modelo aún no lanzado, lo que después llevó a investigaciones de seguimiento en matemáticas y ciencias de la computación teórica
  • Los problemas seleccionados no habían tenido avances en sus resultados centrales durante al menos 10 años, y la mayoría durante mucho más tiempo, además de haber despertado un interés considerable en las comunidades matemáticas de cada área
  • La versión interna de Astra encontró las soluciones, y el costo total de exploración fue de unos 2,000 dólares según la tarifa de Sol API
  • Los 10 resultados son los siguientes
    1. Empaquetamiento de esferas de alta dimensión: redujo una nueva cota superior para la densidad de empaquetamiento de esferas hasta el umbral de Cohn–Elkies
    2. Códigos binarios y esféricos: mejoró exponencialmente la cota del tamaño máximo de códigos binarios con una distancia mínima dada, y obtuvo resultados similares para códigos esféricos de alta dimensión
    3. Grupos no sofic: presentó una construcción que establece la existencia de grupos no sofic y resuelve un problema abierto central de la teoría de grupos
    4. Conjetura de rigidez de Connes: refutó una antigua conjetura que sostenía que ciertos grupos quedan determinados de manera única por sus álgebras de von Neumann
    5. Complejidad de circuitos aritméticos: obtuvo nuevas cotas inferiores para calcular el permanente con circuitos y fórmulas aritméticas, y la cota inferior para fórmulas aritméticas es del orden de n⁴/log n
    6. Repetición paralela cuántica: demostró un teorema de repetición paralela exponencial para juegos cuánticos generales de 2 jugadores, extendiendo un principio fundamental de la teoría clásica de la complejidad
    7. Problema del vector más cercano: estableció la dureza de aproximación por factor polinomial en un problema de retículas clave relacionado con la criptografía poscuántica
    8. Conjetura de volumen de Ehrhart: determinó en todas las dimensiones el volumen máximo posible de un cuerpo convexo cuyo único punto de retícula interior es su baricentro
    9. Números de Ramsey multicolor: obtuvo una cota inferior superexponencial para los números de Ramsey multicolor de triángulos, resolviendo el problema 183 de Erdős
    10. Conjeturas de teoría extremal de grafos: resolvió los problemas 146 y 180 de Erdős con resultados sobre las conjeturas de compacidad y degeneración
  • Entre las investigaciones surgidas después de la anterior refutación de la conjetura de distancia unitaria están un contraejemplo a la conjetura suma-producto en los reales, primos de descomposición y el problema de Elekes–Rónyai, la necesidad de tiempo cuadrático para el par más lejano en dimensión superconstante bajo SETH, la complejidad de comunicación de intersecciones punto-recta sobre los reales y distancias iteradas en retículas de Minkowski

Atribución de la investigación y el papel de la comunidad matemática

  • La aparición de sistemas de IA capaces de contribuir a la investigación matemática plantea cuestiones difíciles de responder para una sola empresa tecnológica, y OpenAI dice respetar las posturas preocupadas por el impacto de la IA, incluidos los firmantes de la Declaración de Leiden sobre IA y matemáticas
  • La forma en que se produjeron los resultados debe reflejarse honestamente en la autoría y atribución de contribuciones
    • Presentar como autoría humana una prueba generada por completo por IA distorsiona tanto la contribución del sistema como el trabajo intelectual real de las personas
    • Los humanos apoyan la preparación de los artículos y la formalización en Lean, y asumen la responsabilidad por la corrección, pero los argumentos matemáticos en sí fueron generados por el sistema de IA
  • OpenAI espera que la comunidad matemática revise los resultados, les dé contexto y luego desarrolle esas ideas hacia nuevas investigaciones y descubrimientos
  • A medida que la IA evoluciona hacia un colaborador de investigación más sofisticado, un acceso amplio será esencial para que científicos y matemáticos exploren y definan el futuro de sus campos

1 comentarios

 
GN⁺ 3 시간 전
Comentarios de Hacker News
  • La mayor queja es la falta de transparencia sobre todo el experimento y la configuración. Como cuesta creer que solo hayan hecho que el modelo resolviera estos 10 problemas una vez cada uno, los 2,000 dólares presentados sin publicar el diseño completo del experimento pueden prestarse a malentendidos, como si fuera p-hacking
    Quisiera saber el número total de problemas que se le dieron al modelo, la proporción y el costo de los que no pudo resolver antes de rendirse, el número de intentos por problema y el costo del entorno de ejecución, incluido si tuvo acceso a un clúster de trabajo

    • Recuerdo que incluso antes del boom de la IA ya se discutía en educación matemática que no solo importan el problema y la solución en sí, sino también el andamiaje (scaffolding) que ayuda a encontrarlos
    • El costo más bien no parece encajar con esta crítica. Incluso si hubieran gastado 1 millón de dólares en 10 problemas, eso sería más o menos el costo anual de 10 a 20 investigadores en matemáticas, y no está claro si pagando lo mismo a humanos se obtendrían los mismos resultados
    • También me pregunto si algún investigador sin relación con OpenAI u otras empresas de LLM ha logrado resultados parecidos
      También habría que confirmar la posibilidad de que OpenAI haya contratado a un investigador competente en combinatoria para resolver los problemas y que el modelo solo se haya usado de forma secundaria
    • También es excesiva la postura de no aceptar nada sin un ensayo controlado aleatorizado (RCT) obligatorio. No lo digo con sarcasmo: debería ser posible tener un escepticismo razonable sin montar un RCT
    • Es injusto comparar no revelar el costo total de ejecución con el p-hacking. Omitir el precio no se parece en nada al fraude científico o a manipular resultados
  • Más sorprendente es que este post ni siquiera llegó al primer lugar de la portada de HN. Aunque sea un resultado mejor que antes, muestra que la idea de que la IA produzca avances importantes en matemáticas y ciencias de la computación ya no sorprende demasiado

    • Gente que psicológicamente no puede aceptar el avance de la IA lo reportó activamente y por eso bajó en el ranking. Hacker News ya no es un sitio de élite
    • Varios amigos matemáticos en academia, que eran parte del público objetivo, dijeron que lo ignoraron porque el título parecía un resumen de logros del mes pasado y no 10 nuevos resultados
    • Los bandos están fuertemente divididos por intereses de cada empresa y por si algo es open source o no
    • Entonces me pregunto cómo estará la investigación en IA en sí. También hay que preguntarse si OpenAI está cerca de automatizar a sus empleados humanos y eliminar puestos de trabajo
    • Sinceramente, ya estoy un poco cansado de este tipo de posts
  • Ya es difícil negar el impacto de la IA, y casi no queda espacio para seguir moviendo la portería. La próxima vez habrá que moverla fuera del estadio
    Mientras más rápido la gente salga de la negación y empiece a tomárselo en serio, mejor

    • Me cuesta entender la crítica de mover la portería. La ciencia consiste en avanzar, aprender y reajustar expectativas; si no cambias los objetivos en absoluto, solo repites el mismo logro
    • El problema no es la negación sino la indiferencia. A la mayoría no le importa, pero sí podrían decirte todo sobre Kim Kardashian
  • No soy experto en el área donde OpenAI dice haber avanzado, así que no quiero desmerecer el logro precipitadamente, pero me preocupa que el lenguaje del blog esté exagerado con fines de marketing
    Es cierto que antes no había métodos computacionales para resolver estos problemas de forma confiable, pero la cuestión clave es si esta demostración aportó una idea nueva a las matemáticas o si simplemente hizo una búsqueda a gran escala de una combinación adecuada de herramientas ya existentes en la literatura
    Quisiera saber si desde el principio era un problema cuya respuesta parecía intuitiva y demostrable, pero no lo bastante valioso como para que expertos le dedicaran tiempo, o si era intrínsecamente difícil y la IA hizo algo más que meterlo en un gran resolvedor

    • A partir de los registros de citas, la investigación de ruptura puede definirse como aquella que es muy citada y al mismo tiempo conecta linajes de citas que antes no aparecían juntos. En cambio, la investigación incremental común combina citas previas que ya estaban cercanas entre sí
      Es decir, la innovación puede medirse de forma bastante concreta como el grado en que conecta ideas y campos que antes no estaban vinculados. Puja Ohlhaver habló sobre esto, y yo también participé en un experimento relacionado: https://www.youtube.com/watch?v=guLDNMAOn24
    • Los problemas de CVP y complejidad de circuitos en ciencias de la computación son tareas muy importantes que los mejores investigadores han estudiado durante 30 o 40 años, incluyendo ganadores del Turing Award. Si de verdad se resolvieron, merecerían premio a mejor artículo en varias de las conferencias más prestigiosas
    • Me cuesta entender la preocupación por exageración de marketing solo porque usaron la palabra advanced. Investigadores con doctorado dedicaron buena parte de su carrera a estos problemas, así que la expresión es adecuada
  • Una de las primeras proyecciones de aceleración brusca de la IA era que un sistema capaz de resolver problemas abiertos de matemáticas avanzadas también dispararía el rendimiento del software mediante nuevos descubrimientos en matemáticas y ciencias de la computación
    El nivel actual corresponde, si fuera humano, a matemáticas de frontera dentro del top 100 a 1,000 mundial, alrededor del top 0.00001%, y también aparecen grandes avances en software, como cuando OpenAI corrigió problemas en kernels de GPU y mejoró el rendimiento cerca de 15%. Ambas cosas se conectan por las leyes de escala y la generalización de la inteligencia: los modelos grandes adquieren a la vez capacidades de matemáticas e ingeniería de software que eran imposibles a menor escala
    Pero ahora veo menos probable que los descubrimientos en matemáticas o ciencia impulsen directamente mejoras de rendimiento en software. Incluso las empresas tecnológicas ponen a doctores en matemáticas a hacer ingeniería de software en vez de matemáticas puras, y muchas veces destacan más por su inteligencia general que por descubrimientos académicos recientes
    Así que sí es evidencia de que los modelos están mejorando, pero cuesta verlo como la antesala inmediata de una aceleración explosiva (foom) detonada por una revolución matemática de frontera

    • Para verlo así habría que asumir que el modelo está sobreajustado explícitamente a las matemáticas académicas y que esa capacidad no se transfiere en absoluto a la ingeniería de software práctica. Yo no apostaría por eso
    • Equiparar nuevos avances matemáticos con un nivel equivalente al top 100 o 1,000 mundial parece basarse en una mala comprensión de lo que realmente hacen los matemáticos
  • La capacidad de una IA interna cuyo nombre ni siquiera se ha revelado es impresionante, pero no aparece ni un solo nombre de contribuidor humano. Al menos alguien debió prepararle café a ese modelo

    • Está especificado que el resultado se logró con una versión interna de Astra, el próximo modelo importante
  • Me pregunto cuál habrá sido el costo total de esta investigación, incluyendo sueldos de matemáticos e ingenieros

    • Si no hizo falta que una persona estuviera encima todo el tiempo, no hay razón para incluir el salario completo. Bastaría contar el tiempo dedicado al entorno de ejecución, la configuración de prompts y la verificación de resultados; el costo de entrenar el modelo se reparte entre otros usos
    • Como OpenAI compensa a sus empleados con acciones, la cifra sería enorme, pero ahora que la infraestructura y el modelo entrenado ya existen, no es un número tan significativo. Aunque la IA no avance más, ya tiene una capacidad destructiva enorme
    • Dicen que el costo de generar las pruebas de los 10 avances fue de menos de 2,000 dólares según los precios de la API de Sol
      https://x.com/polynoamial/status/2083470822258467194
  • Me pregunto qué pasará si empresas como OpenAI dejan de publicar este tipo de resultados y simplemente empiezan a incluirlos en los datos de entrenamiento

    • Mantener en secreto las matemáticas puras casi no tiene valor industrial, y para la empresa sirve sobre todo para presumir la capacidad del modelo. En la práctica, es más probable que dejen de financiar ese tipo de investigación
      Incluso si se usara en privado para mejorar el modelo, el beneficio adicional de unas cuantas demostraciones correctas sería mínimo, y además es probable que al final se extraigan del modelo y se den a conocer afuera
    • Como eran problemas todavía no resueltos, no existían respuestas previas, así que no está claro qué significaría exactamente decir que se meten en el entrenamiento
  • Lugares como OpenAI probablemente pueden dejar que expertos gasten efectivamente millones de dólares en tokens. Como no venden toda su capacidad de cómputo las 24 horas del día, su costo interno real seguramente está más cerca del costo de electricidad
    Aun así, si los recursos de cómputo no se usan por completo, surge la duda de si de verdad harán falta todos los muchos centros de datos que van a construir

    • En OpenAI, la investigación es marketing, así que seguro le asignaron presupuesto suficiente
    • Comparado con el volumen total de salida, probablemente sea un error de redondeo. Están limitando el uso del modelo público para reservar cómputo a investigación, y mientras más centros de datos haya, menos restricciones harán falta
    • El entrenamiento con aprendizaje por refuerzo sí puede usar todos los recursos de cómputo, así que no entiendo con base en qué se diría que no hacen falta
    • Concluir que no hacen falta centros de datos porque había cómputo sobrante para hacer avanzar las matemáticas es bastante forzado. De hecho, la única conclusión razonable de esta noticia es que hacen falta más centros de datos