1 puntos por GN⁺ 2024-12-02 | 1 comentarios | Compartir por WhatsApp

1 comentarios

 
GN⁺ 2024-12-02
Comentarios de Hacker News
  • Agregué al final del texto que escribí sobre AlphaChip(https://vighneshiyer.com/misc/ml-for-placement/) una refutación de Google y un apéndice que trata el algoritmo AlphaChip en general
    En resumen, creo que los autores de Nature sí hicieron algunas críticas válidas a la metodología de entrenamiento de los autores de ISPD. Pero AlphaChip sigue siendo poco competitivo frente a los floorplanners automáticos comerciales y AutoDMP porque su costo computacional y su tiempo de ejecución son demasiado altos. Aun así, los autores de ISPD deberían publicar un estudio más riguroso que aborde todas las críticas de los autores de Nature, y evaluar aunque sea los checkpoints de preentrenamiento que Google publicó sería material útil para la discusión

    • En la conclusión del texto dijiste: “Reconozco que hubo cosas que los autores de ISPD podrían haber hecho mejor, pero la conclusión sigue siendo válida. Los autores de Nature no abordan el hecho de que CMP y AutoDMP logran mejor rendimiento que CT con mucho menos tiempo de ejecución y requisitos computacionales”. Pero uno de los puntos centrales de la refutación es que los recursos usados para la comparación eran mucho menores
      Solo por esa razón ya parece suficiente para poner en duda la validez de las conclusiones del estudio de ISPD; me gustaría saber qué opinas. Además, este comentario es neutral, pero en el texto usabas un tono mucho más fuerte con expresiones como “arrogance”, “disdain”, “hyperbole”, “belittling” y “hostile” hacia los autores de AlphaChip, mientras que al vicepresidente de Synopsys lo llamabas “excellent”. También me da curiosidad de dónde sale esa diferencia
    • Usar 16 GPU durante unas 6 horas para inferencia y 48 horas para preentrenamiento no es una cantidad excesiva de cómputo
      En la nube, una GPU cuesta alrededor de 1 a 2 dólares por hora, así que la inferencia sale en unos 100 a 200 dólares y el preentrenamiento en unos 800 a 1600 dólares, y el costo del preentrenamiento se amortiza entre varios chips. Los precios de la nube están cerca del límite superior, y la mayoría de los laboratorios de ciencias de la computación tienen muchos más recursos on-premise que eso. En la industria, ese costo es completamente menor comparado con el resto del proceso de diseño de chips, y solo las licencias de software EDA comercial ya cuestan millones de dólares
  • A estas alturas, no veo por qué no darle de entrada al menos un mínimo de credibilidad a Jeff Dean. Su trayectoria es difícil de comparar con la de cualquiera y sigue muy activo. ¿Ha pasado algo que realmente merezca poner una sombra sobre él? A veces el mensajero en sí mismo tiene peso

    • Aquí parece haberse puesto del lado de la gente equivocada. En esencia es un constructor de sistemas, no un experto en diseño de chips ni en EDA, y estrictamente hablando tampoco es un investigador de machine learning
      Algunos dirán que lo enredó un joven estafador carismático y que ahora ya se metió demasiado como para echarse atrás. Además, enfocarse en este proyecto tampoco ayudó a su posición dentro de Google; el año pasado todos los asuntos importantes pasaron a Demis y a él solo le quedó un título casi honorífico. Considerando sus logros, resulta bastante triste
    • Que Jeff Dean recibiera esa confianza tenía sentido cuando daba charlas en 2020, 2021 y 2022. Pero ahora está respondiendo al escepticismo de la comunidad EDA con ataques personales no académicos y referencias vagas a que lo usan “muchas empresas”
      Creo que ya pasamos la etapa de asumir buena fe y entramos en una zona donde es razonable tener bastantes sospechas
  • Me pregunto por qué hay tanta emoción y tanta hostilidad en esta polémica. ¿Cómo una discusión académica aburrida sobre benchmarks o significancia terminó convertida en una pelea de ataques personales?

    • Hay mucha gente trabajando con enfoques de implementación que no son de IA
    • Se hacen afirmaciones grandilocuentes sin una forma de reproducirlas, y luego corren a la prensa, que publica cualquier cosa
      Decir “la IA diseña IA… no, diseña chips” les suena futurista a los de humanidades, y al parecer también a los programadores que deberían desconfiar de todo lo que lleve “IA”. Desde haberlo publicado en Nature, todo el proceso de publicación parece deshonesto. ¿Por qué no en algo como ISCCC?
    • Por dinero
    • Si esto te parece desagradable, deberías ver a los activistas ambientales en Twitter intentando atacar a Jeff Dean
    • El problema es que los incentivos comerciales de Big Tech alrededor de la IA han contaminado las aguas de la “academia aburrida” y han producido publicidad informativa deshonesta disfrazada de artículos de revista o preprints de arXiv[1]
      Como resultado, la investigación moderna en IA está atravesando una crisis de reproducibilidad mucho peor que la de las ciencias sociales, con muchas menos excusas válidas. Si Google no estuviera mintiendo, gran parte de la controversia se disiparía con solo publicar los datos de benchmark para que personas independientes los revisen, pero siguen negándose: https://cacm.acm.org/news/updates-spark-uproar/ Parece que Google cree que sus conclusiones deben aceptarse simplemente por autoridad. Además, el artículo filtrado del denunciante interno Satrajit Chatterjee, despedido por Google en 2022, decía que la ventaja de “30~35%” de RePlAce coincidía con resultados que refutaban las afirmaciones “sobrehumanas” que Google promovía en ese momento sobre su enfoque de IA para diseño de chips. Los “ataques personales” contra Jeff Dean son totalmente apropiados, porque el centro de la crítica es que su carácter es deshonesto y autoritario. Publica investigaciones dudosas y despide a quienes se oponen
      [1] Es especialmente repugnante que Jeff Dean se burle del artículo crítico por ser un paper de conferencia. Es una actitud increíblemente pésima
  • Según un tuit de Jeff Dean, Cheng y otros no siguieron el procedimiento necesario para reproducir el trabajo de los investigadores de Google.
    En particular, dijo que “los autores no hicieron ningún preentrenamiento, a pesar de que el preentrenamiento se menciona 37 veces en el artículo de Nature, por lo que privaron al método basado en aprendizaje de la capacidad de aprender de otros diseños de chips”. Sin embargo, en el repositorio de Google de Circuit Training[1] se indica explícitamente que “los resultados entrenados desde cero son similares o mejores que los resultados del artículo al afinar un modelo preentrenado”. Puede que yo esté entendiendo algo mal, pero ¿cuál de las dos es? ¿Lo arruinaron por no hacer preentrenamiento, o intentaron una reproducción justa siguiendo el “procedimiento” descrito originalmente en el repositorio? Dado que el grupo de UCSD tuvo que hacer ingeniería inversa de varios pasos, parece que los resultados del artículo por sí solos no eran reproducibles.
    [1]: https://github.com/google-research/circuit_training/blob/mai...

    • El artículo de Markov también enlaza a un artículo de otro grupo de autores de Google, y ahí también la ventaja del preentrenamiento aparece como muy pequeña.
      Además, cuando hay pocos benchmarks, usar un modelo preentrenado de Google cuyo origen no se conoce podría ser contraproducente. Google probablemente lo entrenó con todos los benchmarks disponibles para hacer que reproduzca la solución óptima de las herramientas comerciales.
    • “Entrenar desde cero” también podría significar mezclar intentos de diseño nuevos con diseños anteriores.
      En ese caso no habría contradicción. La diferencia sería entre preentrenar con diseños anteriores y luego afinar con un diseño nuevo, frente a entrenar desde cero mezclando todos los datos durante todo el período. El ajuste fino puede causar olvido catastrófico, y ambos enfoques podrían rendir mejor que no incluir en absoluto diseños anteriores.
    • El repositorio de Circuit Training parece más bien mostrar un ejemplo simple. Es común que un repositorio de código abierto describa un ejemplo sencillo para probar o validar la configuración, y eso no significa que, en general, sea la forma de obtener resultados óptimos.
      La confusión pudo haber surgido porque en ese ejemplo se dijo que se obtuvieron resultados similares a los del artículo con preentrenamiento. Pero eso claramente no negaba el preentrenamiento en general. Si Cheng y otros realmente sintieron que era ambiguo, debieron haber consultado al autor de correspondencia. Si sintieron que tenían que “hacer ingeniería inversa” de partes del repositorio, también debieron haber preguntado eso.
  • Publicaciones relacionadas. ¿Hay alguna otra?
    AI Alone Isn't Ready for Chip Design - https://news.ycombinator.com/item?id=42207373 - noviembre de 2024, 2 comentarios
    That Chip Has Sailed: Critique of Unfounded Skepticism Around AI for Chip Design - https://news.ycombinator.com/item?id=42172967 - noviembre de 2024, 9 comentarios
    Reevaluating Google's Reinforcement Learning for IC Macro Placement (AlphaChip) - https://news.ycombinator.com/item?id=42042046 - noviembre de 2024, 1 comentario
    How AlphaChip transformed computer chip design - https://news.ycombinator.com/item?id=41672110 - septiembre de 2024, 194 comentarios
    Tension Inside Google over a Fired AI Researcher’s Conduct - https://news.ycombinator.com/item?id=31576301 - mayo de 2022, 23 comentarios
    Google is using AI to design chips that will accelerate AI - https://news.ycombinator.com/item?id=22717983 - marzo de 2020, 1 comentario

  • El contexto de la respuesta de Jeff Dean está aquí.
    https://news.ycombinator.com/item?id=41673769
    https://news.ycombinator.com/item?id=41673808

  • Es casi ridículo lo caro que puede salir una mala contratación: https://www.wired.com/story/google-brain-ai-researcher-fired...

    • Chatterjee, que en el artículo enlazado queda como el villano, ahora al parecer está demandando a Google. Parece creer que lo despidieron por señalar que su jefe, Jeff Dean, estaba haciendo afirmaciones falsas a sabiendas
      Se dice que la frase “Para ser claros, no hay evidencia para creer que RL sea mejor que el estado del arte académico o que los colocadores de macros comerciales más sólidos. La comparación con estos últimos fue tan deficiente que en muchos casos las herramientas comerciales ni siquiera pudieron ejecutarse por problemas de instalación” es una captura de pantalla de una presentación interna de Jeff Dean. https://regmedia.co.uk/2023/03/26/satrajit_vs_google.pdf Como externo, es muy difícil juzgar si Chatterjee fue una mala y costosa contratación que bloqueó los buenos resultados de sus colegas, o un empleado sumamente valioso que intentó impedir una presentación falsa
    • De verdad se desperdició muchísimo tiempo
      Incluso hizo investigación interna con Markov, pero los autores de AlphaChip lo explican así. Dicen que en 2022 un comité independiente de Google lo revisó y concluyó que “las afirmaciones y conclusiones del borrador no estaban respaldadas científicamente por los experimentos”, y que “cuando los resultados del dataset original de [AlphaChip] se reprodujeron de forma independiente, surgieron dudas sobre los resultados de RL de [Markov et al.]”. Los autores dicen que le proporcionaron al comité un script de una sola línea que producía resultados de RL mucho mejores que los reportados por Markov et al., y que esos resultados incluso superaban su línea base “más fuerte” de recocido simulado. Dicen que todavía no saben cómo Markov y sus coautores produjeron las cifras del paper
      (https://arxiv.org/pdf/2411.10053)
    • Contratar gente que comete fraude o manipulación en la academia, las finanzas y otros ámbitos es realmente un problema serio
      La mejor forma de reducirlo, y quizá la única, son los incentivos, controles y cultura internos. Si exiges con fuerza mejoras interminables de unos cuantos puntos porcentuales en cada ciclo, y además asciendes de manera constante a quienes traen esos resultados sin verificar siquiera si esos logros existían desde el principio, al final pasa lo mismo sin importar la escala. Puede ocurrir en un equipo pequeño, un departamento, una empresa, un hedge fund que posee muchas de esas empresas, fondos de esos fondos o el gobierno federal. Tarde o temprano, el liderazgo queda bastante infiltrado por gente sin escrúpulos. Los continuos escándalos de publicaciones en la academia y los innumerables casos en las finanzas son ejemplos de ello. Holmes y SBF están en prisión, pero la misma clase de gente que los financió sigue en la cima de la influencia, ahora cargando esa ideología y con abogados todavía mejores. Hay un dicho viejo: “el pescado se pudre por la cabeza”. Si ves toda la conducta sospechosa y los escándalos interminables de los líderes emblemáticos de la industria STEM y reaccionas con “bien hecho, le ganaron al sistema”, es difícil esperar otro resultado que no sea un ataque generalizado contra un orden previo honesto y justo. Al final también hemos votado con los pies por un ideal cuasirreligioso de que “el poder hace el derecho”, y yo también fui parte de eso hasta que renuncié por asco. Se le llama de muchas maneras, como Objectivism, Effective Altruism o Capitalism, pero ni siquiera es capitalismo de verdad. No se puede sorprender uno de que todo esté pegajosamente contaminado. No sé muy bien cuál sea la respuesta hoy. Tal vez trabajar en empresas menos malas, exponer abusos al menos de forma anónima y escuchar con atención lo que dicen los líderes en entrevistas para examinarlo a fondo. Me gustaría oír otras propuestas
  • Entiendo la presión de que Jeff tenga que responder aquí. Su nombre aparece en casi toda la producción de investigación de “Google Brain”
    Pero responder con algo del estilo “sí es reproducible, ellos no pudieron porque son tontos” no es una refutación, es hostigamiento. Parece que los críticos tocaron un nervio y que no hay una buena manera de refutar los problemas de reproducibilidad que su investigación pone en evidencia

    • En el tuit enlazado no hace esa afirmación. Su argumento es que “no pudieron reproducirlo porque no siguieron el procedimiento”, y sin importar cuál sea su motivación, parece una afirmación bastante razonable
    • Si no siguieron el procedimiento de reproducción, por ejemplo el preentrenamiento o suficiente cómputo, y luego fallaron, no veo qué tiene de malo señalar los defectos de ese intento de “reproducción”
    • ¿Dónde dice eso? En el tuit, Dean da pasos concretos que los autores omitieron
    • Por suerte, él no dijo eso
      El tuit solo dice que el intento de reproducción no siguió realmente la metodología original. No llama “tontos” ni nada parecido a los autores del intento de reproducción; eso simplemente fue inventado. Y la lógica claramente errónea de “no pudieron reproducirlo, así que sí es reproducible” también es una invención total
    • Sí da risa que afirme que hay sesgo por el empleador de los críticos, como si trabajar en Google no fuera un conflicto de interés
      ¿Acaso Google no es una empresa que exagera desesperadamente todo tipo de desarrollos de IA “yo también” para inflar el precio de su acción? Jeff parece haber tomado tanto kool-aid que ya hasta olvidó qué es el agua
  • La prueba definitiva de Google es fabricar chips mejores que los de la competencia. Por ahora no lo está logrando

  • La crítica de “cuando reprodujeron nuestro método no usaron suficientes recursos de cómputo” suena un poco ridícula hoy en día. Claro, por supuesto, ustedes son Google
    Suena como decir que no se puede auditar nuestra metodología si no posees una nube. No sería sorprendente que más cómputo y más preentrenamiento ayuden, pero entonces la validación se vuelve difícil. También hay un ángulo interesante del lado contrario. Google tiene muchísimo cómputo, pero Synopsys tiene muchísimos datos para entrenar. Claro, con la gran condición de si está permitido entrenar con propiedad intelectual de clientes

    • Los diseñadores de chips ejecutan las herramientas EDA on-premises. ¿Cómo se supone que una empresa de EDA accedería a los datos de los clientes? Tal vez para depuración bajo NDA, pero eso no significa que puedan entrenar con propiedad intelectual de clientes