1 puntos por GN⁺ 2024-10-30 | 1 comentarios | Compartir por WhatsApp
  • OpenAI está desarrollando un chip de inferencia de IA y abandonando su plan de red de fundiciones
  • Broadcom está ayudando con el diseño del chip de OpenAI y facilitando su fabricación en TSMC
  • OpenAI también está sumando chips de IA de AMD para diversificar su suministro de chips

El esfuerzo interno de diseño de chips de OpenAI y el aprovechamiento de alianzas en la industria

  • OpenAI está evaluando varias opciones para diversificar el suministro de chips y reducir costos
  • Por ahora, la empresa planea pausar su ambicioso plan de fundición y concentrarse en su esfuerzo interno de diseño de chips
  • La estrategia de OpenAI muestra, al igual que la de grandes competidores como Amazon, Meta, Google y Microsoft, cómo aprovechar alianzas en la industria y enfoques internos y externos para asegurar el suministro de chips y controlar costos
  • OpenAI es uno de los mayores compradores de chips, y su decisión de desarrollar chips personalizados mientras se abastece de varios fabricantes podría tener un amplio impacto en el sector tecnológico
  • Broadcom ayuda a empresas como Google a ajustar con precisión diseños de chips para su fabricación y suministra componentes de diseño que permiten mover información rápidamente dentro de los chips
  • A través de Broadcom, OpenAI aseguró capacidad de fabricación con TSMC para producir en 2026 su primer chip de diseño personalizado
  • Actualmente, las GPU de Nvidia tienen más del 80% de participación de mercado
  • Sin embargo, la escasez de suministro y el aumento de costos están llevando a grandes clientes como Microsoft, Meta y ahora OpenAI a buscar alternativas internas o externas
  • La decisión de OpenAI de usar chips de AMD a través de Azure de Microsoft muestra que el nuevo chip MI300X de AMD está intentando captar parte del mercado dominado por Nvidia
  • Entrenar modelos de IA y operar servicios como ChatGPT cuesta mucho dinero
  • OpenAI espera este año pérdidas por 5 mil millones de dólares sobre ingresos de 3.7 mil millones de dólares
  • Los costos de cómputo son el mayor gasto de la empresa, lo que ha impulsado esfuerzos para optimizar su utilización y diversificar proveedores

La opinión de GN⁺

  • El esfuerzo interno de OpenAI por diseñar chips y su colaboración con distintos fabricantes representan un cambio importante en la industria de la IA. Esto podría crear nuevas alternativas capaces de desafiar el dominio de Nvidia y acelerar el avance de la tecnología de IA
  • Sin embargo, podrían surgir preocupaciones sobre la estructura de costos de OpenAI. Dado que el desarrollo de modelos de IA y la operación de servicios requieren gastos enormes, existen dudas sobre la rentabilidad y sostenibilidad a largo plazo
  • Al mismo tiempo, la aparición de nuevos chips de IA como el MI300X de AMD impulsará la competencia en el mercado y ofrecerá más opciones a los clientes. Esto podría contribuir a la masificación y comercialización de la tecnología de IA
  • Se espera que la competencia cada vez más intensa en el mercado de chips de IA acelere la innovación tecnológica y aumente la demanda de chips de alto rendimiento y bajo consumo energético. En consecuencia, también se prevé una competencia aún más fuerte por inversión y talento en diseño y fabricación de chips
  • Cuando las empresas adopten chips de IA, deben considerar de forma integral diversos factores como rendimiento, costo, compatibilidad y escalabilidad. Es importante elegir el chip más adecuado para su hoja de ruta tecnológica de largo plazo y su estrategia de negocio

1 comentarios

 
GN⁺ 2024-10-30
Opiniones de Hacker News
  • Como exempleado de Google, no me sorprende en absoluto. Sigo en contacto con amigos que todavía están en Google, y en los últimos meses aumentó mucho la cantidad de ingenieros de hardware provenientes de Google que OpenAI está contratando.
    Con solo mirar en LinkedIn los perfiles de ingenieros de hardware de OpenAI, es fácil ver cuántos vienen de Google. El equipo de TPU de Google quedó como una sombra de lo que fue, así que no me sorprendería que las futuras TPU de Google terminen siendo peores que el nuevo chip de OpenAI.
    El trabajo anterior en las TPU de Google también dependía de la ayuda de Broadcom: https://www.theregister.com/AMP/2023/09/22/google_broadcom_t...
    Dado lo bien que Broadcom ayudó con las TPU de Google, es muy natural que los ex-Googlers se lleven esa relación con el proveedor a su nueva empresa.

    • BRCM se está pareciendo cada vez más a una empresa de servicios que diseña ASIC para compañías que quieren ASIC personalizados. Hay muchas empresas así, y no entiendo por qué esto es noticia.
      BRCM, junto con Marvell y otras, es líder en SerDes, y estas empresas de chips también usan mucho IP de Synopsys y Cadence. Ninguna compañía va a integrar verticalmente toda la IP, así que no parece algo por lo que hacer tanto escándalo.
    • También hay que tener en cuenta que Google invirtió muchísimo tiempo, dinero y capital humano en las TPU, y consiguió resultados lentamente. Incluso empresas con experiencia probada en escalar a gran escala lo intentaron y fracasaron, como Tesla.
      No es tan fácil como encerrar a un montón de doctores en una sala y hacer que produzcan un LLM. El desarrollo de hardware es complicado, lento, lleva mucho tiempo de validación y es extremadamente caro.
  • Jensen viene diciendo que la demanda está “desquiciada”, y también se escuchan rumores de bajos rendimientos. Esto puede traducirse en problemas de suministro durante los próximos meses o años.
    Ninguna empresa del Fortune 500 va a apostar todo su hardware y software de IA a un solo proveedor. Diversificar y alejarse de una única fuente es una decisión inteligente.

    • Cuando los ejecutivos de nuestra empresa preguntan por qué no usamos Nvidia, la respuesta es exactamente la diversificación de proveedores. Lo gracioso es que no usamos Nvidia para entrenamiento en absoluto.
      Usamos Trainium porque no podemos conseguir Nvidia.
    • Me pregunto cómo encaja eso de que “es sensato no poner todo el hardware y software de IA en un único proveedor” con el contrato exclusivo con Microsoft.
      Incluso el contrato OpenAI/Oracle está estructurado de modo que Oracle tenga que ejecutar el stack de Azure en sus propios centros de datos, permitiendo que MSFT medie la relación. Los chips AMD mencionados en el artículo también los compra MSFT.
      Me pregunto si esto significa que OpenAI asume el riesgo y el gasto de capital mientras le proporciona hardware diverso a Microsoft, o si hay otros términos.
  • Decir que OpenAI estaba considerando fabricar todo por su cuenta y recaudar capital para construir una red de fundiciones para fabricar chips minimiza enormemente lo absurda que era la ambición de Sam.
    Él lanzó la idea de recaudar de alguna forma 7 billones de dólares para construir 36 fabs dedicadas a silicio de IA, y se dice que los ejecutivos de TSMC prácticamente se le rieron en la cara al escucharlo.

    • Sam aclaró directamente esa afirmación. Dijo que se refería a que, para satisfacer la demanda, al final todos nosotros, colectivamente, tendríamos que gastar 7 billones de dólares en cómputo, no que OpenAI fuera a recaudar por sí sola 7 billones de dólares y construir toda la capacidad de producción.
    • Me sorprende que Satya Nadella haya visto a esta persona y ese plan y haya pensado: “este es el genio estable al que hay que confiarle OpenAI”.
    • Cualquiera con un poco de sentido común debería haberse reído. 7 billones de dólares no es dinero que simplemente puedas recaudar.
      La inversión neta interna total de EE. UU. ni siquiera llega a 1 billón de dólares: https://fred.stlouisfed.org/series/W790RC1Q027SBEA
      La formación bruta de capital fijo, es decir, la inversión neta más la depreciación, tampoco es mucho mayor: https://fred.stlouisfed.org/series/NFIRSAXDCUSQ
      Google, Apple y Microsoft juntas no llegan a 100.000 millones de dólares de capex anual. Y eso aunque la capitalización de mercado combinada de las tres ronda los 10 billones de dólares.
      Que una empresa de 100.000 millones de dólares pida 7 billones es absurdamente increíble.
    • Aun así, de alguna manera es admirable. Si al principio pides 7 billones de dólares, después pedir solo 1 billón de dólares parece bastante razonable ;-)
    • Tal vez estoy siendo demasiado cínico, pero con solo hablar de una fab ya da risa. El diseño, bueno, puede ser; pero fabricación, en serio.
  • Tras leer el convincente análisis financiero de “The Subprime AI Crisis”, no tengo nada más que agregar salvo una frase de la película “Dodgeball”:
    “Estrategia audaz, Cotton. Veremos si les funciona.”
    0 - https://www.wheresyoured.at/subprimeai/
    1 - https://www.imdb.com/title/tt0364725/quotes/

    • En respuesta al artículo de wheresyouredat, parece que OpenAI debilitó el modelo general gratuito, haciendo que siga dando respuestas incompletas en mis benchmarks. En cambio, el modelo o1 sigue acertando esos mismos benchmarks.
      Antes, el modelo gratuito también solía dar respuestas más correctas a mis benchmarks, según el día. Así que da la impresión de que ampliaron la brecha entre ambos para que o1 parezca más útil.
      No me importa lo que OpenAI haga con su producto, pero a mí me parece que nerfearon el producto gratuito para hacer que o1 se vea relativamente mejor.
  • ¿Cuánto tardará poner el nuevo chip en producción y usarlo para entrenamiento o inferencia?

    • Si es un buen equipo, aproximadamente 2 años. Después hará falta el software para que funcione correctamente. No es algo que se pueda hacer rápido.
      Si le meten más dinero quizá pueda acelerarse, pero también podría arruinarse y terminar tardando más.
    • No creo que el tiempo sea tan importante aquí. Basta ver cómo Apple silicon cambió el rendimiento y eliminó la dependencia de Intel.
      Si logran hacerlo bien, podrían ampliar aún más la brecha con otros proveedores de LLM.
    • Es muy probable que el chip de primera generación no sea suficiente para usarlo en operaciones reales, y entonces tendrán que pasar a la segunda generación. Podría tomar más o menos 3 a 4 años.
  • Probablemente estén construyendo su propio centro de datos para usar este chip, pero es raro que el artículo en realidad no lo diga.
    ¿Hay algún chip occidental de AI/multiplicación de matrices que no se produzca en TSMC? ¿Amazon o Meta quizá son distintos? NVIDIA, AMD y Google TPU también usan TSMC con colaboración de diseño de Broadcom, y ahora OpenAI también.
    Me pregunto si Samsung no es competitivo. También me pregunto si el límite del volumen total de chips o chipsets se debe a la capacidad de producción de TSMC, o más bien a la memoria o al empaquetado.

    • Samsung no es competitivo, así que hoy todos los chips buenos tienen que fabricarse en TSMC. Se ha reportado que el cuello de botella de los chips de AI es el empaquetado y HBM, pero TSMC también está con una alta utilización.
    • Samsung está aproximadamente 2 a 3 años atrás, y no está en un estado tan terrible como dicen en HN. Pero si puedes vender chips con un margen de ganancia del 80%, obviamente vas a querer usar lo mejor.
  • Creo que OpenAI se dio cuenta de que, fuera del reconocimiento de marca, en realidad no tiene una ventaja defensiva, y quiso crearla con fabs y diseño de chips.
    Si sus fabs y chips propietarios hubieran sido mágicamente superiores y pudieran fabricarlos barato sin pagar el impuesto del equipo verde, habrían tenido una ventaja enorme en costos de inferencia.
    Quizá juzgaron que con empezar por chips propietarios ya era suficiente.

  • Sigo pensando que en AI se están desperdiciando transistores. Usamos estados binarios para eliminar entropía del sistema, pero en AI se permite mucha más entropía.
    Para este uso, debería poder emplearse algo mucho mejor que compuertas NAND.

    • Otra razón por la que se usó el enfoque binario es que permitió la automatización de síntesis, no circuitos dibujados a mano. A gran escala eso es realmente importante.
      Reduce los costos de ingeniería no recurrente y acelera el desarrollo. Si abandonas eso, quizá también abandones todo el ecosistema de herramientas que hizo posible la eficiencia actual.
  • Cosas como GH Copilot son impresionantes, pero fuera de eso todavía no he visto el impacto social y cultural de los LLM. Me refiero excluyendo las publicaciones sobrecalentadas en redes sociales donde influencers muestran ejemplos llamativos o lanzamientos de modelos.
    No veo que esta tecnología esté permeando a toda la sociedad, y me pregunto si soy inmune o si está escondida en capas profundas de productos SaaS/empresariales.
    Siento que debería haber un impacto cultural productivo amplio, pegajoso y con alta retención, no algo que termine en “oh, qué genial”, como los televisores 3D o la VR.
    Más aún considerando cuánto dinero se quemó en disipadores para GPU.

    • La generación que está ahora en escuelas y universidades está convirtiendo los LLM en parte de su rutina diaria.
      Fuera del sector educativo, también creció una industria SEO alrededor de los LLM, y les encanta su nueva capacidad de producir spam a gran escala.
      En empresas y gobierno se están adoptando con cautela para mejorar la productividad en tareas de comunicación donde se tolera cierta alucinación o un estilo corporativo robótico. La frase final todavía la escribe una persona.
      En soporte al cliente y ventas están gastando dinero en versiones “AI” de los viejos árboles de menú telefónicos, que al final te hacen gritar “quiero hablar con un agente” antes de que te conecten con una persona.
      En otros lados, la adopción es lenta. Esperamos resultados deterministas, pero con estos modelos es difícil esperarlos. Al crear software que interactúa con APIs de LLM, la salida puede salirse aleatoriamente de la estructura solicitada, así que hay que volver a implementar técnicas de programación defensiva que no se usaban desde hace más de 10 años. Por eso incluso usar salidas estructuradas o llamadas a funciones se vuelve complicado.
    • Comprobarlo es bastante fácil. Pregúntales a tus amigos, de ser posible a amigos que no sean desarrolladores, si lo usan.
      Al ver que un amigo de contabilidad y una amiga de marketing lo usan para análisis básicos o para redactar textos promocionales, me di cuenta de que ya los no desarrolladores también lo usan con regularidad.
      El uso por parte de perfiles no técnicos importa en este campo. Como contraejemplo de la sobreexcitación está la criptomoneda: las personas no técnicas que conozco solo la “tenían” a través de exchanges, pero no concretaban los casos de uso prometidos.
    • La gente a mi alrededor y yo lo usamos para reemplazar parte de la búsqueda web.
      En particular, o1-preview es bastante bueno para escribir mini reseñas de panorama general sobre preguntas que me interesan.
      Funciona bien cuando ya hay muchos textos sobre el tema y hay que recombinarlos según mi pregunta.
      El formato de chat es mucho más eficiente que buscar en la web o leer varios artículos relacionados de Wikipedia. Realmente es cuestión de si ves el vaso medio lleno o medio vacío. Me impresiona mucho su utilidad y tengo expectativas, pero al mismo tiempo claramente no es AGI.
    • Curiosamente, parece que los medios no han captado bien su uso. La mayoría de periodistas y youtubers solo muestran casos de uso triviales.
      He visto a personas inesperadas usar LLM para todo tipo de fines. En muchos casos ni siquiera quieren contarle a su jefe que usan la herramienta, porque les da superpoderes.
      Hablo de empleados bancarios, gerentes de tienda, políticos locales y pequeños empresarios. Antes a mí también me habría costado creerlo, pero cada vez veo más gente inesperada usando LLM y armando bien sus prompts.
    • Parece que solo estás pensando en consumidores directos, pero hay que ver que Microsoft integró Copilot en Windows y lo sigue mejorando.
      Cuando todos los usuarios de Outlook tengan botones para resumir, extraer y mejorar correos, cientos de millones de personas usarán LLM todos los días.
  • Decir que iban a gastar 7 billones de dólares en fabs propias era ambicioso y a la vez una locura. Parece que al final la realidad se impuso. Si despertaron de ese gran sueño, espero que sigan manteniendo la calidad.

    • Parece más bien que ya terminó el trabajo de fijar un punto de referencia de precios y que ahora están listos para cerrar tratos reales.