1 puntos por GN⁺ 3 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Tras la publicación de Kimi K3, crecieron las voces que ven a la IA de código abierto como una amenaza peligrosa, pero el software propietario también se construye sobre bases de código abierto, y los modelos de IA son el mismo tipo de producto de software.
  • Las empresas comerciales desarrollan en conjunto componentes inferiores que no las diferencian y compiten en los productos de capas superiores, por lo que los modelos de IA también podrían convertirse en bienes básicos, aunque los laboratorios de frontera tienen incentivos para no querer eso.
  • Como muestran los casos de PGP y SSL, es muy difícil restringir el software de código abierto; incluso si se intentara regular los modelos chinos, la destilación y el fine-tuning volverían ambiguo el criterio de nacionalidad, por lo que solo los usuarios de EE. UU. podrían terminar restringidos.
  • Nvidia, startups estadounidenses, usuarios empresariales de IA, Google y Meta, entre otros, tienen incentivos comerciales propios para desarrollar modelos de código abierto, y los modelos gratuitos pueden convertirse en un recurso para la transición a la IA que permita a un país absorber nuevas tecnologías y hacer crecer su economía.
  • Los argumentos que temen dumping, propaganda y backdoors de China pasan por alto que el software puede copiarse, modificarse e inspeccionarse; la IA de código abierto es poderosa y difícil de controlar, por lo que probablemente seguirá expandiéndose pese a los frenos de política pública.

Cómo el código abierto sostiene al software comercial

  • Dean Ball, de OpenAI, considera que si dominan los modelos de pesos abiertos podría surgir un “comunismo de la IA”, en el que la IA se vuelve un bien público en vez de un producto de mercado.
  • La lógica de los laboratorios de frontera es que los modelos de código abierto son peligrosos, por lo que solo deberían acceder a ellos guardianes responsables y usuarios confiables; pero, en la práctica, todo el software propietario está construido sobre código abierto.
  • Los productos de software tienen una estructura de varios programas apilados en capas.
    • Para crear un servicio como Uber se necesitan numerosos componentes, como frameworks de lenguajes de programación, software para enviar y recibir tráfico web y herramientas de análisis de datos.
    • La mayoría de estos componentes inferiores no son elementos diferenciadores para las empresas, así que les conviene comercialmente desarrollarlos en conjunto y competir en las capas superiores, donde realmente ocurre la diferenciación.
  • Los laboratorios de frontera no quieren que los modelos de IA se conviertan en componentes de uso general tan comunes que ya no haga falta competir en ellos, pero todavía no está definido si eso ocurrirá realmente.
  • Aquí, modelos de código abierto se refiere a modelos de pesos abiertos.

Por qué es difícil restringir el código abierto

  • El software de código abierto es extremadamente difícil de restringir, y los intentos de hacerlo pueden debilitar a las empresas nacionales frente a competidores internacionales.
  • En 1991, cuando Phil Zimmermann creó PGP, el gobierno de EE. UU. trataba el cifrado como tecnología militar e inició una investigación penal contra Zimmermann.
  • Cuando Netscape desarrolló SSL, el gobierno de EE. UU. solo permitió distribuir en el extranjero una versión debilitada.
    • Como la versión internacional debilitada circuló con más facilidad, muchos estadounidenses también la usaron.
    • Los controles de exportación no impidieron la expansión del cifrado y, de hecho, terminaron perjudicando a los estadounidenses.
  • Las herramientas de cifrado, incluidas SSL y PGP, siguieron usándose en todo el mundo, y los tribunales determinaron que publicar código fuente de cifrado era una forma de expresión protegida.
  • Más tarde, el gobierno de EE. UU. flexibilizó los controles de exportación de cifrado.

Por qué es difícil regular solo los modelos chinos

  • El propio criterio para determinar la nacionalidad de un modelo es ambiguo.
    • No está claro si un modelo destilado a partir de un modelo estadounidense puede considerarse un modelo chino.
    • Tampoco queda claro de qué país es un modelo chino al que una persona estadounidense le hizo fine-tuning.
  • En el mejor de los casos, este tipo de regulación podría imponer a los estadounidenses una carga administrativa y acceso limitado a la IA de forma temporal, dejándolos en desventaja frente a otros países.

Incentivos para crear IA de código abierto fuera de China

  • La IA de código abierto no es una tecnología que solo el gobierno chino tenga incentivos para desarrollar; distintos actores comerciales pueden participar por sus propias razones de negocio.
  • Fabricantes de chips

    • Jensen Huang, CEO de Nvidia, llama a lo que fabrica Nvidia “fábricas de tokens”.
    • Nvidia busca generar la mayor demanda posible de tokens, ya sea que estos se ejecuten en sus chips mediante modelos de frontera o mediante modelos de código abierto baratos.
    • También publicó su propia familia de modelos de código abierto Nemotron.
    • El enorme capital invertido en entrenar modelos de frontera también beneficia a Nvidia, pero a largo plazo obtiene ganancias incluso si la demanda de tokens comerciales se reemplaza por demanda de tokens de código abierto.
  • Startups estadounidenses

    • Thinking Machines Lab publicó Inkling, un potente modelo de código abierto.
    • Considera que, si los modelos se vuelven bienes básicos, puede construir una ventaja competitiva defendible en servicios complementarios o de personalización.
  • Usuarios empresariales de IA

    • Por ahora no participan activamente en el desarrollo de IA de código abierto, pero querrán modelos más baratos para tareas de menor complejidad.
    • Para funciones orientadas a clientes, necesitan un control más fino.
  • Grandes empresas tecnológicas

    • Google y Meta no pueden dejar de prestar atención al nuevo producto publicitario de OpenAI.
    • Si crece el negocio publicitario de los modelos de frontera, tendrán incentivos para convertir los modelos de código abierto sin publicidad en bienes básicos y así contener la competencia publicitaria.

El objetivo ambiguo de la “carrera de la IA”

  • Las preocupaciones sobre los modelos chinos suelen centrarse en la idea de perder la carrera de la IA, pero ni siquiera está claro si el objetivo es desarrollar el mejor modelo o vender la mayor cantidad de tokens.
  • A diferencia de enviar primero un cohete a la Luna, la carrera de la IA es un proceso de adaptación a una nueva tecnología transformadora, por lo que es tan ambigua como la expresión “carrera de Internet”.
  • Si existe una competencia entre países, lo central es absorber la transición tecnológica y hacer crecer la economía; bajo este criterio, los modelos de IA gratuitos son una ventaja, no una amenaza.

El argumento del dumping chino en IA

  • Scott Galloway sostiene que China igualó la calidad occidental en paneles solares, acero, vehículos eléctricos y baterías, luego redujo los precios a un tercio y dominó el mercado, y que podría aplicar la misma estrategia a la IA gratuita.
  • Sin embargo, salvo por los chips, la IA no es un producto físico.
    • Los paneles solares y el acero requieren cadenas de suministro físicas en las que es difícil que cada etapa exista de forma independiente.
    • Si un país no fabrica paneles solares, también es difícil que construya un negocio de obleas de silicio para energía solar.
  • En software, que un modelo de código abierto provenga de China no impide un negocio de fine-tuning en EE. UU.; al contrario, puede usarse como base para ese negocio.

Sesgo propagandístico y modificación de modelos

  • No es irrazonable asumir que un modelo chino pueda incluir sesgo pro-China, pero es difícil usar eso como motivo para restringirlo.
  • Si el sesgo político de un modelo de código abierto es un problema, los usuarios estadounidenses pueden modificarlo y redistribuirlo como un modelo “americanizado”.
  • En el mercado estadounidense, a un modelo distorsionado con sesgo pro-China le costaría superar a un modelo con sesgo proestadounidense de desempeño similar.

Backdoors e inspección pública

  • La IA tampoco cambia la estructura básica del mercado de vulnerabilidades: los actores responsables parchean vulnerabilidades y los atacantes las explotan.
  • Restringir las herramientas de los actores responsables solo beneficia a los atacantes.
  • En teoría, es posible que un actor malicioso inserte comportamientos adversarios ocultos en un modelo.
  • Los actores responsables deben encontrar esos comportamientos lo antes posible, y la forma más eficaz es permitir que cualquiera inspeccione el modelo.

Competitividad de los modelos de frontera y los agentes de programación

  • No hay garantía de que los proveedores de frontera también dominen los mercados no fronterizos.
    • En el desarrollo de modelos pequeños, el acceso a enormes cantidades de capital es menos importante.
    • Los proveedores de frontera pueden dirigir a los usuarios hacia modelos más caros, por lo que tienen pocos incentivos para desarrollar activamente modelos pequeños.
  • La adherencia de Claude Code y Codex es similar a la de Coke y Pepsi: una vez que alguien elige uno, tiene pocos motivos para cambiar, pero eso requiere el supuesto de que costo y calidad sean parecidos.
  • Los agentes de programación no tienen una ventaja competitiva defendible; ante pequeñas molestias como diferencias de precio, calidad del modelo o problemas de confiabilidad, los usuarios pueden migrar a otro agente.

La expansión de la IA de código abierto

  • La IA de código abierto es poderosa y difícil de controlar, por lo que es difícil frenarla solo por las preferencias de responsables de política pública o líderes empresariales.
  • Los intentos de contener su expansión solo generarán ruido temporal, pero no impedirán la llegada de la IA de código abierto.

1 comentarios

 
GN⁺ 3 시간 전
Comentarios de Hacker News
  • Esto no es IA de código abierto. Para ser open source tendría que estar el código fuente de Photoshop y una licencia de la OSI; si solo se publican los binarios, eso corresponde a pesos abiertos, y una app web SaaS es un modelo cerrado como GPT u Opus/Fable
    El modelo chino en cuestión solo permite ejecutar el binario en su propio entorno en vez de usar una API. Si quieren open source de verdad, miren proyectos como OLMo 3: https://allenai.org/

    • Es cierto que entre los modelos chinos actuales no hay una familia que ofrezca una documentación reproducible al nivel de OLMo/Nemotron, cubriendo modelo, datos, checkpoints, evaluación, código y todo el proceso de base/inferencia/instrucción/RLVR
      Aun así, componentes como MAP-Neo y YuLan-Mini para preentrenamiento transparente, y DAPO/verl y Open-Reasoner-Zero para RL de razonamiento, existen repartidos entre varios proyectos. Que aparezca un OLMo chino es cuestión de tiempo y, considerando incluso esfuerzos del sector público global como Apertus en Suiza y LLM-jp-4 en Japón, para 2027 probablemente veremos una guía totalmente open source con la que incluso una persona pueda reproducir un modelo de punta al menos al nivel de 2023~2024
    • Considerar un modelo de pesos abiertos igual que un binario cerrado es absurdo. Los pesos abiertos se pueden ajustar finamente, mientras que modificar un binario cerrado para adaptarlo a un propósito es mucho más difícil
    • La IA de código abierto es difícil de crear. Incluso los modelos pequeños requieren recursos enormes, así que no aplica tal cual el modelo tradicional del software open source, donde una persona podía construir en su tiempo libre piezas centrales de la infraestructura mundial
      Más bien se parece a la investigación científica, así que hace falta financiamiento público y una institución de confianza que lo administre. Ojalá Allen AI cumpla ese rol, pero no está claro si EE. UU. realmente se dirige hacia la inversión que requiere una IA de interés público. Además, Photoshop no es una comparación adecuada frente a un modelo de pesos abiertos. No se puede distribuir legalmente una copia de Photoshop, pero sí se puede distribuir GLM 5.2; para comparar habría que usar una aplicación privativa gratuita
    • El costo principal de producir código fuente son los millones de dólares pagados a ingenieros de software, y el software de código abierto permite que otros se beneficien de esa inversión. El costo principal de un modelo de IA es el entrenamiento, también de millones de dólares, y un modelo abierto igualmente permite que otros aprovechen el resultado de esa inversión
      Incluso si recibieras todos los datos de entrenamiento y la arquitectura, para modificar el modelo no lo volverías a entrenar desde cero, sino que ajustarías finamente el comportamiento deseado. Así como llamamos open source al software cuando se puede modificar, un modelo también puede considerarse abierto si se puede ajustar finamente
    • Parte de la lógica del artículo depende de “basta con cambiar el entrenamiento”, así que tiene sentido señalar las limitaciones de los pesos abiertos. Se puede seguir entrenando, pero no se puede borrar el entrenamiento existente, así que no es del todo justo afirmar “solo vuelvan a entrenarlo para esa nacionalidad”
      En la práctica, para entrenar desde cero un modelo equivalente hace falta verdadero open source
  • La ansiedad alrededor de los modelos chinos se centra en “nos estamos quedando atrás en la carrera de la IA”, pero la meta de la que hablan algunos es llegar a una especie de singularidad. Incluso sin creer en interpretaciones de ciencia ficción, hay un argumento realista de que ciertos logros en el desarrollo de IA podrían convertirse de hecho en armas ultrapotentes
    Altman también ha dicho públicamente que eso terminará ocurriendo y que quiere ser quien lo construya. Aunque no haya superinteligencia, si una máquina puede explotar vulnerabilidades de ciberseguridad eso ya es suficientemente preocupante para un gobierno, y recientemente el gobierno de EE. UU. usó ese mismo argumento al prohibir modelos estadounidenses. No hace falta creer en la singularidad para entender que algunos la ven como la meta de la carrera por la IA

    • Si la IA se convierte en un arma ultrapotente, ¿por qué habría que confiar en que sea propiedad de empresas privadas? Si se puede descargar públicamente, tampoco hay razón para prohibir el acceso solo a los ciudadanos estadounidenses
    • Si están dispuestos a sacrificar vidas reales por la remota posibilidad de una iluminación y deificación, parece que necesitan ayuda profesional
    • El incidente de OpenAI/Hugging Face demuestra la necesidad de modelos abiertos. En su análisis posterior, Hugging Face dijo que identificó rápidamente que la causa de la amenaza era una IA avanzada e intentó analizar datos sospechosos de telemetría con un modelo de punta, pero falló por las barreras de seguridad del modelo
      En su lugar, ejecutó un GLM sin esas barreras para analizar los datos y encontrar la causa raíz. Si una empresa quiere evaluar correctamente una amenaza, también necesita modelos con mínimas restricciones de seguridad. Si no existe una IA de pesos abiertos para inspeccionar una IA de punta fuera de control, también desaparecen los medios para responder
    • Esa gente no ha aprendido pensamiento sistémico, o no sabe aplicarlo al hecho de que la IA no es un sistema cerrado
    • En general estoy de acuerdo con la idea, pero si en Occidente se crea la “IA definitiva”, lo más probable es que se desarrolle con dinero de varios inversionistas privados. Incluso China dependerá de inversionistas que esperan rentabilidad, y ellos quieren ganancias distribuibles, no una única singularidad indivisible
      Los inversionistas esperan ingresos constantes desde antes de la singularidad, así que las empresas tienen que vender modelos. Si bloquean por completo la generación actual, también se quedan sin el dinero para construir la siguiente, y eso crea un equilibrio complicado
  • Es gracioso que esto apareciera apenas 4 días después de que un ejecutivo de OpenAI sembrara pánico diciendo que “de un laboratorio chino escapó un agente sin vida, invisible, peligroso y capaz de autorreplicarse infinitamente”: https://news.ycombinator.com/item?id=48997548

  • Puede haber desacuerdos razonables sobre el nivel de preocupación por la seguridad de la IA en el futuro cercano y mediano plazo. Pero no tratar esos argumentos en absoluto reduce muchísimo el valor de este artículo

    • Sí intentó tocar el tema de la seguridad, aunque fuera brevemente, en las partes sobre backdoors y propaganda. Me da curiosidad qué más te habría gustado ver
      Como el enfoque del texto es comparar IA abierta y cerrada, y no considera que las preocupaciones de seguridad difieran mucho entre ambas, no le dedicó tanto espacio
  • La razón para oponerse a una IA que corra libremente en local es que las empresas quieren controlar al público general. EE. UU. es un infierno centrado en las corporaciones

    • Si alguien lee el texto original y concluye tajantemente que no existe ninguna preocupación legítima de seguridad que una persona razonable pueda tener, entonces este artículo terminó produciendo el efecto contrario en vez de convencer al lector: [1] https://news.ycombinator.com/item?id=49029303
  • Los LLM se entrenan no solo con datos públicos, sino también con datos obtenidos ilegalmente. El acuerdo de 1.5 mil millones de dólares de Anthropic es un ejemplo, y los LLM no son nada sin enormes volúmenes de datos humanos
    Se puede sostener que este tipo de investigación debería limitarse a gobiernos y universidades reguladas, en lugar de empresas públicas opacas con conflictos de interés, o ser gestionada por verdaderas comunidades sin fines de lucro con sistemas de gobernanza democrática, como los estándares de internet o las telecomunicaciones. Por más que presuman virtudes, es difícil creer que las empresas privadas se regularán eficazmente a sí mismas y comunicarán con transparencia los riesgos al público y a la comunidad científica, y los continuos conflictos de interés socavan su credibilidad

  • Decir “no se puede detener X” es un argumento flojo y pésimo para sostener la conclusión de que “X no es malo”. No tengo nada más que decir sobre el resto del texto

    • En cambio, para sostener que “hay que detener X”, también hay que presentar un método realista
      Mi postura es que no se puede detener la IA de código abierto, y que los intentos de frenarla inevitablemente terminan dando más poder a los actores maliciosos que a los bienintencionados
  • El dinero del lobby no presta atención a este tipo de discusiones

    • Al final, el punto clave es que el dinero consigue el resultado que quiere
  • Se siguen encontrando puertas traseras en routers y equipos de red chinos. Dudo que llegue a existir una manera de auditar por completo los modelos chinos

    • ¿Y existe una forma de auditar por completo los modelos estadounidenses? Al menos los modelos chinos publican los pesos, así que por lo menos existe una posibilidad real de auditoría
    • Los modelos chinos entregan los pesos, así que puedes ejecutar tú mismo cualquier revisión que quieras. En cambio, los modelos estadounidenses bloquean el acceso diciendo que son demasiado poderosos para que la gente común como nosotros los use, pero quieren que creamos que todo es por el bien de la ciudadanía
    • Primero hay que dejar claro qué es exactamente lo que se quiere auditar. Una puerta trasera de hardware es fácil de entender porque permite el acceso de personas no autorizadas por el cliente
      Un modelo de pesos abiertos no está atado a una capa de ejecución específica, así que en la práctica el área de seguridad preocupante queda limitada a los propios pesos. Hace falta precisar si se habla de inyección adversaria de instrucciones, inyección de revisionismo histórico y propaganda, u otra vía por la que un modelo no soberano se volvería especialmente más riesgoso que uno soberano
  • Este texto no aborda en absoluto el problema de seguridad. ¿Qué podría impedir que un actor malicioso ajuste finamente pesos abiertos y ejecute una estafa prácticamente totalmente automatizada, de nivel genio, dirigida contra casi cualquier persona?

    • ¿Te refieres a algo como que ChatGPT hackee Hugging Face? Tampoco se puede impedir que un proveedor de pesos cerrados cometa una estafa de nivel genio, y ni siquiera se puede saber qué método y qué modelo usó
      Al final, para frenar el uso malicioso de pesos cerrados, ya sea con ajuste fino o preentrenamiento, el lado bueno también necesita pesos abiertos
    • ¿Qué está impidiendo ahora mismo hacer lo mismo sin LLM, solo un poco más lento?
    • ¿Qué impide cargar miles de litros de gasolina en un camión de alquiler en una gasolinera y lanzarlo contra un hospital? La mayoría de la gente no es terrorista, y no se puede dar por sentado que algo es peligroso solo porque puede formar parte de un plan criminal sofisticado
    • ¿Cómo se vuelve a cerrar una caja de Pandora que ya fue abierta? La seguridad no consiste en permitir el acceso solo a las personas que prefiere el gobierno
      La codicia de los ejecutivos de IA abrió la caja, y ahora están buscando desesperadamente una forma de quedarse con las ganancias sin asumir responsabilidad por las consecuencias
    • Tampoco es una solución confiar en el gobierno y en las grandes tecnológicas. Incluso los pesos abiertos al final se ejecutan en hardware ajeno
      Si tienes el dinero para correrlo en local, puedes hacer cosas mucho peores que una estafa. Pregúntale a cualquier lobista