- A medida que la amplitud de las fuentes de datos se volvió más importante en el entrenamiento de modelos de lenguaje a gran escala, The Pile se publicó como un conjunto de entrenamiento abierto de 825 GiB que agrupa 22 datasets de alta calidad
- Su diseño central consiste en combinar múltiples fuentes como libros, código, páginas web, registros de chat y artículos académicos para aumentar la generalización entre dominios
- Los modelos entrenados con The Pile mostraron mejoras moderadas en benchmarks existentes de modelado de lenguaje, y mejoras significativas en Pile BPB
- Como Pile BPB maneja conjuntamente texto de múltiples dominios, se usa para comprobar una capacidad de modelado de texto más amplia que el rendimiento sobre un solo corpus
- El leaderboard marca con
*la posible duplicación con el conjunto de prueba, y Zero-shot significa que no todos los componentes de The Pile estuvieron incluidos en los datos de entrenamiento
Composición y distribución de The Pile
- The Pile es un dataset diverso y open source de modelado de lenguaje de 825 GiB
- Está construido combinando 22 datasets más pequeños y de alta calidad en uno solo
- Los archivos de descarga están alojados en the Eye
- Si usas The Pile o tienes un modelo evaluado con The Pile, puedes avisar a EleutherAI
- Si usas The Pile o alguno de sus componentes, debes citar el siguiente artículo
-
The Pile: An 800GB Dataset of Diverse Text for Language Modeling
- preprint de arXiv arXiv:2101.00027, 2020
-
Rol como conjunto de entrenamiento y benchmark
- Especialmente en los modelos de gran escala, la diversidad de las fuentes de datos mejora el conocimiento general entre dominios y la capacidad de generalización downstream
- En la evaluación, los modelos entrenados con The Pile mostraron mejoras moderadas en benchmarks tradicionales de modelado de lenguaje y registraron mejoras significativas en Pile BPB
- Pile BPB (bits per byte) es un benchmark que requiere comprender texto de múltiples dominios
- Entre los dominios objetivo se incluyen libros, repositorios de GitHub, páginas web y registros de chat
- También incluye artículos de medicina, física, matemáticas, ciencias de la computación y filosofía
- Este benchmark exige tanto conocimiento del mundo específico por dominio como capacidad de razonamiento, por lo que se utiliza para evaluar la capacidad de modelado de texto entre dominios de los modelos de lenguaje a gran escala
- El ejemplo del leaderboard incluye entradas al 1 de enero de 2021
- GPT-3 (Zero-Shot)*, OpenAI: Test BPB 0.7177
- GPT-2 (Zero-Shot)*, OpenAI: Test BPB 1.2253
*indica una posible duplicación potencial con el conjunto de prueba- Zero-shot significa que no todos los componentes de The Pile estuvieron incluidos en los datos de entrenamiento
1 comentarios
Comentarios de Hacker News
En 2020, cuando expresé preocupación porque Books3 estaba incluido en The Pile, Stella Biderman, que entonces era responsable de Eleuther, respondió así:
Dijo que en los datos existen 1) materiales fuente originales que existen en el mundo y fueron subidos en línea, 2) datos por conjunto depurados y procesados a partir de esos materiales para modelado de lenguaje, y 3) The Pile, que combina a gran escala los datos por conjunto, incluso con ponderaciones
Explicó que Eleuther creó y publicó 2 y 3, que 2 se dejó para que la gente pudiera reponderar y recombinar, y que la mayoría simplemente descargaría 3 tal cual
También sostuvo que, aunque 2 y 3 contengan datos con copyright, bajo el estándar de EE. UU. eso sería uso justo y no infracción de copyright; que descargar Maroon 5 desde un sitio web y crear un dataset correspondiente a 2 podría ser infracción según el caso, pero que su uso no lo era
El uso justo no se establece porque uno lo declare por su cuenta; se parece a Michael Scott de The Office gritando “¡declaro bancarrota!”
Los tribunales lo evalúan considerando 1) el propósito y carácter del uso, 2) la naturaleza de la obra, 3) la cantidad usada y qué tan sustancial es, y 4) el efecto sobre el mercado potencial o el valor; justamente por eso OpenAI está litigando con New York Times
Un buen resumen está en https://copyright.columbia.edu/basics/fair-use.html
Salvo que “procesado para modelado de lenguaje” signifique un proceso completamente irreversible
Este tipo de datasets parece reprobar la mayoría de los cuatro factores del análisis de copyright, y hasta personas no expertas a las que les expliqué los LLM entendieron que las empresas de IA están robando el trabajo de otros
Hay un texto que resume los temas legales relacionados, cada dataset incluyendo The Pile, alternativas legales y una propuesta equilibrada de reforma de copyright: http://gethisword.com/tech/exploringai/
Por ahora, al menos en un país, harían falta de inmediato tres reglas: las obras a las que se tiene acceso legal deberían poder usarse para entrenamiento de IA; las restricciones al entrenamiento, los cobros adicionales y las restricciones de descarga deberían ser ilegales; debería permitirse copiar y transformar obras accesibles para entrenamiento con fines de uso personal; y las obras web publicadas gratuitamente deberían poder copiarse, compartirse, procesarse y agruparse para entrenamiento de IA sin importar las condiciones
El copyright de las salidas de IA debería regirse por la doctrina existente sobre IA y obras mixtas, y si la salida es objeto de copyright, el usuario debería quedar en la misma posición que si hubiera publicado directamente basándose en una obra preexistente; además, los conjuntos de entrenamiento también deberían publicarse para poder determinarlo
Soy escéptico. Compartir por torrent una película que bajaste de algún lugar de internet no es “uso justo”, y The Pile no es solo código que transforma datos, sino los propios datos redistribuidos
Con esa lógica, significaría que se puede operar legalmente un mirror de Libgen
¿Dónde se puede verificar la reproducción de licencias y la atribución de créditos/autores del contenido distribuido en este dataset?
¿Está todo incluido? ¿Se puede saber si todos los elementos incluidos cumplen?
Estoy abierto a discutir si un generador hecho con un modelo entrenado con datos con copyright puede evitar obligaciones de copyright en sus salidas, pero el dataset en sí obviamente no queda atado al copyright del contenido que contiene, ¿o sí?
Si llenas una pared con nombres de autores o editoriales famosas y lanzas un dardo, es muy probable que le des a alguien que tenga derechos sobre parte de estos datos
Parece que si dices “para investigación de IA”, entonces todo vale. Como si con solo tener un dominio .ai ya estuviera bien subir rips de Blu-ray
No puedo creer que la gente comparta y vuelva a publicar obras con copyright en internet. Qué sorpresa
En fin, ¿RedPajama 30T y The Pile son “all you need”? ;)
Para obtener resultados interesantes, hace falta generar a partir de esto datasets de instrucciones, y tienen que cubrir tareas variadas
No es la oración completada en sí lo que hace que un LLM muestre conocimiento y razonamiento, sino datasets de instrucciones grandes y diversos
¿Books3, que aparece en el paper de The Pile, es efectivamente ese dataset por el que los autores están en juicio? ¿Ese que contiene en masa material popular y con copyright?
Se indica que Bibliotik mezcla ficción y no ficción, que es casi un orden de magnitud más grande que BookCorpus2, el siguiente dataset de libros más grande, y que se incluyó porque los libros son valiosos para la investigación de modelado de contexto largo y narración consistente
https://originality.ai/blog/openai-chatgpt-lawsuit-list
Mucha atención se ha centrado en Books3, pero otro gran componente de este dataset es OpenWebText2, cuyo nombre resulta engañoso
Esto se armó raspando 15 años de sitios web de terceros enlazados desde publicaciones de Reddit con muchas recomendaciones, y parte de mis textos está ahí
Es como transmitirlo por radio o repartir impresos en la puerta de millones de personas al azar
Hay formas de establecer la propiedad intelectual y proteger datos con copyright, pero fanfics de Tumblr, comentarios de YouTube y discusiones de HN no son una vía formal para asegurar copyright
Lo publicado en sitios web que se pueden raspar legalmente puede quedar cubierto por uso justo
Los datos recopilados de sitios web públicos se pueden usar en privado para lo que uno quiera, e incluso se podría crear un gran HN LLM con un dataset raspado y usarlo de forma privada
Considerando la jurisprudencia reciente, mientras se hagan esfuerzos de buena fe para respetar el copyright y evitar la reproducción del texto original, incluso un modelo entrenado con todas las obras del mundo podría quizá ofrecerse por API y usarse comercialmente
Pero vender o distribuir el modelo en sí ya entra en otro terreno legal
Internet fue diseñado originalmente para funcionar así, y si alguien quiere impedir el acceso debería implementar autenticación, configuración de red o controles de acceso
Si lo publicaste en un sitio abierto sin esas medidas, hay que entender que renuncias en gran parte a reclamar una amplia protección basada en uso justo, y que al poner un servidor y un dominio implícitamente invitaste al mundo entero a descargarlo
Lo que se considera un mal uso en OpenWebText2, en el fondo, también proviene de haberlo publicado en un sitio web abierto y luego perder el control sobre su uso posterior; fue raspado de manera legítima
Apuesto a que ningún modelo podrá generar ni una sola oración de tus textos
¿Todavía se puede descargar desde algún lado? Intenté bajarlo hace unos meses, pero el enlace de descarga daba 404, y parece que sigue igual
Si no conoces a alguien que ya lo tenga, puedes buscar trackers públicos
Pero debes saber que, como incluye contenido con copyright, distribuirlo equivale a piratería
magnet:?xt=urn:btih:0d366035664fdf51cfbe9f733953ba325776e667&dn=EleutherAI_ThePile_v1
https://huggingface.co/datasets/bigcode/the-stack-v2
— https://the-eye.eu/public/AI/pile/readme.txt
Por ejemplo, procesar fuertemente Common Crawl y mezclarlo; dolma o the-stack-v2 para modelos de código, que otros mencionaron, son ejemplos de eso
El nombre está bueno. Me recuerda al “Pile” original del Proyecto Manhattan
Lo leí en “The Making of the Atomic Bomb” (1986), y supongo que también habrá salido en la película reciente
La película me dio la impresión de hilar anécdotas para construir al final un mensaje algo tosco
Como historia de ficción más que como recreación fiel, me pareció una película aceptable, pero creo que es mejor leer el libro
En especial si te interesa Fermi, recomiendo “The Last Man Who Knew Everything” de David Schwartz
The Pile es bastante antiguo, ¿esta es una versión actualizada?
En relación con eso, hace poco se publicó la versión 2 del dataset the-stack
Recorrieron el dataset de grafos de Software Heritage del 2023-09-06 y recopilaron 3.28 mil millones de archivos únicos pertenecientes a 104.2 millones de repositorios de GitHub, y además reunieron metadatos a nivel de repositorio del GitHub Archive hasta el 2023-09-14
El tamaño total sin comprimir es de 67.53TB, y en el pipeline de preprocesamiento implementaron deduplicación aproximada además de deduplicación exacta
Después de la deduplicación, por tamaño y cantidad de tokens, la v1 queda en 2.9TB·200B y la v2 en 32.1TB·900B
Parece que pronto saldrán modelos de código públicos bastante potentes, y los modelos que quiero probar son dolphincoder-starcoder2-15b-iMat.GGUF, CodeFuse-DeepSeek-33B-iMat.GGUF, OpenCodeInterpreter-DS-33B-iMat.GGUF y starcoder2-15b-instruct-iMat.GGUF
Dataset: https://huggingface.co/datasets/bigcode/the-stack-v2
Cuantizaciones GGUF: https://huggingface.co/dranger003
Los grandes estudios de Hollywood les pagan mucho dinero a varias empresas de ciberseguridad para encontrar contenido pirateado y enviar avisos de cese por infracción de derechos de autor a las empresas de hosting
Si autores y artistas se organizaran en formas como agrupaciones de datos, podrían hacer lo mismo que los estudios
Si la ley de derechos de autor realmente tiene fuerza efectiva, una organización así podría enviar solicitudes legales a donde se hospeda ese contenido para exigir que lo bajen