• 3 min de lectura
Se están destruyendo libros raros para entrenar IA
Se informa que laboratorios de IA están destruyendo libros raros durante escaneos de alta velocidad, lo que suscita preocupaciones sobre la pérdida cultural irreversible y la preservación.

Imagen: TechRadar
Se informa que empresas de IA están comprando y destruyendo libros impresos raros para crear conjuntos de datos de entrenamiento, y que ISBNdb envía hasta un millón de libros de forma anónima a laboratorios de IA. La práctica implica quitar los lomos de los libros, separar las páginas y pasarlas por escáneres de alta velocidad que pueden hacer la digitalización más rápida y barata, pero dejan el volumen original inservible.
Por qué se buscan libros anteriores a 2022 para el entrenamiento
Informes de 404 Media encontraron que ISBNdb suministra libros físicos a desarrolladores de IA que buscan material escrito por humanos no afectado por los contenidos generados por chatbots modernos. La compañía sostiene que los libros publicados antes de 2022 proporcionan datos más limpios porque preceden al uso generalizado de texto generado por IA.
Estas obras se describen como “densos, editados y autoritativos”, en contraste con el material en línea que contiene cada vez más contenidos generados por máquinas y de calidad incierta. Usar libros más antiguos también puede ayudar a las empresas a evitar el colapso del modelo, una caída de calidad que puede ocurrir cuando los modelos se entrenan repetidamente con texto sintético producido por modelos anteriores.
ISBNdb también afirma que las obras impresas más antiguas tienen menos probabilidades de contener técnicas deliberadas de envenenamiento de datos, en las que los autores modifican documentos para interferir con el entrenamiento de la IA. Según se informa, la empresa suministra libros bajo estrictos acuerdos de confidencialidad, manteniendo en secreto la identidad de sus clientes comerciales.
Libros raros y el problema de la preservación
Librosellers entrevistados por 404 Media dijeron que algunos volúmenes que ingresan a los programas de escaneo solo cuentan con unas pocas copias supervivientes tras guerras, incendios y siglos de manipulación. A diferencia de sitios web ampliamente disponibles o publicaciones modernas, estas obras históricas pueden ser imposibles de reproducir una vez que se destruyen sus ejemplares físicos.

Recomendado
Amazon completa anticipadamente acuerdo de 50.000 millones de dólares con OpenAI
Se informa que ISBNdb reconoce el riesgo reputacional del proceso. Su sitio web afirma:
«“Una empresa de IA destruye dos millones de libros” no es un titular que genere simpatía.»
Una reciente resolución judicial de Estados Unidos relacionada con Anthropic determinó que escanear libros comprados legalmente para el entrenamiento de IA constituía uso legítimo en circunstancias específicas. Parte del razonamiento fue que destruir cada copia impresa durante el escaneo significaba que una copia legal reemplazaba efectivamente a otra, en lugar de crear múltiples copias.
En respuesta a un crítico identificado como @Hedgie en X, Elon Musk dijo:
«He pedido al equipo de SpaceXAI que preserve cualquier libro raro en una biblioteca y los escanee a la manera difícil.»
La fuente no identifica qué empresas de IA están recibiendo los libros ni cuántas obras raras se han destruido ya. Informa que el método de ISBNdb puede implicar envíos anónimos al por mayor y que el propio ejemplo de la compañía se refiere a «dos millones de libros», pero no establece que realmente se hayan destruido dos millones de libros.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía TechRadar


