3 min de lectura

Por qué los artículos científicos pueden envenenar el entrenamiento de los LLM

Un ensayo de Reinvent Science sostiene que los artículos científicos pueden degradar los LLM y ocultar las señales reputacionales que usan los humanos para juzgar la investigación.

Imagen: Hacker News

Los artículos científicos pueden estar entre las peores fuentes de entrenamiento para modelos de lenguaje útiles, según un nuevo ensayo de Reinvent Science. El problema no es simplemente que parte de la investigación sea errónea: la literatura mezcla trabajo honesto y deshonesto con afirmaciones correctas e incorrectas, a menudo en el mismo artículo.

Ilustración de la literatura científica
Ilustración de la literatura científica

Un científico honesto puede verse obligado a presentar un trabajo experimental solvente con un lenguaje exagerado y explicarlo usando una teoría incorrecta pero de moda para competir por su publicación. Al mismo tiempo, un investigador menos escrupuloso puede falsificar datos convenientes. El corpus resultante contiene medias verdades, omisiones y mentiras que pueden ser difíciles de distinguir de hallazgos fiables. Los metadatos científicos ofrecen poca protección: una vez que la autoría y el recuento de citas se convirtieron en métricas de evaluación, argumenta el ensayo, esas señales fueron ampliamente manipuladas. La mala conducta no se limita a investigadores oscuros, instituciones de bajo perfil o campos concretos.

Lo que encontró el estudio sobre datos de entrenamiento de 2024

El argumento tiene cierto apoyo empírico. En 2024, investigadores del MIT, Cornell, Carnegie Mellon, Google y OpenAI probaron qué ocurría al eliminar diferentes corpus de texto de los datos de entrenamiento de un LLM, manteniendo constante su arquitectura.

Eliminar ArXiv, PhilPapers y NIH ExPorter mejoró el rendimiento del modelo en preguntas académicas y su puntuación media en todos los benchmarks. También hizo que el modelo fuera menos propenso a generar contenido tóxico. Sin embargo, eliminar PubMed redujo el rendimiento en cierto grado, por lo que el estudio no establece que la literatura científica sea dañina de manera uniforme.

El ensayo describe la mejora derivada de eliminar grandes colecciones de artículos científicos como "bastante sugestiva", al tiempo que reconoce que no está claro si el resultado se mantiene en 2026. Sus autores dicen que apostarían a que sí. El artículo citado es Shayne Longpre, Gregory Yauney, Emily Reif, Katherine Lee, Adam Roberts, Barret Zoph, Denny Zhou, Jason Wei, Kevin Robinson, David Mimno y Daphne Ippolito, "A Pretrainer’s Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity", publicado en los Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics.

Recomendado

Los bosques sintéticos reducen drásticamente las etiquetas para drones que cuentan árboles

La capa que falta es la reputación

Los científicos humanos compensan las publicaciones poco fiables mediante redes informales, juicios personales sobre qué investigadores y resultados son de confianza, visitas y replicaciones. Los agentes de IA no participan en esas relaciones sociales, por lo que no pueden acceder directamente a esa información reputacional a menos que los humanos la proporcionen.

El ensayo presenta varias posibles respuestas para proyectos de IA para la ciencia:

  • Desarrollar agentes con los que los científicos humanos socialicen.
  • Grabar con frecuencia a los científicos humanos en entornos privados.
  • Crear incentivos para que los científicos proporcionen un flujo continuo de información reputacional informal.

Se sugiere que asistentes diseñados para apoyar más trabajo científico en entornos informales podrían ayudar a impulsar el proceso, aunque se reconoce que ese modelo equivaldría a vigilancia. La fuente no ofrece un plan de despliegue, una estimación de costes ni pruebas de que alguna de estas iniciativas se esté persiguiendo actualmente.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Hacker News

/ Sigue leyendo