• 3 min de lectura
Por qué los artículos científicos pueden envenenar el entrenamiento de los LLM
Un ensayo de Reinvent Science sostiene que los artículos científicos pueden degradar los LLM y ocultar las señales reputacionales que usan los humanos para juzgar la investigación.

Imagen: Hacker News
Los artículos científicos pueden estar entre las peores fuentes de entrenamiento para modelos de lenguaje útiles, según un nuevo ensayo de Reinvent Science. El problema no es simplemente que parte de la investigación sea errónea: la literatura mezcla trabajo honesto y deshonesto con afirmaciones correctas e incorrectas, a menudo en el mismo artículo.
Un científico honesto puede verse obligado a presentar un trabajo experimental solvente con un lenguaje exagerado y explicarlo usando una teoría incorrecta pero de moda para competir por su publicación. Al mismo tiempo, un investigador menos escrupuloso puede falsificar datos convenientes. El corpus resultante contiene medias verdades, omisiones y mentiras que pueden ser difíciles de distinguir de hallazgos fiables. Los metadatos científicos ofrecen poca protección: una vez que la autoría y el recuento de citas se convirtieron en métricas de evaluación, argumenta el ensayo, esas señales fueron ampliamente manipuladas. La mala conducta no se limita a investigadores oscuros, instituciones de bajo perfil o campos concretos.
Lo que encontró el estudio sobre datos de entrenamiento de 2024
El argumento tiene cierto apoyo empírico. En 2024, investigadores del MIT, Cornell, Carnegie Mellon, Google y OpenAI probaron qué ocurría al eliminar diferentes corpus de texto de los datos de entrenamiento de un LLM, manteniendo constante su arquitectura.
Eliminar ArXiv, PhilPapers y NIH ExPorter mejoró el rendimiento del modelo en preguntas académicas y su puntuación media en todos los benchmarks. También hizo que el modelo fuera menos propenso a generar contenido tóxico. Sin embargo, eliminar PubMed redujo el rendimiento en cierto grado, por lo que el estudio no establece que la literatura científica sea dañina de manera uniforme.
El ensayo describe la mejora derivada de eliminar grandes colecciones de artículos científicos como "bastante sugestiva", al tiempo que reconoce que no está claro si el resultado se mantiene en 2026. Sus autores dicen que apostarían a que sí. El artículo citado es Shayne Longpre, Gregory Yauney, Emily Reif, Katherine Lee, Adam Roberts, Barret Zoph, Denny Zhou, Jason Wei, Kevin Robinson, David Mimno y Daphne Ippolito, "A Pretrainer’s Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity", publicado en los Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics.

Recomendado
Los bosques sintéticos reducen drásticamente las etiquetas para drones que cuentan árboles
La capa que falta es la reputación
Los científicos humanos compensan las publicaciones poco fiables mediante redes informales, juicios personales sobre qué investigadores y resultados son de confianza, visitas y replicaciones. Los agentes de IA no participan en esas relaciones sociales, por lo que no pueden acceder directamente a esa información reputacional a menos que los humanos la proporcionen.
El ensayo presenta varias posibles respuestas para proyectos de IA para la ciencia:
- Desarrollar agentes con los que los científicos humanos socialicen.
- Grabar con frecuencia a los científicos humanos en entornos privados.
- Crear incentivos para que los científicos proporcionen un flujo continuo de información reputacional informal.
Se sugiere que asistentes diseñados para apoyar más trabajo científico en entornos informales podrían ayudar a impulsar el proceso, aunque se reconoce que ese modelo equivaldría a vigilancia. La fuente no ofrece un plan de despliegue, una estimación de costes ni pruebas de que alguna de estas iniciativas se esté persiguiendo actualmente.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía Hacker News


