3 min de lectura

Los LLMs inventan sesgos en la contratación, según un estudio

Un estudio encuentra que los LLMs pueden inventar sesgos de contratación contra grupos ficticios, y que los modelos más potentes generan estereotipos más severos.

Imagen: Gizmodo

Según un estudio de investigadores de Princeton University y University of Chicago, los modelos de IA pueden desarrollar estereotipos discriminatorios de contratación incluso cuando los grupos que evalúan no presentan diferencias reales.

Los investigadores pidieron a modelos de lenguaje grandes (LLMs) que jugaran a un juego de contratación previamente probado con participantes humanos. Los modelos asignaban candidatos a puestos y recibían retroalimentación sobre si cada contratación tenía éxito. Cada candidato tenía la misma probabilidad de éxito, pero pertenecía a uno de cuatro grupos étnicos ficticios: Tufa, Aima, Reku o Weki.

Los participantes humanos empezaron a evitar un grupo para un puesto concreto después de recibir retroalimentación negativa —por ejemplo, eran menos propensos a contratar a una Tufa como médico tras una contratación fallida. Esos sesgos persistieron después de que terminara el juego. Los LLMs desarrollaron patrones similares, pero a tasas mucho más altas.

Recomendado

Roscosmos prueba IA para los informes de la tripulación en la EEI

“Los LLMs pueden desarrollar espontáneamente nuevos sesgos sociales sobre grupos demográficos artificiales incluso cuando no existen diferencias inherentes.”

Investigadores de Princeton University y University of Chicago

Por qué los modelos formaron estereotipos

El estudio vincula ese comportamiento con el dilema explorar-explotar: si probar una opción desconocida para obtener información o confiar en una opción que ha funcionado antes. Cuando las apuestas parecen altas, las personas a menudo explotan las opciones conocidas en lugar de explorar nuevas.

Los investigadores afirman que los LLMs están aún menos inclinados a explorar y, en cambio, tienden a maximizar las recompensas. Eso puede llevarlos a sobregeneralizar a partir de resultados limitados, convirtiendo decisiones aparentemente racionales en patrones que marginan a grupos.

El equipo probó 15 modelos de OpenAI, Anthropic, DeepSeek, Meta, Google y Alibaba. El modelo de razonamiento o3 de OpenAI estratificó a los solicitantes ficticios de forma más severa. Dentro de cada familia de modelos, los sistemas más nuevos y grandes con capacidades de razonamiento más fuertes produjeron resultados más sesgados.

“Una razón sencilla es que los modelos mejores sacan inferencias más precisas sobre resultados pasados: en lugar de elegir al azar, un LLM más potente puede favorecer a candidatos de un grupo si asignaciones anteriores a trabajos similares tuvieron éxito.”

Investigadores de Princeton University y University of Chicago

Los sistemas de contratación impulsados por IA enfrentan mayor escrutinio

Más del 90% de las empresas usan IA en la adquisición de talento, según una encuesta reciente de ManPower Group. Los hallazgos llegan mientras los candidatos informan que los sistemas automatizados de reclutamiento les han costado oportunidades.

Workday enfrenta una demanda colectiva que alega que las herramientas de contratación impulsadas por IA que suministra a sus clientes son discriminatorias. En Meta, empleados han demandado alegando que un sistema de IA utilizado en decisiones de despido estaba sesgado contra personas con discapacidades y empleados que tomaron licencias médicas o familiares protegidas.

Los investigadores dicen que los mismos riesgos se extienden más allá del empleo, incluyendo la atención sanitaria y los sistemas de evaluación de inquilinos usados en decisiones de vivienda. La capacidad de los LLMs para identificar patrones y generalizar les ayuda a aprender tareas sin bases de datos masivas, pero esas mismas capacidades pueden producir resultados perjudiciales.

“El reto por delante es diseñar intervenciones que desincentiven selectivamente el emparejamiento de patrones dañino al tiempo que preservan las formas constructivas de abstracción que hacen a los LLMs poderosos.”

Investigadores de Princeton University y University of Chicago
Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Gizmodo

/ Sigue leyendo