3 min de lectura

Estudio encuentra que los LLM inventan estereotipos de contratación rápidamente

Los investigadores dicen que los grandes modelos de lenguaje pueden formar nuevos sesgos de contratación incluso con grupos étnicos ficticios y resultados de candidatos iguales.

Imagen: Gizmodo

Los grandes modelos de lenguaje pueden inventar nuevos estereotipos sociales durante tareas de contratación, incluso cuando no hay diferencias reales entre los grupos, según un nuevo estudio de investigadores de la Universidad de Princeton y la Universidad de Chicago.

El equipo hizo que un conjunto de LLM completara un juego de contratación usado previamente con participantes humanos. En el experimento, a los candidatos se les asignaban trabajos y los participantes recibían retroalimentación sobre si la contratación tuvo éxito. Cada candidato tenía la misma probabilidad de éxito, pero cada uno pertenecía a uno de cuatro grupos étnicos ficticios: Tufa, Aima, Reku o Weki.

Los participantes humanos en la versión anterior de la tarea desarrollaron sesgos basados en la retroalimentación. Si alguien contrataba a un Tufa como médico y recibía retroalimentación negativa, por ejemplo, era menos probable que contratara a otro Tufa para ese puesto, y esos sesgos persistían incluso después de que el juego terminaba. Pero los investigadores hallaron que los LLM mostraron tasas de sesgo mucho más altas.

“Los LLM pueden desarrollar de forma espontánea nuevos sesgos sociales sobre grupos demográficos artificiales incluso cuando no existen diferencias inherentes.” “Estos resultados muestran que los LLM no son meros espejos pasivos de los sesgos sociales humanos, sino que pueden crear activamente nuevos sesgos a partir de la experiencia, lo que plantea preguntas urgentes sobre cómo estos sistemas seguirán moldeando a las sociedades con el tiempo.”

Autores del estudio

Los investigadores atribuyen este comportamiento al dilema exploración-explotación: si probar algo nuevo para aprender más, o ceñirse a una opción que previamente pareció funcionar. En situaciones de alto riesgo, las personas a menudo optan por lo que parece más seguro. El estudio sostiene que los sistemas de IA son aún menos propensos a explorar y, en cambio, optimizan para la recompensa, lo que puede convertir los resultados iniciales en estereotipos.

Recomendado

Corea del Sur lanzará en 2026 un chatbot de IA nacional gratuito

El equipo evaluó 15 modelos de OpenAI, Anthropic, DeepSeek, Meta, Google y Alibaba. Entre ellos, el modelo de razonamiento o3 de OpenAI mostró la estratificación más severa de los solicitantes ficticios. Los investigadores también hallaron que, dentro de una familia de modelos, los modelos más nuevos, más grandes y con mayores capacidades de razonamiento producían resultados más sesgados.

“Una razón sencilla es que los modelos mejores extraen inferencias más precisas sobre resultados pasados: en lugar de elegir al azar, un LLM más potente puede favorecer a candidatos de un grupo si asignaciones anteriores de trabajos similares tuvieron éxito.” “Sin embargo, esta tendencia aparentemente racional puede ser desadaptativa, ya que corre el riesgo de reducir la exploración y marginar inadvertidamente a grupos sociales.”

Autores del estudio

Los hallazgos llegan en un momento en que más del 90 % de las empresas utilizan IA en la adquisición de talento, según una encuesta reciente de ManPower Group. Las consecuencias legales y laborales ya se están acumulando. Workday enfrenta una demanda colectiva que alega que sus herramientas de contratación impulsadas por IA son discriminatorias. En Meta, un grupo de empleados demandó a la empresa, afirmando que las decisiones de despido se basaron en un sistema de IA sesgado contra trabajadores con discapacidades o que tomaron licencias médicas o familiares protegidas.

Los investigadores dicen que el riesgo se extiende mucho más allá de la contratación, señalando resultados sesgados en áreas como la atención sanitaria y la evaluación de inquilinos. Su conclusión es contundente: la misma búsqueda de patrones y capacidad de generalización que hacen útiles a los LLM también puede volverlos peligrosos cuando se despliegan en decisiones del mundo real.

“El desafío por delante es diseñar intervenciones que disuadan selectivamente el emparejamiento de patrones dañinos mientras se preservan las formas constructivas de abstracción que hacen poderosos a los LLM.” “Encontrar este equilibrio puede estar lejos de ser sencillo, pero allanará el camino hacia sistemas de IA equitativos y socialmente beneficiosos.”

Autores del estudio
Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Gizmodo

// Sigue leyendo