IA forma sesgos más fuertes que humanos al contratar

⏱ Tiempo de lectura: 4 min
Los modelos de lenguaje desarrollan prejuicios propios durante procesos de contratación, según un estudio de investigadores de la Universidad de Princeton y la Universidad de Chicago. Las pruebas con ChatGPT, Claude y Gemini muestran que estos sistemas estereotipan candidatos más que los humanos, incluso cuando todos tienen igual desempeño.
Cómo la IA aprende sesgos de su propia experiencia
Un equipo de investigadores simuló un proceso de contratación donde modelos de lenguaje debían seleccionar candidatos para 20 puestos diferentes: doctores, abogados, cuidadores de niños y conserjes. Los candidatos provenían de cuatro grupos étnicos ficticios: Tufa, Aima, Reku y Weki. Tras cada contratación, los modelos recibían retroalimentación sobre si el candidato tuvo éxito. Lo crucial: todos los candidatos tenían probabilidades idénticas de triunfar en cualquier rol. Los modelos comenzaron a segregar candidatos en trabajos específicos según observaciones iniciales. Por ejemplo, si un candidato Aima fracasaba como doctor, el modelo dejaba de contratar Aimas para esa posición y los canalizaba hacia puestos de conserje. Los resultados del estudio fueron publicados en la conferencia ICML en Seúl en julio de 2026.
Magnitud de los sesgos en números
En una escala de segregación donde 2 representa confinamiento total de cada grupo a su propio nicho laboral, los participantes humanos en el estudio original puntuaron 0,84. Los modelos de lenguaje puntuaron aproximadamente 65% más alto: OpenAI o3 alcanzó 1,83, cercano al máximo posible. Modelos más nuevos con capacidades de razonamiento superior, como o3 y DeepSeek R1, mostraron sesgos aún más fuertes. Ryan Liu, estudiante de doctorado en Princeton y coautor del estudio, explica que los LLMs "realmente están ávidos de crear generalizaciones a partir de datos limitados" porque ese es su propósito fundamental de entrenamiento en matemática, código y ciencia. La investigación completa está disponible en MIT Technology Review.
Qué falta por confirmar
El estudio plantea una pregunta abierta: ¿qué tanto estereotiparán estos sesgos en procesos reales de contratación? En el experimento, los modelos recibieron retroalimentación inmediata. En el mundo real, las empresas tardan meses en evaluar si una contratación fue exitosa. Sin embargo, cuando esa retroalimentación llega, los modelos podrían sobre-interpretar los resultados y amplificar sesgos en futuras selecciones. Los sistemas modernos con memoria mejorada y personalización representan un riesgo particular: al recuperar historial de conversaciones previas, pueden reforzar patrones de sesgo aprendidos.
| Aspecto | Dato |
|---|---|
| Modelos probados | ChatGPT, Claude, Gemini, OpenAI o3, DeepSeek R1 |
| Institución | Universidad de Princeton y Universidad de Chicago |
| Escala segregación (humanos) | 0,84 en escala donde 2 es máximo |
| Escala segregación (modelos) | Aproximadamente 65% más alta; o3 alcanzó 1,83 |
| Publicación | Conferencia ICML, Seúl, julio 2026 |
| Causa identificada | Tendencia de LLMs a generalizar rápidamente desde datos limitados |
| Mitigación: bonus diversidad | Prometer bonificación por contratación diversa redujo sesgos significativamente |
| Información personal relevante | Edad y educación redujeron segregación; datos irrelevantes (color de cabello, tatuajes) no ayudaron |
Preguntas frecuentes sobre sesgos de IA en contratación
¿Quién realizó este estudio?
Investigadores de la Universidad de Princeton y la Universidad de Chicago colaboraron en este análisis. El paper fue presentado en la conferencia ICML de 2026 en Seúl.
¿Por qué los modelos desarrollan estos sesgos si todos los candidatos tienen igual desempeño?
Los modelos de lenguaje optimizados para generalizar rápidamente desde pocos ejemplos tienden a asumir patrones donde no los hay. Una mala experiencia inicial —como un candidato de un grupo específico fracasando en un rol— genera generalizaciones amplias. Esto ocurre incluso sin retroalimentación real que lo justifique.
¿Se puede reducir este sesgo?
Sí, parcialmente. El estudio encontró que establecer objetivos explícitos de diversidad en las contrataciones redujo significativamente los sesgos. También ayudó proporcionar información personal relevante sobre candidatos (edad, educación) en lugar de detalles irrelevantes.
Qué conviene mirar de cerca
Las empresas ya despliegan modelos de lenguaje para filtrar currículos e incluso conducir entrevistas. Este hallazgo sugiere que los sesgos de IA en contratación podrían incluir patrones nunca enseñados explícitamente: sesgos "noveles" que emergen de la experiencia del modelo. Angelina Wang, científica informática de la Universidad de Cornell, advierte que las características mejoradas de memoria y personalización en chatbots modernos amplían este riesgo.
En Inteligencia Artificial creemos que este estudio es crítico para cualquier empresa considerando automatizar decisiones de contratación. Los sesgos desarrollados por IA no son fáciles de detectar ni corregir con indicaciones simples. ¿Estamos listos para auditar y controlar el sesgo de sistemas que deciden sobre empleabilidad?
Fuente: www.technologyreview.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.