Pruebas de IA: dónde fallan los modelos de lenguaje

⏱ Tiempo de lectura: 4 min
Los modelos de lenguaje grandes avanzan rápidamente en capacidades de razonamiento, pero siguen enfrentando limitaciones claras en tareas específicas. Según investigadores de Columbia University y otros centros, incluso los mejores modelos actuales fracasan en pruebas que miden razonamiento espacial, adaptabilidad y comprensión visual. Este análisis explora dónde los sistemas de IA todavía no alcanzan el desempeño humano.
Las limitaciones medidas en puzzles y juegos lógicos
Los puzzles y juegos han sido herramientas centrales para evaluar el progreso de la IA desde sus inicios. En finales de 2024, investigadores demostraron que los mejores modelos resolvían solo el 18% de los Connections del New York Times; en principios de 2025, algunos modelos lograban resolverlos casi perfectamente. Sin embargo, esta mejora no es uniforme en todos los tipos de problemas. Las limitaciones persisten en razonamiento espacial, visual y en tareas que requieren adaptabilidad cognitiva. La investigación en IA utiliza estos desafíos para entender mejor las brechas entre cognición humana y artificial.
Dónde fallan los modelos actuales
El razonamiento espacial representa una debilidad crítica. Los modelos de lenguaje típicamente pueden analizar entrada visual, pero fracasan en rotación mental: la capacidad de visualizar objetos en 3D desde ángulos diferentes. Los arquitectos e ingenieros mecánicos resuelven estos problemas naturalmente; los modelos aún no. La memoria también es un arma de doble filo. Los LLM recordaban millones de hechos de entrenamiento, pero cuando un puzzle se parece mucho a uno que vieron antes, memorizan la respuesta anterior en lugar de resolver el nuevo variante. Investigadores de Google y la Universidad de Illinois demostraron esto con puzzles de Caballeros y Bribones: cambios sutiles en la estructura confunden a modelos que confían en memorización. Los puzzles visuales abstractos, como los del benchmark ARC-AGI, también desafían a los sistemas. Los modelos funcionan mejor cuando reciben datos en forma de números en lugar de imágenes, sugiriendo que la comprensión visual verdadera sigue siendo limitada. Cuando los modelos resuelven ARC correctamente, a menudo usan reglas complejas y no generalizables, mientras que los humanos aplican conceptos visuales simples. El alcance de esta investigación es accesible en www.technologyreview.com.
La escala revela otra limitación
Algunos fallos dependen directamente de la complejidad. Investigadores de Apple encontraron que los modelos resuelven versiones simples de la Torre de Hanoi, pero fracasan cuando el número de discos alcanza seis o más. El mismo patrón aparece en puzzles de cruce de ríos y cuadrículas lógicas. El aumento de variables o pasos requeridos desborda las capacidades actuales, indicando que aunque la IA maneja bien problemas pequeños y definidos, la escalabilidad en razonamiento secuencial sigue siendo un desafío pendiente.
| Tipo de Prueba | Desempeño Reportado |
|---|---|
| Connections (New York Times) | 18% en finales 2024; casi perfecto en principios 2025 |
| Razonamiento espacial (rotación mental) | Fracaso consistente; debilidad crítica |
| Caballeros y Bribones (puzzles lógicos) | Confundidos por variantes sutiles; memorización deficiente |
| ARC-AGI (razonamiento abstracto visual) | Mejora reciente; usa reglas no generalizables |
| Torre de Hanoi (escala) | Resuelve hasta 5 discos; fracasa en 6+ |
| Comprensión visual | Mejor con entrada numérica que con imágenes |
Preguntas frecuentes sobre limitaciones de IA
¿Los modelos de lenguaje son realmente inteligentes si fallan en estos puzzles?
Sí, pero de formas distintas a los humanos. Los modelos excelen en recuperación de información y reconocimiento de patrones a escala. Sus limitaciones revelan que inteligencia no es un concepto único: los sistemas actuales no captan razonamiento espacial tridimensional como lo hacen los humanos, pero procesan texto a velocidades y volúmenes que nosotros no alcanzamos.
¿Cuándo resolverán estos desafíos los nuevos modelos?
No se especifica en el texto fuente recibido. El progreso es rápido en tareas específicas como Connections, pero las limitaciones de escala y razonamiento espacial son profundas. La investigación sugiere que mejoras arquitectónicas significativas serían necesarias.
¿Qué nos enseña esto sobre el futuro de la IA?
Las pruebas muestran que la IA actual tiene fortalezas y debilidades complementarias a las humanas. Entender estas diferencias es clave para diseñar sistemas más robustos y aplicaciones más prácticas en campos como ingeniería, diseño y resolución de problemas complejos.
El punto clave para la comunidad tech
Estos desafíos no invalidan el progreso de la IA; lo contextualizan. Los modelos mejoran exponencialmente en algunas áreas mientras mantienen limitaciones claras en otras. La investigación rigurosa mediante puzzles es invaluable para anticipar debilidades reales antes de desplegar sistemas en aplicaciones críticas.
En Inteligencia Artificial creemos que este tipo de evaluación sistemática es esencial para evitar sobrevalorar capacidades cognitivas generales en sistemas que siguen siendo especializados. ¿Cuál es tu desempeño en estos puzzles comparado con la IA?
Fuente: www.technologyreview.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.