• 2 min de lectura
La IA explica descubrimientos pero no logra predecirlos
Un benchmark CUSP que abarcó 4,760 eventos científicos descubrió que los mejores modelos podían explicar mecanismos plausibles, pero estaban cerca del azar al pronosticar avances reales.

Imagen: iXBT
Un nuevo benchmark CUSP sugiere que los principales modelos actuales pueden hablar de forma convincente sobre ciencia sin predecir de manera fiable hacia dónde avanzará realmente la ciencia.
Los investigadores utilizaron Cutoff-conditioned Unseen Scientific Progress para evaluar 6 sistemas líderes frente a 4,760 eventos científicos verificables en 8 disciplinas que ocurrieron después del corte de entrenamiento de cada modelo. El grupo evaluado incluyó a GPT-5.4, Claude S4.5 y DeepSeek R1. Se evaluó a los modelos en cuatro tareas: si podían predecir si un descubrimiento ocurriría antes de una fecha límite, identificar el mecanismo que conduciría al resultado, idear una estrategia para resolver el problema científico y pronosticar cuándo llegaría el logro.
El hallazgo central fue una división clara entre entender mecanismos científicos y hacer predicciones reales. En tareas de selección de mecanismos, los modelos se desempeñaron muy por encima del azar: GPT-5.4 alcanzó 79.2% de precisión y Claude S4.5 obtuvo 69.9%. Pero cuando se les preguntó si un logro específico ocurriría realmente en el mundo real, los resultados estuvieron cerca de lo que daría un lanzamiento de moneda. GPT-5.4 obtuvo 49.1%, mientras que Claude S4.5 alcanzó 52.6%.
Los modelos también tuvieron problemas con el momento. Tendían a predecir que los avances científicos se harían públicos más tarde de lo que realmente ocurrió. Los errores en la predicción de fechas oscilaron entre 4.9 meses para LLaMA 3.3 y 15.7 meses para DeepSeek R1, mientras que algunos modelos de generación anterior fallaron por más de 2 años.
Comparación con expertos y límites del acceso a la web
Proporcionar a los modelos más información no resolvió el problema. Cuando los investigadores añadieron acceso a búsquedas web con límite temporal, el rendimiento mejoró en los casos en que la falta de datos había causado el error. Pero incluso con toda la información públicamente disponible, persistió la brecha entre conocer los hechos y pronosticar resultados.

Recomendado
Google prepara el chip Frozen v2 para un salto de eficiencia de Gemini
Los expertos humanos aún lo hicieron mejor. Al evaluar la viabilidad de los eventos científicos, los expertos alcanzaron 73% de precisión, frente a 52.5% para GPT-4o.
Los autores del estudio dicen que los modelos actuales muestran una fuerte competencia científica retrospectiva: pueden analizar el conocimiento existente y generar ideas científicamente plausibles. Pero predecir descubrimientos futuros parece ser un desafío completamente distinto, con implicaciones evidentes para la planificación de la investigación, las decisiones de financiación y la toma de decisiones científicas en general.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía iXBT


