Tecno

La IA "razona" o solo simula hacerlo bien

Modelos de inteligencia artificial resuelven problemas matemáticos de altísimo nivel, pero varios estudios muestran que sus "cadenas de pensamiento" no siempre reflejan lo que realmente ocurre dentro del sistema.

Por Administrador 3 min de lectura36 visualizaciones
La IA "razona" o solo simula hacerlo bien

Los llamados "modelos de razonamiento" de inteligencia artificial atraviesan un momento contradictorio. Por un lado, lograron hitos como resolver de una sola vez un problema matemático abierto y ganar medallas de oro en la Olimpiada Internacional de Matemática. Por otro, distintas investigaciones académicas encontraron que el mecanismo que supuestamente explica esos logros —las llamadas "cadenas de pensamiento"— no siempre corresponde a un proceso lógico real.

Estos modelos, conocidos como LRM (large reasoning models), se entrenan para generar textos intermedios antes de dar una respuesta final. Esos textos, presentados como el "razonamiento" del sistema, buscan simular cómo una persona resuelve un problema paso a paso.

Cadenas de pensamiento que no serían fieles

Un equipo de la Universidad Estatal de Arizona, liderado por Subbarao Kambhampati, reemplazó las cadenas de razonamiento correctas de un modelo por otras incorrectas o irrelevantes y comprobó que el desempeño no empeoraba. Incluso entrenando al sistema solo con ejemplos correctos, el modelo igual generaba explicaciones inválidas aunque llegara a la respuesta correcta.

En la misma línea, investigadores de la Universidad de Nueva York demostraron en 2024 que cadenas de texto sin ningún significado —simples secuencias de puntos— podían cumplir la misma función que una explicación en lenguaje humano. Uno de los autores de ese trabajo, William Merrill, sostuvo que no existe ninguna garantía de que esas cadenas deban tener sentido.

Un estudio de 2025 de las universidades Northeastern y de California en Berkeley fue más allá: analizó modelos de código abierto de última generación y halló que entre el 30% y el 60% de los "pasos de pensamiento" tenía un impacto mínimo o nulo sobre la respuesta final. Eliminar la mitad de esos pasos apenas afectaba el resultado.

Pavel Izmailov, investigador de NYU que también trabaja en Anthropic, dijo dudar de que el método de entrenamiento habitual de estos modelos —el aprendizaje por refuerzo— incentive siquiera la producción de explicaciones fieles a lo que ocurre internamente.

Resultados que contradicen las críticas

A la par de estos cuestionamientos, otros resultados parecen mostrar lo contrario. Google DeepMind, junto al matemático Terence Tao, usó IA para redescubrir o mejorar soluciones a 67 problemas de análisis matemático, combinatoria, geometría y teoría de números. Y OpenAI presentó un modelo que resolvió en 2026 un problema matemático abierto, el llamado problema de la distancia unitaria, en un solo intento.

Sébastien Bubeck, integrante del staff técnico de OpenAI, rechazó las críticas previas —entre ellas un trabajo de investigadores de Apple que había hablado de un "colapso total de precisión" en los modelos— y aseguró que esos problemas correspondían a versiones anteriores, ya superadas por los modelos actuales.

Kambhampati, en cambio, sostiene que buena parte de la comunidad científica y de la industria se apresura a dar explicaciones convenientes sobre por qué estos sistemas funcionan, sin sustento suficiente. "Una teoría falsa es peor que admitir que no tenemos ninguna teoría", planteó.

Melanie Mitchell, investigadora del Instituto Santa Fe con una larga trayectoria en inteligencia artificial, resume el estado actual del debate en tres puntos: los modelos de razonamiento efectivamente mejoran la precisión frente a los modelos de lenguaje comunes; el texto que generan como explicación no necesariamente refleja lo que pasa dentro del sistema; y buena parte de ese texto ni siquiera resulta útil, al punto de poder eliminarse sin afectar el resultado.

Los especialistas coinciden en un punto: gran parte de los sistemas de IA más efectivos combinan estos modelos con software convencional que verifica y guía sus respuestas, como ocurre en los sistemas de IA "agéntica" o en herramientas que usan demostradores automáticos de teoremas. La discusión, entonces, pasa por entender qué parte del resultado depende realmente del "razonamiento" del modelo y qué parte depende de esas herramientas externas.

Publicidad

Comentarios

Ingresá para comentar — leer es gratis, comentar también.

Todavía no hay comentarios. Sé el primero en opinar.

Notas relacionadas