O3-pro: lo que realmente significa «razonamiento» en la IA
Hace unos días, OpenAI anunció que o3-pro está disponible para usuarios de ChatGPT Pro y Team, reemplazando al modelo o1-pro. Además de las mejoras técnicas, la compañía redujo el precio del API un 87% respecto a su predecesor. Pero más allá de los números, esta actualización vuelve a poner sobre la mesa una cuestión fundamental: ¿qué significa realmente «razonamiento» cuando hablamos de IA?
¿Qué hay de nuevo en o3-pro?
El o3-pro se centra en mejorar áreas como matemáticas, ciencia y programación, mientras añade capacidades que no tenía el modelo básico: búsqueda web, análisis de archivos e imágenes, y ejecución de Python. Todas estas integraciones hacen que el modelo sea más lento (incluso más que el ya pausado o1-pro), por lo que OpenAI recomienda usarlo solo cuando la precisión importa más que la velocidad.
Un detalle que no podemos pasar por alto: estos modelos de «razonamiento» siguen cometiendo errores factuales. Es decir, pueden confabular información igual que sus contrapartes «no razonantes». Esto es crucial tenerlo en cuenta cuando buscamos respuestas precisas.
Respecto a los precios, la reducción es significativa. O3-pro cuesta ahora $20 por millón de tokens de entrada y $80 por millón de tokens de salida en el API, un 87% menos que o1-pro. El modelo estándar o3 también ha visto su precio reducido en un 80%. Estas reducciones abordan una de las principales críticas que tenían estos modelos: su alto coste comparado con modelos estándar.
¿Por qué usar o3-pro?
A diferencia de modelos de propósito general como GPT-4o que priorizan la velocidad y el conocimiento amplio, o3-pro utiliza un proceso de simulación de razonamiento paso a paso. Destina más tokens a trabajar en problemas complejos, lo que lo hace generalmente mejor para desafíos técnicos que requieren análisis profundo.
OpenAI afirma que en evaluaciones con expertos, los revisores prefieren consistentemente o3-pro sobre o3 en todas las categorías probadas, especialmente en áreas clave como ciencia, educación, programación, negocios y ayuda en escritura. Los revisores también calificaron o3-pro de forma más alta en claridad, exhaustividad, seguimiento de instrucciones y precisión.
Los resultados de benchmarks son impresionantes: en la competición matemática AIME 2024, o3-pro alcanzó un 93% de precisión pass@1, comparado con el 90% de o3 (medium) y el 86% de o1-pro. En preguntas científicas de nivel PhD de GPQA Diamond, llegó al 84%, mejorando el 81% de o3 y el 79% de o1-pro. Para tareas de programación medidas por Codeforces, o3-pro logró una puntuación Elo de 2748, superando los 2517 de o3 y los 1707 de o1-pro.
Sin embargo, hay que tomar estos resultados con cierta cautela. Medir la capacidad de «razonamiento» es complicado, ya que los benchmarks pueden ser fáciles de «gamificar» mediante la selección selectiva de datos o la contaminación de los datos de entrenamiento.
Cuando el razonamiento es simulado
Es fácil confundirse con el término antropomórfico de «razonamiento» aplicado a modelos de IA. Al igual que ocurre con «alucinaciones», «razonamiento» se ha convertido en un término técnico en la industria que básicamente significa «dedicar más tiempo de cómputo a resolver un problema». No implica necesariamente que estos modelos apliquen lógica sistemáticamente o posean la capacidad de construir soluciones a problemas verdaderamente nuevos.
Los modelos de razonamiento simulado como o3-pro muestran mejoras medibles sobre modelos de propósito general en tareas analíticas. Pero la investigación sugiere que estas ganancias provienen simplemente de asignar más recursos computacionales para recorrer sus redes neuronales en pasos más pequeños y dirigidos. La clave está en lo que los investigadores llaman escalado de «compute de tiempo de inferencia».
Durante este proceso de «razonamiento», el modelo de IA genera un flujo de texto donde «piensa en voz alta», utilizando tokens de salida para trabajar problemas paso a paso de manera visible para los usuarios. Cada paso intermedio sirve como contexto para la siguiente predicción, restringiendo efectivamente las salidas del modelo de maneras que tienden a mejorar la precisión y reducir errores matemáticos (aunque no necesariamente los factuales).
Los límites del detector de IA que opera como razonamiento
Fundamentalmente, todos los modelos de IA basados en Transformers son maravillas de reconocimiento de patrones. Toman patrones de razonamiento de ejemplos en los datos de entrenamiento. Estudios recientes sobre problemas de Olimpiadas Matemáticas revelan que estos modelos siguen funcionando como máquinas sofisticadas de reconocimiento de patrones: no pueden detectar sus propios errores ni ajustar enfoques fallidos, a menudo produciendo soluciones incorrectas con confianza.
Investigadores de Apple encontraron limitaciones similares al probar estos modelos en entornos de puzles controlados. Incluso cuando se les proporcionaba algoritmos explícitos para resolver puzles como la Torre de Hanoi, los modelos fallaban al ejecutarlos correctamente. Esto sugiere que su proceso se basa en el reconocimiento de patrones de datos de entrenamiento más que en razonamiento lógico real.
Utilidad práctica vs limitaciones fundamentales
Entender estas limitaciones no disminuye la utilidad real de estos modelos. Para muchas aplicaciones del mundo real —depurar código, resolver problemas matemáticos o analizar datos estructurados— el reconocimiento de patrones basado en amplios conjuntos de entrenamiento es suficientemente útil.
La tecnología está evolucionando rápidamente y ya se están desarrollando nuevos enfoques para abordar estas deficiencias. Por ejemplo, el muestreo de auto-consistencia permite a los modelos generar múltiples caminos de solución y verificar si hay concordancia. Las instrucciones de auto-crítica intentan hacer que los modelos evalúen sus propias salidas en busca de errores.
Otra dirección prometedora es la aumentación con herramientas, ya utilizada por o3-pro y otros modelos de ChatGPT. Al conectar estos modelos a calculadoras, motores matemáticos simbólicos o sistemas de verificación formal, los investigadores pueden compensar algunas de las debilidades computacionales de los modelos.
El generador de imágenes IA y su relación con el razonamiento
Es interesante comparar cómo funcionan los generadores de imágenes IA con los modelos de razonamiento. Mientras que los generadores de imágenes utilizan redes adversarias o difusión para crear contenido visual basado en patrones aprendidos, los modelos de razonamiento como o3-pro intentan simular un proceso de pensamiento estructurado.
Sin embargo, ambos comparten la misma base fundamental: son sistemas de reconocimiento de patrones entrenados en enormes conjuntos de datos. La diferencia principal es que los modelos de razonamiento muestran su «trabajo» de forma textual, mientras que los generadores de imágenes solo presentan el resultado final visual.
Esta comparación nos ayuda a entender mejor qué es realmente el «razonamiento» en IA: un proceso simulado diseñado para imitar cómo los humanos abordamos problemas, pero fundamentalmente diferente en su implementación y limitaciones.
¿Qué significa esto para los usuarios?
Por ah


