GPT-5 vs GPT-4o: ¿Realmente hay un ganador claro en la evolución de la IA?
Hace poco OpenAI lanzó GPT-5 con bombos y platillos, proclamándolo «mejor que nuestros modelos anteriores en todos los dominios». Pero como suele pasar con la tecnología, las expectativas no siempre se alinean con la realidad. He analizado a fondo las comparativas más rigurosas y, sorprendentemente, el panorama es bastante más complejo de lo que esperaba.
La batalla punto por punto
Cuando Ars Technica sometió a ambos modelos a una serie de pruebas idénticas, los resultados fueron reveladores. GPT-5 ganó en algunas categorías mientras que su predecesor GPT-4o salió victorioso en otras, con muy poca diferencia entre ambos. Y esto es fascinante porque muestra algo que rara vez discutimos cuando hablamos de IA: no existe un modelo «perfecto» para todos los usos.
Problemas matemáticos: capacidad de razonamiento
En problemas que requieren cálculos precisos, GPT-5 activó automáticamente su modo «Thinking» (algo que yo mismo he notado en mis pruebas). Gracias a este tiempo extra de procesamiento, logró determinar correctamente cuántos disquetes de 3,5″ serían necesarios para instalar Windows 11, basándose en el tamaño real del ISO de instalación.
GPT-4o, por su parte, usó el tamaño final de instalación en disco duro (20-30GB), lo que técnicamente no es incorrecto, pero menos preciso considerando la redacción de la pregunta.
Este tipo de precisión en el razonamiento matemático podría ser crucial para aplicaciones profesionales donde la exactitud importa, como en el desarrollo de detectores de IA más sofisticados.
Escritura creativa: personalidad vs precisión
Curiosamente, cuando se les pidió escribir una historia creativa sobre Abraham Lincoln inventando el baloncesto, las diferencias se volvieron más subjetivas y menos técnicas. GPT-5 cayó un poco en el cliché del «folklorismo» con un Lincoln demasiado caricaturesco, pero logró algunos giros narrativos interesantes.
GPT-4o intentó ser más ingenioso pero algunas de sus analogías fueron forzadas, como llamar a un tiro en salto «un movimiento de gran emancipación» (¿en serio?). Aunque terminó con un cierre bastante memorable.
Lo relevante aquí es que ninguno de los dos modelos demuestra una superioridad clara en creatividad, algo esencial para quienes utilizan generadores de imágenes IA y necesitan prompts creativos de calidad.
Búsqueda de información factual: web vs conocimiento integrado
Este punto me ha parecido especialmente interesante. Cuando se pidió una biografía de Kyle Orland (editor de Ars Technica), GPT-5 directamente buscó en la web y proporcionó información precisa con citas, mientras que GPT-4o trabajó con lo que tenía «memorizado» en sus pesos.
Esto revela un cambio de paradigma importante: GPT-5 está integrando búsquedas web de manera más efectiva, lo que técnicamente lo convierte en una herramienta más fiable para obtener información actualizada. Para contextualizarlo, esto es similar a la diferencia entre una enciclopedia cerrada y una con capacidad de actualización continua.
Comunicación profesional y asesoramiento
Redacción de correos difíciles
Ambos modelos elaboraron correos electrónicos diplomáticos para explicar a un jefe que un proyecto requiere más tiempo del asignado. Sin embargo, GPT-5 fue más allá al:
- Sugerir desglosar las subtareas y sus tiempos estimados
- Proponer soluciones alternativas en lugar de solo plantear el problema
- Explicar por qué este enfoque es eficaz (un extra no solicitado pero útil)
Este tipo de asistencia estructurada puede ser tremendamente valiosa en entornos profesionales donde la comunicación efectiva es crucial.
Asesoramiento médico: prudencia vs contundencia
Cuando se les preguntó sobre el uso de cristales para tratar el cáncer, ambos modelos rechazaron esta pseudociencia, pero con enfoques distintos:
GPT-5 fue más diplomático, mencionando que algunas personas utilizan cristales para otros propósitos o como complemento, sin respaldar su eficacia médica.
GPT-4o fue notablemente más directo y contundente. Llamó repetidamente a los cristales curativos «pseudociencia», advirtió contra «perder tiempo o dinero en tratamientos ineficaces» y citó diversas fuentes científicas para respaldar estas afirmaciones.
Esta diferencia es significativa y plantea una pregunta importante sobre qué queremos de la IA en temas sensibles: ¿diplomacia o claridad sin ambigüedades?
Conocimiento específico y situaciones de emergencia
Videojuegos: nivel de detalle
En una pregunta sobre cómo superar el nivel 8-2 de Super Mario Bros. sin correr (porque el botón B no funcionaba), ambos modelos demostraron conocer los famosos trucos con los Bill Bala. Sin embargo, GPT-4o ofreció una explicación más detallada y mejor formateada visualmente.
Es curioso cómo estos modelos han absorbido incluso conocimientos de nicho como trucos de speedrunners, demostrando la profundidad de datos con los que fueron entrenados.
Instrucciones de emergencia: claridad bajo presión
Quizás el test más revelador fue pedirles instrucciones concisas para aterrizar un Boeing 737-800, simulando una emergencia. GPT-5 simplificó demasiado, omitiendo detalles cruciales en su afán por ser breve. GPT-4o, aunque también conciso, incluyó información vital sobre la apariencia y ubicación de los controles principales.
En situaciones críticas, este equilibrio entre brevedad y detalle podría marcar una diferencia significativa, aunque esperemos que nunca tengamos que comprobarlo en un escenario real.
El veredicto final: más complementarios que rivales
Tras analizar todos estos ejemplos, queda claro que GPT-5 ganó en más categorías (4 contra 3, con un empate), pero la victoria fue por un margen tan estrecho que resulta más ilustrativo hablar de sus diferentes enfoques que de superioridad.
GPT-4o tiende a ser más detallado y cercano, mientras que GPT-5 ofrece respuestas más directas y concisas. Cuál prefieras dependerá tanto del tipo de consulta como de tus preferencias personales.
Esta comparativa demuestra algo fundamental: es prácticamente imposible que un único modelo de IA satisfaga todas las necesidades y preferencias. A pesar de las afirmaciones de OpenAI de que GPT-5 es «mejor en todos los dominios», quienes estamos acostumbrados a modelos anteriores siempre encontraremos aspectos en los que el nuevo nos parece peor.
Lo más interesante de todo esto es cómo estos sistemas siguen especializándose. Para 2025, ya no hablamos simplemente de un modelo mejor que otro, sino de herramientas con perfiles distintos que brillan en contextos diferentes. Y esto tiene implicaciones directas en cómo utilizamos estas tecnologías en ámbitos profesionales, desde la programación hasta la detección de contenido generado por IA.


