Probamos 4 agentes de IA para recrear Minesweeper, y solo uno estuvo a la altura
¿Qué tan buenas son las herramientas de codificación impulsadas por IA? Llevan meses causando polémica entre los desarrolladores. Por un lado, tenemos a quienes sostienen que estas herramientas cometen errores garrafales que requieren más tiempo corregir que programar desde cero. Por otro, están los que aseguran que los modelos más avanzados ya están superando esos problemas iniciales y realmente pueden acelerar el trabajo de programación.
Para salir de dudas, decidí probar cuatro de los agentes de IA más destacados del mercado actual con un reto aparentemente simple: recrear el clásico Minesweeper de Windows.
El desafío: Buscaminas con un toque de originalidad
La tarea no era simplemente clonar el juego. Cualquier sistema de coincidencia de patrones puede copiar código de versiones existentes. Por eso añadimos estos requisitos específicos:
- Replicar fielmente el juego estándar de Windows
- Implementar una característica divertida y sorprendente
- Incluir efectos de sonido
- Añadir soporte para pantallas táctiles
Los cuatro contendientes fueron OpenAI Codex (basado en GPT-5), Claude Code de Anthropic (con Opus 4.5), Gemini CLI de Google y Mistral Vibe. Todos fueron probados usando sus interfaces de terminal, sin accesos especiales ni privilegios, en condiciones de uso normales.
Agent 1: Mistral Vibe – Lo básico y poco más
El primer contendiente, Mistral Vibe, entregó una versión jugable pero que carece de elementos fundamentales. Para empezar, no implementó el «chording» (técnica que permite limpiar rápidamente espacios rodeando un número que ya tiene suficientes minas marcadas) – algo imperdonable para cualquier jugador experimentado.
La interfaz tenía inconsistencias como un botón de dificultad «Personalizado» que no hacía nada, y un botón de «Nuevo Juego» redundante junto al clásico botón de carita sonriente.
Lo más sorprendente: olvidó por completo incluir efectos de sonido, a pesar de que lo solicitamos explícitamente. Y como «característica divertida», simplemente añadió un fondo arcoíris cuando completabas el juego.
En cuanto a velocidad, fue el tercer más rápido, lo cual es relativamente impresionante para un modelo de peso abierto sin el respaldo financiero de los gigantes tecnológicos. Sugiere que con más tiempo de entrenamiento, podría convertirse en un contendiente serio.
Calificación: 4/10 – Cumplió con los requisitos mínimos, pero faltaron elementos cruciales.
Agent 2: OpenAI Codex – Un ganador por los detalles
Codex no solo implementó correctamente el chording, sino que incluyó instrucciones en pantalla para usar esta técnica tanto en PC como en dispositivos móviles. Sorprendentemente, hasta incluyó la opción de alternar entre marcas de «?» al marcar casillas con banderas, un detalle del Buscaminas original que muchos recreadores humanos suelen pasar por alto.
La experiencia móvil fue la mejor de todas las versiones probadas, con una opción de mantener presionado para marcar banderas que resultaba muy natural.
Aunque visualmente tenía algunos elementos básicos (usaba un simple «*» para las minas y una «F» para las banderas), compensó con efectos sonoros al estilo retro que recordaban a los primeros PCs, con la opción de desactivarlos si lo preferías.
Como característica divertida, implementó un «Barrido Afortunado» que te otorgaba un cuadrado seguro gratis cuando estaba disponible. No era revolucionario, pero añadía un elemento estratégico interesante.
Codex tardó aproximadamente el doble que Claude Code en desarrollar su versión, pero el resultado mereció la pena.
Calificación: 9/10 – Atención al detalle y funcionalidad completa.
Agent 3: Anthropic Claude Code – Rápido pero incompleto
Claude Code impresiona por su velocidad: generó un Minesweeper funcional en menos de cinco minutos, claramente más rápido que sus competidores. Sin embargo, cometió el mismo error que Mistral al omitir la característica de chording.
Visualmente, esta versión se llevó la palma con una presentación pulida: emojis para la carita, buenos gráficos para bombas y banderas, y efectos sonoros simples pero efectivos. Todo se veía profesional, aunque presentaba algunos problemas visuales ocasionales como espacios raros entre columnas.
Su característica divertida fue la más elaborada: un «Modo Poder» que ofrecía diferentes potenciadores como «Escudo» (que te protege de una adivinanza errónea) o «Explosión» (que garantiza una cascada de casillas reveladas). Aunque algunos poderes como el «Rayos X» parecían demasiado fáciles de explotar.
Calificación: 7/10 – Gran presentación y rapidez, pero la falta de chording es imperdonable.
Agent 4: Google Gemini CLI – Un fracaso total
La experiencia con Gemini CLI fue… decepcionante, por decirlo suavemente. Después de mucho tiempo generando código (alrededor de una hora por intento), el resultado fue completamente inútil: apenas unos cuadros grises en los que se podía hacer clic, sin ninguna funcionalidad real de juego.
El modelo se quedó atascado intentando crear manualmente efectos de sonido en formato WAV e insistía en usar bibliotecas externas complejas como React. Incluso con una segunda oportunidad especificando el uso de HTML5, el resultado seguía sin funcionar.
Es justo mencionar que Gemini CLI usa un sistema híbrido de tres LLMs para diferentes tareas (Gemini 2.5 Flash Lite, 2.5 Flash y 2.5 Pro), y que existen modelos Gemini 3 que no probamos. Pero con lo visto, no pintaba bien.
Calificación: 0/10 – Directamente no funcionó.
¿Qué nos dice este experimento sobre los generadores de IA?
Este pequeño experimento confirma algo que venimos observando en el sector: no todos los modelos de IA para codificación están al mismo nivel, ni de lejos. OpenAI Codex se llevó la victoria en esta ocasión, principalmente porque fue el único que entendió y aplicó correctamente todas las características esenciales del juego original.
Claude Code impresionó por su velocidad y acabados visuales, mientras que Mistral Vibe demostró potencial como alternativa de código abierto. Google Gemini CLI, por su parte, evidenció que tener el respaldo de un gigante tecnológico no garantiza resultados.
Lo más interesante es cómo estos modelos interpretan de manera tan distinta una misma solicitud. Algunos se centran en la funcionalidad básica, otros en los aspectos visuales, y solo los mejores logran equilibrar todos los aspectos requeridos.
El futuro de la programación asistida por IA
Estamos en un punto donde estos asistentes de codificación pueden ser realmente útiles, pero no están listos para trabajar sin supervisión. Incluso el mejor modelo (Codex) tardó bastante en desarrollar lo que un programador experimentado podría hacer en tiempo similar, pero con mayor precisión.
Sin embargo, el ritmo de mejora es impresionante. Si comparamos con los resultados de hace apenas dos años, cuando estos modelos apenas podían generar funciones simples sin errores, el avance es notable.
Por ahora, la conclusión es clara: los detectores de IA y generadores


