Waymo revoluciona el mundo autónomo con IA que «imagina» escenarios de conducción
Cuando pensamos en coches autónomos, solemos imaginar vehículos recorriendo las calles recopilando millones de kilómetros de experiencia. Pero ¿qué pasa con situaciones que rara vez ocurren? ¿Cómo entrenar un vehículo para algo que quizás nunca ha experimentado? Aquí es donde la nueva tecnología de Waymo, basada en la IA de DeepMind, está cambiando las reglas del juego.
El salto a la simulación hiperrealista
Waymo, la empresa de conducción autónoma nacida de Google, acaba de presentar su «Waymo World Model», una herramienta basada en el modelo Genie 3 de Google DeepMind. Lo que hace especial a este sistema es su capacidad para crear entornos simulados hiperrealistas mediante simples indicaciones textuales.
La compañía presume de tener más de 200 millones de kilómetros de conducción real, pero ahora añade miles de millones de kilómetros virtuales. Y no, no estamos hablando de simulaciones básicas. Este modelo puede crear escenarios que difícilmente ocurrirían en la vida real, como nieve en el puente Golden Gate o un elefante cruzando una avenida.
Más allá del entrenamiento tradicional
Hasta hace poco, entrenar coches autónomos significaba recolectar datos exclusivamente de situaciones reales. Esto creaba un problema evidente: los eventos peligrosos o extraños quedaban subrepresentados en los datos de entrenamiento, precisamente porque son raros (y menos mal).
Con el nuevo modelo, los ingenieros pueden generar estas situaciones poco comunes mediante indicaciones textuales simples. Es como si dijéramos: «Vale, muéstrame cómo respondería el coche si de repente aparece un ciclista desde un punto ciego durante una tormenta de nieve». Y boom, tienes un escenario completo para entrenar.
La memoria que todo lo ve y recuerda
Lo que diferencia a Genie 3 de otros modelos de simulación es su «memoria de largo alcance». Suena técnico, pero es bastante intuitivo: si en una simulación pasas por delante de un objeto y luego regresas, el modelo «recuerda» cómo se veía ese objeto, manteniendo la coherencia visual.
En modelos anteriores, si te alejabas de algo, el sistema prácticamente «olvidaba» cómo era cuando volvías a mirarlo. Genie 3 mantiene esta memoria contextual durante varios minutos, lo que hace que las simulaciones sean mucho más realistas y útiles.
No es solo trasplantar Genie 3 a coches
Waymo no se ha limitado a tomar Genie 3 y rellenarlo con vídeos de coches. Junto con DeepMind, han desarrollado un proceso especializado para que el modelo genere tanto vídeo 2D como datos de lidar 3D de la misma escena.
Mientras las cámaras captan detalles finos, Waymo insiste en que el lidar es fundamental para añadir información de profundidad a lo que un coche autónomo «ve» en la carretera. Y sí, no puedo evitar pensar que alguien debería comentárselo a Tesla, que sigue apostando exclusivamente por cámaras…
Transformando lo real en lo posible
Una de las características más interesantes del Waymo World Model es su capacidad para «mutar» condiciones en vídeos reales. ¿Qué pasaría si ese cruce soleado de Phoenix estuviera nevado? ¿O si fuera de noche en lugar de día? ¿Y si hubiera una señal de tráfico adicional?
Esto resulta particularmente útil ahora que Waymo está expandiéndose a ciudades con climas más variables como Boston y Washington D.C., después de haberse concentrado inicialmente en lugares consistentemente soleados como Phoenix.
El detector de IA que valida la realidad
Para asegurarse de que estas simulaciones sean útiles, Waymo debe verificar que sean lo suficientemente realistas. Es como tener un detector de IA que evalúa si lo que ha generado otro sistema de IA es creíble o no.
Los vídeos de prueba que hemos visto de Genie 3 varían desde bastante convincentes hasta adentrarse en el territorio del «valle inquietante», pero Waymo confía en que la tecnología ha mejorado lo suficiente como para ser realmente útil en el entrenamiento de vehículos autónomos.
Lidar + IA: la combinación ganadora
Un aspecto fascinante de este generador de imágenes IA es su capacidad para tomar vídeos de cámaras convencionales y generar los datos de lidar correspondientes. Esto permite a Waymo aprovechar millones de vídeos de dashcams disponibles públicamente que carecen de los datos de sensores multimodales que llevan sus vehículos.
Simplemente alimentando estos vídeos al modelo, pueden generar los datos de sensores que mostrarían cómo habría «visto» la IA de conducción esa situación. Es como transformar cualquier vídeo de carretera en un entorno de entrenamiento completo.
La simulación realista está abriendo nuevas posibilidades para el entrenamiento de sistemas autónomos, permitiéndonos anticipar situaciones que de otro modo tomaría décadas encontrar en el mundo real. Y aunque las simulaciones nunca reemplazarán completamente la experiencia real en carretera, definitivamente acelerarán el camino hacia una conducción autónoma más segura y confiable.


