google veo 3 el generador de video ia que finalmente puede hablar y cantar

Google Veo 3: el generador de vídeo IA que finalmente puede hablar (y cantar)

La evolución de los generadores de vídeo con IA acaba de dar un salto cualitativo significativo. Google ha lanzado Veo 3, un modelo de síntesis de vídeo que por fin soluciona uno de los mayores problemas que arrastraban estos sistemas: la ausencia de audio sincronizado. Hasta ahora, la mayoría de vídeos generados por IA eran mudos y de corta duración, pero Veo 3 permite crear clips de ocho segundos en alta definición con voces, diálogos y efectos de sonido.

La evolución del «test del espagueti»

Cuando un nuevo generador de vídeo con IA llega al mercado, parece que hay una prueba de fuego inevitable: ver cómo representa a Will Smith comiendo espaguetis. Este peculiar benchmark tiene su origen en marzo de 2023, cuando ModelScope (un modelo de código abierto para generar vídeos) produjo una versión grotesca y perturbadora del actor comiendo pasta, que se volvió viral precisamente por lo mal que estaba hecha.

Para entender cuánto hemos avanzado, hay que recordar que aquella imagen extraña y deforme se convirtió en una referencia para medir el progreso de la tecnología. Tanto es así que el propio Will Smith parodió el vídeo casi un año después, en febrero de 2024, convirtiendo este «test del espagueti» en un meme reconocible dentro del mundo de la IA generativa.

Los espaguetis crujientes de Veo 3

El desarrollador Javi Lopez fue uno de los primeros en probar Veo 3 con el famoso test. El resultado: un Will Smith mucho más realista comiendo espaguetis, pero con un detalle curioso: el sonido que emite al masticar es un crujido, como si la pasta estuviera dura o fuera una galleta.

Este peculiar fallo nos revela cómo funcionan realmente estos sistemas: son máquinas de predicción que trabajan con patrones. Si en los datos de entrenamiento hay muchos ejemplos de personas masticando con efectos de sonido crujientes, el modelo simplemente establece esa correlación. Es lo que los expertos en IA llamamos un sesgo de representación en los datos de entrenamiento.

Cuando intenté reproducir el mismo experimento, Google ya había bloqueado el nombre «Will Smith» con sus filtros de contenido (algo lógico para prevenir deepfakes de celebridades), pero al solicitar «un hombre negro comiendo espaguetis», obtuve resultados similares con el mismo sonido crujiente.

Más allá del espagueti: el potencial de la IA sonora

Lo realmente revolucionario de Veo 3 no es que genere vídeos más realistas, sino su capacidad para crear diálogos coherentes y música sincronizada. Para poner a prueba estas capacidades, pedí al sistema que creara «un hombre cantando una ópera cómica en inglés sobre espaguetis mientras los come en una mesa de cocina».

El resultado fue sorprendente: un vídeo donde el sujeto efectivamente canta una improvisada ópera sobre pasta con una voz medianamente sincronizada con sus movimientos labiales. Disto mucho de ser perfecto, pero representa un avance significativo respecto a lo que teníamos hace apenas unos meses.

El filtro de celebridades: una barrera necesaria pero imperfecta

Los filtros que Google ha implementado para evitar la creación de deepfakes con celebridades son una medida prudente pero limitada. Al bloquear nombres específicos como «Will Smith», la plataforma intenta prevenir el mal uso más obvio, pero como demostró Lopez (y como ocurre con otros sistemas similares), estos filtros suelen ser fáciles de eludir con variaciones en los prompts o técnicas de evasión.

Esta situación plantea preguntas importantes sobre cómo se regularán estas herramientas cuando sean capaces de producir vídeos indistinguibles de la realidad. Ya estamos viendo ejemplos cada vez más convincentes, como el que pude generar de «un hombre con disfraz de tiburón rapeando sobre tecnología en un escenario».

El futuro inmediato de la generación de vídeo con IA

Desde aquellos primeros intentos fallidos en 2023 hasta hoy, la evolución ha sido exponencial. Si en dos años hemos pasado de deformidades silenciosas a personas cantando ópera sobre espaguetis, es difícil imaginar dónde estaremos en 2027.

La próxima frontera no está tanto en la calidad visual (que ya es notable) sino en:

  1. Duración extendida: Superar la barrera de los 8-10 segundos para crear narrativas completas
  2. Consistencia de personajes: Mantener la identidad y características de los sujetos durante todo el vídeo
  3. Interacciones complejas: Representar de forma convincente a múltiples personas interactuando
  4. Detección de contenido sintético: Desarrollar mejores detectores de IA que puedan identificar estos vídeos

Lo cierto es que la singularidad cultural de la que tanto se habla está cada vez más cerca. La velocidad a la que avanza esta tecnología supera incluso las predicciones más optimistas, y pronto tendremos que enfrentarnos a un mundo donde diferenciar lo real de lo generado será prácticamente imposible sin herramientas especializadas.

Para los profesionales de la ciberseguridad, esto supone un nuevo frente de batalla: la autenticación de contenido audiovisual. Y para el público general, representa la necesidad de desarrollar un nuevo tipo de alfabetización digital, uno que nos permita navegar con criterio en este océano de contenido potencialmente sintético.

Noticias similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *