Gemini 3.1 Flash Live: la IA de voz que quiere que no sepas si estás hablando con una máquina
Hay un momento concreto en el que te das cuenta de que estás hablando con una IA por teléfono: esa pausa incómoda, esa entonación plana que suena como si alguien hubiera leído el texto en voz alta sin entender muy bien lo que decía, o ese «por supuesto, puedo ayudarte con eso» que nadie en su sano juicio dice en una conversación real. Pues bien, Google está trabajando activamente para que ese momento deje de existir. Y eso merece que nos detengamos a pensar qué significa.
Qué es Gemini 3.1 Flash Live y por qué importa
Google acaba de presentar Gemini 3.1 Flash Live, un modelo de audio conversacional en tiempo real diseñado, según la compañía, para tener conversaciones que suenen —y se sientan— como hablar con una persona. No es un simple asistente de voz mejorado. Es un salto cualitativo en lo que la IA generativa puede hacer con el audio.
La diferencia respecto a modelos anteriores es concreta: velocidad de respuesta más ajustada al umbral humano de percepción, mejor cadencia en el habla y una mayor capacidad para gestionar las interrupciones y titubeos que son, precisamente, lo que hace que una conversación parezca real.
El problema de la latencia en los sistemas de voz con IA
Uno de los grandes obstáculos históricos de los sistemas de voz generativos no es la calidad del audio en sí, sino el retraso entre que el usuario termina de hablar y el sistema responde. Los investigadores sitúan en torno a 300 milisegundos el límite a partir del cual el cerebro empieza a percibir una conversación como extraña o entrecortada. Superar ese umbral de forma consistente es lo que diferencia a un sistema que «funciona» de uno que realmente «convence».
Google no ha publicado un dato concreto de latencia para Gemini 3.1 Flash Live, lo cual es llamativo. Se limita a decir que tiene «la velocidad que necesitas», una formulación lo suficientemente vaga como para levantar una ceja. Ahora bien, los benchmarks que sí ha publicado apuntan a mejoras reales.
Los números que Google sí ha puesto encima de la mesa
Cuando una empresa no da datos de latencia pero sí presenta resultados en pruebas comparativas, lo mejor es mirar esos benchmarks con atención.
ComplexFuncBench Audio y Big Bench Audio
El modelo muestra ganancias relevantes en ComplexFuncBench Audio, una prueba que evalúa la capacidad de un sistema para ejecutar tareas complejas en múltiples pasos dentro de una conversación de audio. Esto es importante: no se trata solo de responder preguntas sencillas, sino de mantener el hilo en interacciones más elaboradas.
En Big Bench Audio, que evalúa el razonamiento a partir de un conjunto de 1.000 preguntas de audio, Gemini 3.1 Flash Live se sitúa en la parte alta de la tabla. Eso indica que el modelo no solo es rápido, sino que entiende mejor el contexto de lo que escucha.
Scale AI’s Audio MultiChallenge: el que mide lo que más nos importa
Esta prueba mide algo muy concreto: cómo reacciona el modelo ante las hesitaciones, interrupciones y cambios de ritmo propios de una conversación humana real. Y aquí Gemini 3.1 Flash Live lidera entre los modelos diseñados para funcionar en tiempo real.
Sin embargo, hay que ponerlo en contexto: el modelo alcanza un 36,1% en esta prueba. Los modelos de audio que no están diseñados para operar en tiempo real superan el 50%. Es decir, Gemini 3.1 Flash Live gana en su categoría, pero todavía hay margen de mejora respecto al rendimiento absoluto. No está nada mal ser el mejor corriendo con aletas, pero quitárselas seguiría siendo mejor.
Suena como una persona, pero ¿cómo sabes que no lo es?
Aquí es donde el tema se pone interesante, y no precisamente de forma tranquilizadora. Google reconoce implícitamente que este modelo puede llegar a confundirse con voz humana real, y por eso ha tomado una decisión que merece atención: todas las salidas de audio de Gemini 3.1 Flash Live incluirán marcas de agua SynthID.
Qué es SynthID y cómo funciona
SynthID es la tecnología de watermarking de Google para contenido generado por IA. En el caso del audio, la marca se incrusta de forma imperceptible para el oído humano: no escucharás ningún pitido, ninguna alteración en la voz ni nada que delate que hay una firma digital ahí. Pero existe, y puede ser detectada si alguien intenta hacer pasar ese audio como real, algo que funciona como un detector de IA en el plano técnico.
Dicho esto, SynthID tiene un límite claro y Google lo reconoce: si en el momento de la llamada ya crees que estás hablando con una persona, esa watermark no te ayuda en absoluto. No es un detector de IA en tiempo real para el oyente. Es una herramienta forense para después, no una advertencia activa durante la conversación.
El problema que nadie resuelve aún
Y aquí está el núcleo del asunto. Que un audio generado por IA pueda ser verificado técnicamente a posteriori está bien. Que en el momento de la interacción no tengas ninguna señal de que estás hablando con un modelo como este, eso ya es otra conversación.
Home Depot, Verizon y otras compañías que han probado el modelo en entornos reales hablan de resultados positivos en cuanto a la capacidad del sistema para imitar el habla humana de forma convincente. Si eso se traduce en mejores experiencias de atención al cliente, perfecto. Si se traduce en que nadie te avisa de que estás hablando con una IA mientras te venden algo, menos perfecto.
Dónde vas a encontrarte con Gemini 3.1 Flash Live
El modelo ya está disponible para desarrolladores a través de AI Studio, la Gemini API y Gemini Enterprise for Customer Experience, que es esencialmente un conjunto de herramientas orientado a construir agentes conversacionales para entornos de venta y atención al cliente.
Para el usuario final, las 2 implementaciones más visibles serán:
- Gemini Live: el asistente conversacional por voz de Google.
- Search Live: una función integrada dentro del modo IA de búsqueda de Google, que permite hacer preguntas de forma oral y recibir respuestas en tiempo real.
El despliegue ha comenzado ya, aunque no de forma global e instantánea. En España y Europa, la llegada de estas funciones suele ir con algo de retraso respecto a Estados Unidos, así que es posible que todavía pase un tiempo antes de que lo veamos de forma generalizada.
Una reflexión que vale la pena no esquivar
La mejora de los modelos de audio conversacional sigue una trayectoria parecida a la que ya vivimos con el texto generado por IA. Durante un tiempo, era fácil detectar ese estilo mecánico, esa falta de naturalidad. Luego dejó de serlo, y ahora ya tenemos generadores de imágenes IA que producen rostros que nadie reconocería como sintéticos a simple vista.
El audio está siguiendo el mismo camino. Y la pregunta de fondo no es técnica, sino de diseño social: ¿debería haber una obligación de identificar cuándo un sistema de IA se dirige a ti en tiempo real? En la Unión Europea, el AI Act ya establece requisitos de transparencia para ciertos usos de IA conversacional, pero la implementación práctica de esos requisitos todavía tiene muchos flecos sueltos.
SynthID es un paso en la dirección correcta. Pero «un paso en la dirección correcta» y «solución suficiente» no son lo mismo. Y conviene no confundirlos.


