Google lanza Gemini 3.8 Live, que piensa y habla a la vez para crear agentes de voz
La variante Extended Thinking lidera el índice de calidad voz a voz de Artificial Analysis y ejecuta tareas en segundo plano sin cortar la conversación.
Google DeepMind ha presentado dos modelos de diálogo en tiempo real, Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, diseñados para agentes de voz capaces de razonar, usar herramientas y mantener la conversación mientras trabajan.
Qué ha ocurrido
Google DeepMind ha lanzado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de audio diseñados para interacciones por voz casi en tiempo real. La versión Live prioriza coste y escala, con comprensión visual en directo y detección automática de cambios de idioma entre 97 lenguas. La versión Extended Thinking está pensada para tareas complejas: razona y habla simultáneamente, narra su progreso y ejecuta llamadas a herramientas en segundo plano sin interrumpir la conversación.
Qué cambió
Hasta ahora los asistentes de voz debían elegir: o respuesta inmediata y superficial, o pausa larga mientras el modelo piensa. La ejecución asíncrona de herramientas con narrativa en vivo disuelve esa elección: el agente puede lanzar una reserva o una consulta y seguir conversando mientras espera el resultado.
Qué sabemos
- El anuncio oficial detalla despliegue inmediato: Gemini API y Google AI Studio para desarrolladores, Search Live, la app de Gemini y Workspace (Docs Live, Gmail Live, Keep Live), con vista previa privada en Gemini Enterprise.
- Google cita un primer puesto en el índice de calidad voz a voz de Artificial Analysis (82,6), un 68,6 % de finalización de tareas agénticas en τ‑Voice y un 97,7 % en Big Bench Audio para la variante Extended Thinking.
- Todo audio generado por los productos de Google se marca con la marca de agua SynthID.
- Google enumera socios iniciales (Salesforce, Genspark, Lumeris) y plataformas de desarrollo (LangChain, LiveKit, Pipecat, Vercel, entre otras).
Qué no sabemos
Las cifras de benchmarks proceden del propio anuncio de Google; ni Artificial Analysis ni los autores de τ‑Voice han publicado todavía su lectura independiente. Tampoco hay precios de la API en el anuncio ni comparativa directa con la oferta de voz de OpenAI o xAI, y la disponibilidad en español de las funciones de Workspace no se detalla región por región.
Qué vigilar
Si la ejecución asíncrona con narrativa se convierte en patrón estándar de la competencia en las próximas lanzamientos de voz, y cómo responden los reguladores a agentes de voz que actúan (reservan, compran) mientras conversan.
Qué cambió
Qué sabemos · qué no
Confirmado
- Despliegue el mismo día en API, Search, Workspace y la app de Gemini.
- Benchmarks publicados por Google: 82,6 en el índice voz a voz de Artificial Analysis y 68,6 % en τ‑Voice.
- Marca de agua SynthID en todo el audio generado.
Todavía no
- Validación independiente de los benchmarks citados.
- Precios de la API y disponibilidad por regiones, incluida España.
- Rendimiento comparado frente a los modelos de voz de OpenAI y xAI.
Qué vigilamos ahora
Lecturas independientes de Artificial Analysis y τ‑Voice, precios de la API y la reacción de la competencia en agentes de voz.
Fuentes
Naturaleza de la afirmación principal: Anuncio de la empresa. Fuente primaria consultada y verificable.
- Google DeepMind Blog · nivel 1 · primaria · consultada 28 sept