Google lanza nuevos modelos Gemini para voz en tiempo real
Nuevas versiones de IA de audio prometen conversaciones más inteligentes y multitarea
El pasado martes, Google anunció la disponibilidad de tres nuevos modelos de inteligencia artificial de audio: Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking y Gemini 3.5 Transcribe. La novedad llegó después de que la empresa publicara en su blog que estos recursos ya están integrados en Gemini API, Google AI Studio y productos como Gmail, Docs y Keep.
Qué son los modelos Gemini 3.8 Live y Extended Thinking
Gemini 3.8 Live introduce una mejora de rendimiento en las capacidades de voz‑a‑voz, permitiendo que el agente de voz ejecute tareas mientras mantiene el flujo de la conversación. La variante Extended Thinking añade razonamiento de múltiples pasos, con “pensamiento configurable” que procesa solicitudes complejas en segundo plano y narra el progreso al usuario.
Aplicaciones prácticas para desarrolladores y empresas
Ambos modelos se ofrecen a través de Live API, con precios de US$0,005 por minuto de audio de entrada y US$0,018 por minuto de salida. Google indica que la solución puede escalarse mediante socios de integración como Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel y Vision Agents, que gestionan la infraestructura de streaming.
Gemini 3.5 Transcribe: transcripción precisa en más de 85 idiomas
El modelo Gemini 3.5 Transcribe, lanzado el mes anterior, se centra en la transcripción de audio con baja latencia. Alcaza una tasa de error de palabra (WER) del 4,0 % en streaming y del 2,6 % en modo no streaming, soportando más de 85 idiomas. Entre sus funcionalidades se incluyen marcas de tiempo estructuradas, etiquetado de hablantes y la posibilidad de transcribir archivos de hasta una hora.
Integración con productos de Google Workspace
Además de atender a desarrolladores externos, los nuevos modelos alimentan recursos de voz en las propias aplicaciones de Google. Gmail Live permite búsquedas conversacionales en correos, Docs Live ofrece generación y edición de textos mediante voz, y Keep Live transforma ideas habladas en listas y notas estructuradas.
Impacto para usuarios brasileños
Con la expansión de la capacidad de comprensión de audio en tiempo real, los usuarios de Brasil podrán interactuar con asistentes de voz más fluidos, incluso en portugués, aprovechando la cobertura de 97 idiomas soportados por Gemini 3.8 Live. La promesa de “hablar con IA de forma más intuitiva e inteligente” se refleja en la reducción de fricciones al realizar tareas como programar citas, buscar información o generar documentos sin necesidad de escribir.
Con información de blog.google, PYMNTS.com, 9to5Google.
Fuente: blog.google, PYMNTS.com, 9to5Google