Google lança novos modelos Gemini para voz em tempo real
Novas versões de IA de áudio prometem conversas mais inteligentes e multitarefas
Na última terça-feira, a Google anunciou a disponibilização de três novos modelos de inteligência artificial de áudio: Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking e Gemini 3.5 Transcribe. A novidade chegou após a empresa divulgar, em seu blog, que esses recursos já estão integrados ao Gemini API, ao Google AI Studio e a produtos como Gmail, Docs e Keep.
O que são os modelos Gemini 3.8 Live e Extended Thinking
Gemini 3.8 Live traz uma mudança de desempenho nas capacidades de fala-para-fala, permitindo que o agente de voz execute tarefas enquanto mantém o fluxo da conversa. A variante Extended Thinking adiciona raciocínio de múltiplas etapas, com “pensamento configurável” que processa pedidos complexos em segundo plano e narra o progresso ao usuário.
Aplicações práticas para desenvolvedores e empresas
Ambos os modelos são oferecidos via Live API, com preços de US$0,005 por minuto de entrada de áudio e US$0,018 por minuto de saída. A Google indica que a solução pode ser escalada por meio de parceiros de integração como Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel e Vision Agents, que cuidam da infraestrutura de streaming.
Gemini 3.5 Transcribe: transcrição precisa em mais de 85 idiomas
O modelo Gemini 3.5 Transcribe, lançado no mês anterior, foca em transcrição de áudio com baixa latência. Ele atinge taxa de erro de palavra (WER) de 4,0% em streaming e 2,6% em modo não-streaming, suportando mais de 85 idiomas. Entre as funcionalidades, estão timestamps estruturados, rotulação de falantes e a possibilidade de transcrever arquivos de até uma hora.
Integração com produtos do Google Workspace
Além de atender desenvolvedores externos, os novos modelos alimentam recursos de voz nos próprios aplicativos da Google. O Gmail Live permite busca conversacional em e-mails, o Docs Live oferece geração e edição de textos por fala, e o Keep Live transforma ideias faladas em listas e notas estruturadas.
Impacto para usuários brasileiros
Com a expansão da capacidade de entendimento de áudio em tempo real, usuários do Brasil poderão interagir com assistentes de voz mais fluidos, inclusive em português, aproveitando a cobertura de 97 idiomas suportados pelo Gemini 3.8 Live. A promessa de “conversar com IA de forma mais intuitiva e inteligente” se reflete na redução de atritos ao realizar tarefas como agendar compromissos, buscar informações ou gerar documentos sem precisar digitar.
Com informações de blog.google, PYMNTS.com, 9to5Google.
Fonte: blog.google, PYMNTS.com, 9to5Google