Google lança Gemini 3.8 Live e 3.8 Live Extended Thinking para voz avançada
IA

Google lança Gemini 3.8 Live e 3.8 Live Extended Thinking para voz avançada

Em resumo

A Google DeepMind apresentou dois novos modelos de diálogo em tempo real, o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, focados em conversas por voz mais naturais, fluidas e inteligentes. Estes modelos combinam raciocínio avançado, contexto visual em tempo real e execução de tarefas em segundo plano sem interromper a conversa. Já estão disponíveis para programadores via Gemini API, para empresas em pré-visualização privada e para o público em geral através do Gemini app, Google Workspace e Search.

Pontos-chave

  • O Gemini 3.8 Live Extended Thinking alcançou o primeiro lugar global no índice de qualidade Speech to Speech da Artificial Analysis, com uma pontuação de 82,6, e lidera em conclusão de tarefas agênticas com 68,6% no benchmark tau-Voice e 35,1% no benchmark tau-Voice-banking da Sierra.
  • O Gemini 3.8 Live ocupa o segundo lugar no Speech Agent Arena e mantém um perfil de custo altamente competitivo, posicionando-se como a opção escalável para programadores e empresas que pretendem implementar agentes de voz em produção.
  • Ambos os modelos suportam a deteção e transição automática entre 97 idiomas durante a mesma conversa, sem necessidade de intervenção do utilizador, tornando-os adequados para implementações globais e multilíngues.
  • O Gemini 3.8 Live processa entradas visuais em tempo quase real, permitindo que o modelo enriqueça as respostas com contexto visual, como demonstrado nos exemplos de orientação de onboarding de colaboradores e de jogo de xadrez por voz.
  • O Gemini 3.8 Live Extended Thinking raciocina e fala em simultâneo, utilizando indicações verbais como 'Deixa-me verificar isso...' para manter a fluidez conversacional enquanto executa tarefas complexas em múltiplos passos, incluindo reservas coordenadas e chamadas a funções assíncronas.
  • Todo o áudio gerado por estes modelos é marcado com a tecnologia SynthID da Google, uma marca d'água imperceptível incorporada diretamente no output de áudio para garantir que o conteúdo gerado por IA permanece detetável e contribui para a prevenção de desinformação.

Análise

A apresentação do Gemini 3.8 Live e do 3.8 Live Extended Thinking marca uma transição clara da IA de voz como funcionalidade experimental para uma infraestrutura de produção robusta. O facto de a Google disponibilizar estes modelos simultaneamente para programadores via API, para empresas em pré-visualização privada e para o público geral através de produtos como o Search e o Workspace indica uma estratégia de adoção acelerada, que visa instalar estes modelos como padrão em múltiplos pontos de contacto digitais num prazo muito curto.

A capacidade de executar ferramentas e chamadas a APIs em segundo plano sem interromper a conversa representa uma mudança fundamental no paradigma dos agentes de voz. Até agora, os modelos de voz exigiam que o utilizador aguardasse a conclusão de tarefas antes de poder retomar o diálogo. Com o Gemini 3.8 Live, o modelo pode reconhecer o pedido, continuar a conversa e entregar o resultado da tarefa de forma assíncrona, o que aproxima a experiência de interagir com um assistente humano real e reduz significativamente a fricção percebida.

O desempenho do Gemini 3.8 Live Extended Thinking nos benchmarks selecionados merece atenção específica. A pontuação de 97,7% no Big Bench Audio, combinada com a liderança no tau-Voice e no benchmarkt bancário da Sierra, sugere que este modelo está otimizado para domínios com elevada complexidade de raciocínio, como serviços financeiros, suporte técnico avançado e automação de processos empresariais. Para as agências de marketing, isto significa que clientes em setores regulados ou de elevada especialização poderão implementar agentes de voz autónomos com capacidade de resolução de problemas que antes exigiam intervenção humana.

A integração com plataformas de desenvolvimento como Agora, LangChain, LiveKit e Pipecat, entre outras, bem como parcerias com empresas como Salesforce, Genspark e Lumeris, demonstra que a Google está a construir um ecossistema alargado em torno destes modelos. Este posicionamento cria um efeito de rede que torna mais difícil para os concorrentes replicar não apenas o modelo em si, mas também a integração com infraestruturas de streaming de média em tempo real e com fluxos de trabalho empresariais já estabelecidos.

A marcação de todo o áudio gerado com SynthID é um elemento de conformidade regulatória que ganha crescente importância no contexto europeu, onde a transparência na identificação de conteúdo gerado por IA é cada vez mais um requisito legal. Para as agências que aconselham marcas a usar ferramentas de IA generativa de voz, a existência de um mecanismo de rastreabilidade incorporado no próprio output representa uma garantia adicional de responsabilidade e pode simplificar processos de auditoria interna.

O que fazer

  • Integrar o Gemini 3.8 Live na estratégia de conteúdo conversacional: uma vez que o modelo suporta 97 idiomas e processamento visual em tempo real, as agências devem considerar desenvolver conteúdos e fluxos de resposta otimizados para interações por voz multimodais, especialmente para clientes com audiências internacionais.
  • Testar a Gemini API com casos de uso agênticos específicos para o setor do cliente, nomeadamente fluxos de suporte ao cliente, qualificação de leads por voz e assistência pós-venda, tirando partido da capacidade de chamadas a ferramentas em segundo plano sem interromper a conversa.
  • Monitorizar o impacto do Search Live nos padrões de tráfego orgânico: com o Gemini 3.8 Live integrado no Google Search, as consultas complexas podem ser resolvidas diretamente por voz sem visita ao website, pelo que é essencial auditar quais as páginas mais vulneráveis a este tipo de substituição e reforçar o seu valor diferenciador.
  • Avaliar a adoção do Gemini 3.8 Live Extended Thinking no Google Workspace, concretamente nas funcionalidades Docs Live, Gmail Live e Keep Live, para identificar oportunidades de automatizar fluxos de trabalho editoriais e de produção de conteúdo dentro das equipas de marketing.
  • Incluir a rastreabilidade SynthID nos processos de conformidade e comunicação de IA: ao selecionar ferramentas de geração de voz para campanhas ou produtos, privilegiar soluções que integrem marcas d'água auditáveis, e documentar este critério nas políticas internas de uso responsável de IA generativa.
  • Aproveitar o posicionamento competitivo do Gemini 3.8 Live em termos de custo-eficiência para propor aos clientes projetos-piloto de agentes de voz em escala, dado que o modelo foi explicitamente concebido para implementações de grande volume sem comprometer a qualidade conversacional.
Impacto

A integração destes modelos no Google Search Live e no Google Workspace representa uma evolução direta na forma como os utilizadores interagem com os resultados de pesquisa e com ferramentas de produtividade, o que pode alterar os padrões de consulta e reduzir o tráfego tradicional para conteúdos que respondam a tarefas complexas. As agências de marketing devem antecipar uma maior prevalência de respostas geradas por voz nos pontos de contacto digitais, o que exige adaptar as estratégias de conteúdo para corresponder a consultas conversacionais e multimodais.

Fonte oficial
Não perca nenhuma novidade

Novidades do produto, atualizações de algoritmos e boas práticas, diretamente no seu email.

Voltar ao acompanhamento

Mantenha-se um passo à frente dos algoritmos

O Pulsar acompanha as suas posições Google, a sua visibilidade nas IA e as suas redes sociais num único painel de controlo. 14 dias de teste, sem cartão bancário.

Começar um teste gratuito