Google lanceert Gemini 3.8 Live en Extended Thinking voor spraakinteractie
AI

Google lanceert Gemini 3.8 Live en Extended Thinking voor spraakinteractie

In het kort

Google DeepMind introduceert twee nieuwe audiomodellen, Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking, die spraakinteractie met AI drastisch verbeteren door vloeiende dialoog, real-time visuele context en meerstapsredenering te combineren. Deze modellen zijn beschikbaar via de Gemini API, Google Workspace, Google Search en de Gemini-app. Voor ontwikkelaars en ondernemingen bieden ze de bouwstenen voor betrouwbare, productieklare voice-agents.

Kernpunten

  • Gemini 3.8 Live Extended Thinking behaalt de eerste plaats in de Artificial Analysis Speech to Speech Quality Index met een score van 82,6 en leidt in agentische taakvoltooiing met 68,6% op de tau-Voice-benchmark.
  • Gemini 3.8 Live ondersteunt automatische taalwisseling tussen 97 talen midden in een gesprek, verwerkt visuele input in bijna real-time en voert API-aanroepen op de achtergrond uit zonder de conversatie te onderbreken.
  • Gemini 3.8 Live Extended Thinking gebruikt vroege verbale signalen zoals 'Laat me dat even nakijken' en live voortgangsnaratie om gebruikers door complexe meerstapstaken te leiden zonder de gespreksflow te onderbreken.
  • Alle door de modellen gegenereerde audio wordt voorzien van een SynthID-watermerk, een onhoorbare markering die AI-gegenereerde inhoud detecteerbaar maakt ter voorkoming van desinformatie.
  • Ontwikkelingsplatformen zoals Agora, LangChain, LiveKit, Pipecat en Vercel integreren de Gemini Live API om ontwikkelaars in staat te stellen hoogwaardige spraakinterfaces te bouwen zonder complexe media-infrastructuur zelf te beheren.
  • De modellen zijn per 15 september 2026 beschikbaar voor ontwikkelaars via de Gemini API en Google AI Studio, en voor eindgebruikers via Gemini Live, Search Live, Gmail, Docs en Keep.

Analyse

De lancering van Gemini 3.8 Live en 3.8 Live Extended Thinking markeert een fundamentele verschuiving in hoe AI-modellen met gesproken taal omgaan. Waar eerdere generaties spraakmodellen tekstgebaseerde redenering vertaalden naar spraak, combineert Gemini 3.8 Live simultaan redeneren en spreken, waardoor de vertraging tussen denken en antwoorden vrijwel verdwijnt. Dit maakt de interactie voor gebruikers aanzienlijk natuurlijker en verlaagt de drempel om complexe taken via spraak te delegeren.

De benchmarkresultaten geven een duidelijk beeld van de positionering van beide modellen. Gemini 3.8 Live Extended Thinking scoort 97,7% op Big Bench Audio en 35,1% op Sierra's tau-Voice-banking benchmark, wat aantoont dat het model niet alleen conversationeel sterk is, maar ook in domeinspecifieke zakelijke toepassingen zoals bankieren en klantenservice betrouwbaar presteert. Gemini 3.8 Live positioneert zich als het schaalbare, kostenefficiënte alternatief voor grootschalige implementaties, wat het toegankelijk maakt voor een breed scala aan ondernemingen.

De integratie in Google Workspace met Docs Live, Gmail Live en Keep Live heeft directe gevolgen voor de manier waarop kenniswerkers documenten opstellen, e-mails verwerken en notities beheren. Spraak wordt een volwaardige productiemethode, niet slechts een dictaatfunctie. Dit versterkt de noodzaak voor organisaties om hun interne workflows en contentstrategie opnieuw te beoordelen in het licht van een spraakgedreven werkplek.

Vanuit een SEO en GEO-perspectief is de uitbreiding van Search Live bijzonder relevant. Gebruikers die via gesproken zoekopdrachten complexe, meerstapsvragen stellen, verwachten directe, conversationele antwoorden. Content die is gestructureerd rondom uitgebreide vragen, stapsgewijze uitleg en concrete antwoorden op specifieke gebruikssituaties sluit beter aan bij de manier waarop Gemini 3.8 Live informatie ophaalt en presenteert. Dit verschuift de optimalisatiefocus van trefwoorddichtheid naar intentiegebaseerde, vraaggerichte contentstructuren.

De introductie van SynthID-watermerking op alle gegenereerde audio is een significante stap op het gebied van transparantie en AI-verantwoordelijkheid. Voor marketeers en communicatieprofessionals die AI-gegenereerde spraakcontent inzetten, betekent dit dat authenticiteit aantoonbaar en controleerbaar wordt. Dit heeft implicaties voor branded content, podcasts en klantenservice-interacties waarbij AI-stemmen worden ingezet, en vraagt om een duidelijk beleid over de inzet en labeling van AI-gegenereerde audiocontent.

Wat te doen

  • Herstructureer bestaande webpagina's en FAQ-secties rondom conversationele, meerstapsvragen die aansluiten bij de manier waarop gebruikers via Search Live zoeken, met aandacht voor volledige zinnen, context en stapsgewijze antwoorden.
  • Verken de Gemini Live API via Google AI Studio om te beoordelen hoe spraakgestuurde interfaces kunnen worden geïntegreerd in bestaande klantenservice- of salesprocessen, en maak gebruik van de private preview van Gemini Enterprise voor een gestructureerde pilotimplementatie.
  • Stel een intern beleid op voor de inzet van AI-gegenereerde audiocontent, inclusief transparantie richting klanten en medewerkers over het gebruik van SynthID-gemarkeerde audio, zodat de organisatie voldoet aan opkomende normen voor AI-verantwoordelijkheid.
  • Monitor de prestaties van voice-gerelateerde zoekterms en gesproken zoekopdrachten in Google Search Console om te beoordelen welke contentformats het beste aansluiten bij de nieuwe Search Live-functionaliteit en pas de contentstrategie hierop aan.
  • Evalueer samenwerkingsplatformen zoals LangChain, Pipecat of LiveKit als tussenlaag voor de implementatie van de Gemini Live API in eigen producten of diensten, zodat de technische complexiteit van real-time media-streaming wordt uitbesteed en de focus kan liggen op de gebruikerservaring.
  • Investeer in de opleiding van marketing- en communicatieteams op het gebied van conversationele AI-interactie, zodat medewerkers begrijpen hoe Gemini 3.8 Live Extended Thinking redenering communiceert en hoe dit de verwachtingen van klanten ten aanzien van AI-interacties verandert.
Impact

De integratie van deze spraakmodellen in Google Search Live en Google Workspace vergroot het belang van gesproken zoekopdrachten en conversationele AI voor SEO-strategie, waarbij content die inspeelt op natuurlijke, gesproken taal en meerstapsvragen aan relevantie wint. Organisaties die voice-agents inzetten voor klantenservice of interne processen kunnen hun zichtbaarheid in AI-gedreven zoekresultaten versterken door te focussen op conversationele, vraaggerichte content.

Officiele bron
Mis geen enkele update

Productnieuws, algoritme-updates en best practices, rechtstreeks in je inbox.

Terug naar het overzicht

Blijf de algoritmes een stap voor

Pulsar volgt uw Google-posities, uw zichtbaarheid in de AI's en uw sociale media in een enkel dashboard. 14 dagen proef, zonder creditcard.

Start een gratis proefperiode