Google heeft afgelopen dinsdag Gemini 3.5 Transcribe gelanceerd. Het spraak-naar-tekstmodel verwijdert stopwoorden, respecteert door de gebruiker opgegeven woordenschatten en labelt tot drie sprekers in een enkele opname. Door ruwe audio om te zetten in gepolijste, gestructureerde tekst zonder menselijke redacteur, vermindert de dienst de tijd die ontwikkelaars besteden aan het opschonen van transcripties voor vergaderverslagen, juridische documenten en meer.

Waarom Google nu de knop indrukte

De audioverwerkingsstack van Google evolueert al jaren, maar de eerdere aanbieding, Chirp 3, struikelde nog steeds over pauzes, technische termen en wisselingen tussen sprekers. Thuiswerken en podcasting hebben de transcriptiemarkt doen groeien, maar veel ondernemingen vertrouwen nog steeds op handmatige nabewerking of dure nicheleveranciers. Gemini 3.5 Transcribe lost dat knelpunt op: een model dat spraak niet alleen herkent, maar deze ook direct bewerkt.

Wat het nieuwe model daadwerkelijk doet

  • Automatische verwijdering van stopwoorden – "um", "uh" en soortgelijke haperingen verdwijnen terwijl de transcriptie wordt gegenereerd, wat zorgt voor een schonere tekst.
  • Aangepaste woordenschatten – Gebruikers kunnen een lijst met domeinspecifieke woorden uploaden, waardoor het model deze niet "corrigeert" naar algemene termen. Dit is belangrijk voor vakgebieden die vol staan met afkortingen, productnamen of buitenlandse spellingen.
  • Sprekerstoeschrijving – Het systeem identificeert tot drie verschillende stemmen, wijst aan elke uiting een label toe en voegt een tijdstempel op woordniveau toe. Juridische teams, medische verslaggevers en journalisten kunnen direct vanuit het bronbestand tijdgecodeerde verslagen maken.
  • Meertalige reikwijdte – Google claimt een verbeterde nauwkeurigheid in meer dan 85 talen, een stap vooruit ten opzichte van de beperktere set van de voorganger.

Al deze mogelijkheden zijn beschikbaar via een API die gericht is op ontwikkelaars. Apps vragen een transcriptie aan en ontvangen een JSON-payload die de schoongemaakte tekst, sprekerslabels en tijdstempels al bevat.

De bredere Gemini audio-uitrol

Gemini 3.5 Transcribe maakt deel uit van een bredere familie van audiomodellen:

  • Gemini 3.5 Live – Geoptimaliseerd voor interactie in realtime; het gaat beter om met onderbrekingen midden in een zin dan eerdere live-modellen.
  • Gemini 3.5 Live Experimental – Een variant met een hoger redeneerpeil die zijn eigen stapsgewijze denkproces verwoordt terwijl het complexe taken oplost.

Beide live-modellen zijn momenteel beschikbaar in het Engels in de macOS Gemini-app en via de Rambler-dicteerfunctie op Android in een handvol regio's.

Wie profiteert hiervan

Ontwikkelaars kunnen een "clean-as-you-speak"-pipeline integreren in samenwerkingstools, platforms voor contentcreatie en spraakgestuurde assistenten. Ondernemingen kunnen kant-en-klare transcripties genereren, waardoor de afhankelijkheid van externe diensten die per minuut rekenen en strikte clausules voor gegevensverwerking opleggen, afneemt. Contentcreators kunnen gepolijste ondertiteling publiceren zonder een aparte bewerkingsronde, wat de doorlooptijd van video's en podcasts versnelt.

Wie de gevolgen kan voelen

Gespecialiseerde transcriptieleveranciers die premiumtarieven rekenen voor sprekerdiarizatie en het omgaan met jargon, kunnen een daling in de vraag zien, vooral bij kostengevoelige startups. De limiet van drie sprekers van het model kan grotere organisaties ook richting dedicated oplossingen duwen die meer deelnemers in een enkel gesprek ondersteunen.

Beperkingen en open vragen

  • Aantal sprekers – Er kunnen slechts drie sprekers per bestand worden onderscheiden; vergaderingen met grotere groepen zullen nog steeds externe hulpmiddelen nodig hebben.
  • Taaluitrol – Meertalige ondersteuning is aangekondigd, maar de live-modellen blijven beperkt tot het Engels, waardoor niet-Engelstalige gebruikers moeten wachten op volledige functionaliteit.
  • Privacy – Zoals bij elke cloudgebaseerde spraakdienst moeten ondernemingen het gemak van de infrastructuur van Google afwegen tegen de noodzaak om gevoelige audio van externe servers weg te houden. De voorwaarden van Google staan on-premise implementatie toe voor bepaalde klanten, maar die optie is nog niet publiek beschikbaar.

Waar we op moeten letten

Google heeft hints gegeven over toekomstige updates die de limiet voor het aantal sprekers zullen verhogen en de dekking van live-modellen zullen uitbreiden naar extra talen. Het in de gaten houden van de prijsniveaus van de API zal ook essentieel zijn; hoge kosten per minuut kunnen de productiviteitswinst voor gebruikers met een hoog volume tenietdoen. Tot slot zal de adoptiecurve onder ontwikkelaars onthullen of het gemak van automatische stopwoordverwijdering opweegt tegen eventuele resterende fouten in niche-woordenschatten.

Kernpunt: Gemini 3.5 Transcribe verandert de tijdrovende taak van het verfijnen van gesproken opnames in een enkele API-aanroep, waardoor ontwikkelaars een kant-en-klare tool krijgen voor heldere tekst met sprekerslabels. Het succes ervan hangt af van hoe snel Google de taalondersteuning uitbreidt, de limiet voor het aantal sprekers verhoogt en de privacyzorgen van bedrijven wegneemt.