De voice-agent die we bijna gingen lanceren, onderbrak beller voortdurend, waardoor het afkappercentage naar 18% steeg en we slechts tien dagen voor de lancering de end-of-turn logica moesten herschrijven. Door grammaticale controles en back-channel detectie toe te voegen aan de stilte-timeout regel, brachten we de onderbrekingen terug naar 3% en elimineerden we de lange, doodse stiltes die het systeem ongevoelig maakten.

Waarom een enkele stilte-timeout niet genoeg was

Ons oorspronkelijke ontwerp beschouwde elke pauze van 700 ms als een signaal dat de gebruiker klaar was met praten. In een gecontroleerde demo — één spreker die volledige zinnen uitspreekt in een stille kamer — werkt die regel prima. Echte beller pauzeren echter om na te denken, breken getallen op in groepen en voegen "uh-huh" of "mm-hmm" toe om te laten zien dat ze luisteren. De agent interpreteerde elke pauze als het einde van een beurt.

Analyse van 312 productiegesprekken onthulde twee problemen. Ten eerste praatte de agent erdoorheen terwijl de spreker nog bezig was met het formuleren van de volgende zin, wat 18% van de beurten verpestte. Ten tweede, toen we de timeout verhoogden naar 1500 ms om de onderbrekingen te stoppen, werd het systeem traag en begon het te hangen op luidruchtige lijnen. Achtergrondruis bleef de stilte-teller resetten, waardoor de agent nooit besloot dat de gebruiker klaar was.

Drie signalen vervangen één enkel getal

We stapten af van een vaste timeout en bouwden een kleine state machine die drie signalen in de gaten houdt:

  • Stilte-duur – hoe lang de gebruiker al stil is.
  • Grammatica – eindigt het transcript met een volledige syntactische eenheid of een loshangend woord zoals "de" of "en"?
  • Back-channel detectie – was het laatste geluid een echte beurt (bijv. een gesproken antwoord) of een korte bevestiging zoals "ja"?

Met deze signalen definieerden we twee stiltebudgetten:

  1. Voltooid transcript – wanneer de geparseerde tekst af lijkt, passen we een korte timeout van 550 ms toe. De agent blijft vlot en reageert direct.
  2. Loshangend transcript – wanneer het laatste token suggereert dat de gebruiker midden in een zin zit, verlengen we de timeout naar 1300 ms, zodat de spreker de ruimte krijgt om door te gaan.

Twee extra beveiligingen voorkomen valse onderbrekingen:

  • Minimale spraakduur – een kort "mm-hmm" telt niet als een volledige beurt, dus de agent wacht op een langere uiting voordat hij een beslissing neemt.
  • Harde limiet – ongeacht de achtergrondruis dwingt een maximale stilte-limiet de agent om na een redelijke periode te reageren, om eindeloos hangen te voorkomen.

Resultaten en de betekenis voor voice AI

Nadat we het systeem met drie signalen hebben uitgerold, daalde het afkappercentage van 18% naar 3%. Beller hoorden de agent niet langer door hen heen praten, en het eerdere probleem van de "dode stilte" verdween. De agent voelt zowel responsief als beleefd aan, passend bij hoe mensen gespreksbeurten beheren.

Voor ontwikkelaars die voice assistants bouwen, is de les duidelijk: een enkele constante in een configuratiebestand kan de nuances van gesproken interactie niet vangen. Een lichtgewicht state machine die de stilte-duur, grammaticale volledigheid en back-channel signalen evalueert, kan de nauwkeurigheid van het beurtwisselen drastisch verbeteren zonder een zware computationele belasting toe te voegen.

Mogelijke nadelen en open vragen

Het toevoegen van grammaticale parsing en back-channel classificatie voegt verwerkingstappen toe. Teams moeten controleren of de extra latentie de winst in gespreksvloeiendheid niet tenietdoet. De aanpak leunt ook op een redelijk nauwkeurig transcript; in luidruchtige omgevingen of bij spraak met een accent kunnen grammaticale signalen tekortschieten, waardoor het systeem moet terugvallen op langere timeouts.

Toekomstig werk zou adaptieve timeout-drempels kunnen verkennen die leren van de gewoonten van individuele beller, of prosodische kenmerken (toonhoogte, energie) kunnen integreren om de back-channel detector te versterken. Het monitoren van hoe deze verfijningen belangrijke statistieken beïnvloeden — klanttevredenheid, gespreksduur en foutpercentages — zal essentieel zijn voordat de techniek wordt opgeschaald naar grotere contactcenter-implementaties.

Kernpunt: Het behandelen van beurtvoltooiing als een beslissing op basis van meerdere signalen, in plaats van een enkele stilte-timer, vermindert onderbrekingsfouten met een factor tien en herstelt de natuurlijke flow die gebruikers van voice agents verwachten.