Un team di AI vocale ha annunciato di aver ridotto la latenza di risposta end-to-end nelle chiamate telefoniche reali a meno di 1,8 secondi, un calo del 55% rispetto al primo prototipo. L'integrazione di flussi di elaborazione sovrapposti, un rilevatore neurale dell'attività vocale, la sintesi text-to-speech in streaming e il pre-fetching speculativo dell'intento hanno guidato questo miglioramento, aumentando i tassi di conversione degli appuntamenti di circa il 30%.

Perché la latenza è importante per gli assistenti vocali

Le lunghe pause portano chi chiama a chiedersi se il sistema stia ancora ascoltando. Nei primi test, il prototipo attendeva 2,9 secondi prima di rispondere. Gli utenti ripetevano ciò che avevano detto o riagganciavano, un chiaro segno che il ritardo stava interrompendo il flusso conversazionale. Per qualsiasi servizio in tempo reale — assistenza clienti, prenotazioni, ricerca di informazioni — ogni secondo di silenzio erode la fiducia e riduce le conversioni.

I piccoli accorgimenti tecnici che hanno fatto risparmiare un secondo

Il team ha abbandonato la pipeline strettamente sequenziale, permettendo a ogni fase di operare in parallelo e alimentando la successiva non appena disponeva di dati sufficienti.

  • Rilevamento neurale dell'attività vocale (VAD). Un piccolo modello neurale monitora il flusso audio e prevede quando l'interlocutore termina una frase, riducendo la finestra di rilevamento da circa 800 ms a 280 ms.
  • Sintesi text-to-speech (TTS) in streaming. Invece di attendere l'intera risposta testuale, il sistema invia immediatamente la prima frase al sintetizzatore in streaming, così l'audio inizia mentre il resto della risposta è ancora in fase di generazione.
  • Pre-fetching speculativo dell'intento. Mentre l'utente sta ancora parlando, il modello prevede l'intento probabile e interroga il backend in anticipo. Se la previsione è corretta, la risposta è pronta nel momento in cui termina l'enunciato; se è errata, la risposta di fallback arriva comunque rapidamente.

Cosa dicono i numeri e cosa aspettarsi in futuro

Grazie al design con flussi sovrapposti, il tempo di risposta totale è sceso sotto i 1,8 secondi e i tassi di conversione degli appuntamenti sono aumentati del 30%.

Questo approccio aggiunge complessità: i flussi paralleli e le query speculative consumano più risorse computazionali e richiedono una gestione attenta degli errori nel caso in cui le previsioni falliscano. I team che puntano alla stessa strada devono valutare il costo dell'hardware rispetto al previsto aumento del coinvolgimento degli utenti.