एका व्हॉइस-AI टीमने जाहीर केले आहे की त्यांनी प्रत्यक्ष फोन कॉल्सवरील एंड-टू-एंड प्रतिसाद विलंब (latency) १.८ सेकंदांच्या खाली आणला आहे—जो त्यांच्या पहिल्या प्रोटोटाइपपेक्षा ५५% कमी आहे. ओव्हरलॅपिंग प्रोसेसिंग स्ट्रीम्स, न्यूरल व्हॉइस-ॲक्टिव्हिटी डिटेक्टर, स्ट्रीमिंग टेक्स्ट-टू-स्पीच सिंथेसिस आणि स्पेक्युलेटिव्ह इंटेंट प्री-फेचिंगमुळे ही सुधारणा झाली असून अपॉइंटमेंट कन्व्हर्जन रेट्समध्ये अंदाजे ३०% वाढ झाली आहे.

व्हॉइस असिस्टंटसाठी लॅटन्सी (latency) का महत्त्वाची आहे

दीर्घ विरामामुळे (pauses) कॉल करणाऱ्यांना वाटते की सिस्टम अजूनही ऐकत आहे की नाही. सुरुवातीच्या चाचण्यांमध्ये, प्रोटोटाइप उत्तर देण्यापूर्वी २.९ सेकंद थांबत असे. कॉल करणारे लोक आपली गोष्ट पुन्हा पुन्हा सांगत किंवा फोन कट करत, जे या विलंबामुळे संवादाचा ओघ खंडित होत असल्याचे स्पष्ट लक्षण होते. कोणत्याही रिअल-टाइम सेवेसाठी—कस्टमर सपोर्ट, बुकिंग, माहिती शोधणे—शांततेचा प्रत्येक सेकंद विश्वास कमी करतो आणि कन्व्हर्जन घटवतो.

एक सेकंद कमी करणारे तांत्रिक बदल

टीमने केवळ क्रमवार (sequential) पाइपलाइन वापरणे थांबवले आणि प्रत्येक टप्पा समांतर (parallel) पद्धतीने चालण्यास भाग पाडले, ज्यामुळे पुरेसा डेटा उपलब्ध होताच पुढचा टप्पा सुरू होऊ शकतो.

  • न्यूरल व्हॉइस-ॲक्टिव्हिटी डिटेक्शन (VAD). एक लहान न्यूरल मॉडेल ऑडिओ स्ट्रीमवर लक्ष ठेवते आणि वक्ता वाक्य कधी संपवेल याचा अंदाज लावते, ज्यामुळे डिटेक्शन विंडो सुमारे ८०० ms वरून २८० ms पर्यंत कमी झाली आहे.
  • स्ट्रीमिंग टेक्स्ट-टू-स्पीच (TTS). पूर्ण मजकूर स्वरूपातील उत्तराची वाट न पाहता, सिस्टम पहिल्या वाक्याचा भाग त्वरित सिंथेसायझरकडे स्ट्रीम करते, जेणेकरून उर्वरित उत्तर तयार होत असतानाच ऑडिओ सुरू होतो.
  • स्पेक्युलेटिव्ह इंटेंट प्री-फेचिंग. वापरकर्ता बोलत असतानाच, मॉडेल संभाव्य हेतूचा (intent) अंदाज लावते आणि आगाऊ बॅकएंडला क्वेरी करते. जर अंदाज बरोबर असेल, तर बोलणे संपताच उत्तर तयार असते; जर अंदाज चुकला, तरीही पर्यायी उत्तर (fallback) वेगाने मिळते.

आकडेवारी काय दर्शवते आणि पुढे काय पाहावे

ओव्हरलॅपिंग डिझाइनमुळे, एकूण प्रतिसाद वेळ १.८ सेकंदांच्या खाली आला आणि अपॉइंटमेंट कन्व्हर्जन रेट्समध्ये ३०% वाढ झाली.

हा दृष्टिकोन गुंतागुंत वाढवतो: पॅरलल स्ट्रीम्स आणि स्पेक्युलेटिव्ह क्वेरीज अधिक कॉम्प्युट (compute) वापरतात आणि अंदाज चुकल्यास काळजीपूर्वक एरर हँडलिंगची (error handling) आवश्यकता असते. याच मार्गाचा विचार करणाऱ्या टीम्सनी हार्डवेअर खर्च आणि युजर एंगेजमेंटमधील अपेक्षित वाढ यांचा समतोल राखणे आवश्यक आहे.