एक voice-AI टीम ने घोषणा की है कि उन्होंने वास्तविक फोन कॉल पर एंड-टू-एंड रिस्पॉन्स लेटेंसी को 1.8 सेकंड से कम कर दिया है—जो उनके पहले प्रोटोटाइप से 55% की कमी है। ओवरलैपिंग प्रोसेसिंग स्ट्रीम्स, एक न्यूरल वॉयस-एक्टिविटी डिटेक्टर, स्ट्रीमिंग टेक्स्ट-टू-स्पीच सिंथेसिस और स्पेक्युलेटिव इंटेंट प्री-फेचिंग ने इस सुधार को संभव बनाया और अपॉइंटमेंट कन्वर्जन रेट में लगभग 30% की वृद्धि की।

वॉइस असिस्टेंट के लिए लेटेंसी क्यों मायने रखती है

लंबे अंतराल कॉल करने वालों को यह सोचने पर मजबूर कर देते हैं कि क्या सिस्टम अभी भी सुन रहा है। शुरुआती परीक्षणों में, प्रोटोटाइप जवाब देने से पहले 2.9 सेकंड तक प्रतीक्षा करता था। कॉल करने वाले अपनी बात दोहराते थे या फोन काट देते थे, जो इस बात का स्पष्ट संकेत था कि लैग (lag) संवाद के प्रवाह को तोड़ रहा था। किसी भी रियल-टाइम सर्विस—जैसे कस्टमर सपोर्ट, बुकिंग, या जानकारी खोजना—के लिए, सन्नाटे का हर एक सेकंड विश्वास कम करता है और कन्वर्जन को घटाता है।

वे तकनीकी बदलाव जिन्होंने एक सेकंड कम कर दिया

टीम ने पूरी तरह से अनुक्रमिक (sequential) पाइपलाइन को छोड़कर प्रत्येक चरण को समानांतर (parallel) रूप से चलाने का निर्णय लिया, जिससे अगले चरण को डेटा मिलते ही वह काम शुरू कर सके।

  • न्यूरल वॉयस-एक्टिविटी डिटेक्शन (VAD)। एक छोटा न्यूरल मॉडल ऑडियो स्ट्रीम पर नज़र रखता है और अनुमान लगाता है कि वक्ता कब वाक्य समाप्त करता है, जिससे डिटेक्शन विंडो लगभग 800 ms से घटकर 280 ms रह गई है।
  • स्ट्रीमिंग टेक्स्ट-टू-स्पीच (TTS)। पूरे टेक्स्ट उत्तर का इंतज़ार करने के बजाय, सिस्टम पहले वाक्यांश को तुरंत सिंथेसाइज़र को स्ट्रीम कर देता है, जिससे बाकी उत्तर तैयार होने के दौरान ही ऑडियो शुरू हो जाता है।
  • स्पेक्युलेटिव इंटेंट प्री-फेचिंग। जब उपयोगकर्ता अभी बोल ही रहा होता है, तब मॉडल संभावित इरादे (intent) का अनुमान लगाता है और बैकएंड से पहले ही जानकारी मांग लेता है। यदि अनुमान सही निकलता है, तो कथन समाप्त होते ही उत्तर तैयार रहता है; यदि यह गलत होता है, तो भी फॉलबैक (fallback) जल्दी आ जाता है।

आंकड़े क्या दर्शाते हैं और आगे क्या देखना है

ओवरलैपिंग डिज़ाइन के साथ, कुल रिस्पॉन्स टाइम 1.8 सेकंड से नीचे आ गया और अपॉइंटमेंट कन्वर्जन रेट में 30% की वृद्धि हुई।

यह दृष्टिकोण जटिलता बढ़ाता है: समानांतर स्ट्रीम्स और स्पेक्युलेटिव क्वेरीज़ अधिक कंप्यूट संसाधनों का उपयोग करती हैं और जब अनुमान गलत हो जाते हैं, तो सावधानीपूर्वक एरर हैंडलिंग की आवश्यकता होती है। इसी रास्ते पर विचार करने वाली टीमों को हार्डवेयर लागत और यूजर एंगेजमेंट में अपेक्षित वृद्धि के बीच संतुलन बनाना होगा।