ایک وائس-AI ٹیم نے اعلان کیا ہے کہ اس نے حقیقی فون کالز پر اینڈ-ٹو-اینڈ رسپانس لیٹنسی (جواب دینے میں ہونے والی تاخیر) کو 1.8 سیکنڈ سے کم کر دیا ہے—جو کہ اس کے پہلے پروٹو ٹائپ کے مقابلے میں 55% کمی ہے۔ اوورلیپنگ پروسیسنگ اسٹریمز، ایک نیورل وائس-ایکٹیویٹی ڈیٹیکٹر، اسٹریمنگ ٹیکسٹ-ٹو-اسپیچ سنتھیسز، اور سپیکیلیٹیو انٹینٹ پری-فیچنگ نے اس بہتری میں اہم کردار ادا کیا اور اپائنٹمنٹ کنورژن ریٹس میں تقریباً 30% کا اضافہ کیا۔
وائس اسسٹنٹس کے لیے لیٹنسی کیوں اہم ہے
طویل وقفے کال کرنے والوں کو یہ سوچنے پر مجبور کر دیتے ہیں کہ آیا سسٹم اب بھی سن رہا ہے یا نہیں۔ ابتدائی تجربات میں، پروٹو ٹائپ جواب دینے سے پہلے 2.9 سیکنڈ تک انتظار کرتا تھا۔ کال کرنے والے اپنی بات دہراتے یا فون کاٹ دیتے، جو کہ اس بات کی واضح علامت تھی کہ تاخیر (lag) گفتگو کے بہاؤ کو متاثر کر رہی ہے۔ کسی بھی ریئل ٹائم سروس—جیسے کسٹمر سپورٹ، بکنگ، یا معلومات تلاش کرنے کے لیے—خاموشی کا ہر ایک سیکنڈ اعتماد کو کم کرتا ہے اور کنورژن کو متاثر کرتا ہے۔
وہ تکنیکی تبدیلیاں جنہوں نے ایک سیکنڈ کم کر دیا
ٹیم نے مکمل طور پر ترتیب وار (sequential) پائپ لائن کا طریقہ چھوڑ دیا اور ہر مرحلے کو متوازی (parallel) طور پر چلنے دیا، تاکہ جیسے ہی ڈیٹا کافی مقدار میں دستیاب ہو، اگلے مرحلے کو فراہم کیا جا سکے۔
- نیورل وائس-ایکٹیویٹی ڈیٹیکشن (VAD)۔ ایک چھوٹا نیورل ماڈل آڈیو اسٹریم پر نظر رکھتا ہے اور پیش گوئی کرتا ہے کہ بولنے والا جملہ کب ختم کرے گا، جس سے ڈیٹیکشن ونڈو تقریباً 800 ms سے کم ہو کر 280 ms رہ گئی ہے۔
- اسٹریمنگ ٹیکسٹ-ٹو-اسپیچ (TTS)۔ مکمل ٹیکسٹ جواب کا انتظار کرنے کے بجائے، سسٹم پہلے جملے کو فوری طور پر سنتھیسائزر کو بھیج دیتا ہے، تاکہ جب تک باقی جواب تیار ہو رہا ہو، آڈیو شروع ہو جائے۔
- سپیکیلیٹیو انٹینٹ پری-فیچنگ۔ جب صارف ابھی بات کر رہا ہوتا ہے، تو ماڈل ممکنہ مقصد (intent) کی پیش گوئی کرتا ہے اور پہلے سے ہی بیک اینڈ سے معلومات حاصل کر لیتا ہے۔ اگر اندازہ درست ہو، تو جملہ ختم ہوتے ہی جواب تیار ہوتا ہے؛ اور اگر غلط ہو، تب بھی متبادل جواب (fallback) تیزی سے پہنچ جاتا ہے۔
اعداد و شمار کیا ظاہر کرتے ہیں اور آگے کیا دیکھنا ہے
اوورلیپنگ ڈیزائن کے ساتھ، کل رسپانس ٹائم 1.8 سیکنڈ سے کم ہو گیا اور اپائنٹمنٹ کنورژن ریٹس میں 30% کا اضافہ ہوا۔
یہ طریقہ کار پیچیدگیوں میں اضافہ کرتا ہے: متوازی اسٹریمز اور سپیکیلیٹیو کوئریز زیادہ کمپیوٹنگ پاور استعمال کرتی ہیں اور پیش گوئی غلط ہونے کی صورت میں احتیاط سے غلطیوں کو سنبھالنے (error handling) کا تقاضا کرتی ہیں۔ جو ٹیمیں اسی راستے پر چلنے کا ارادہ رکھتی ہیں، انہیں ہارڈ ویئر کی لاگت اور صارف کی شمولیت (user engagement) میں متوقع اضافے کے درمیان توازن قائم کرنا ہوگا۔
