یک تیم هوش مصنوعی صوتی اعلام کرد که تأخیر پاسخ پایانبهپایان (end-to-end) در تماسهای تلفنی واقعی را به زیر ۱.۸ ثانیه رسانده است که نشاندهنده کاهش ۵۵ درصدی نسبت به اولین نمونه اولیه است. جریانهای پردازشی همپوشان، آشکارساز عصبی فعالیت صوتی، سنتز متن به گفتار جریانی و پیشفراخوانی حدسی قصد (speculative intent pre-fetching)، عامل اصلی این پیشرفت و افزایش تقریباً ۳۰ درصدی نرخ تبدیل قرار ملاقاتها بودهاند.
چرا تأخیر برای دستیارهای صوتی اهمیت دارد
مکثهای طولانی باعث میشود تماسگیرندگان شک کنند که آیا سیستم هنوز در حال گوش دادن است یا خیر. در آزمایشهای اولیه، نمونه اولیه ۲.۹ ثانیه قبل از پاسخ دادن منتظر میماند. تماسگیرندگان حرف خود را تکرار میکردند یا تماس را قطع میکردند، که نشانهای واضح از شکستن جریان گفتگو بر اثر تأخیر بود. برای هر نوع خدمت بیدرنگ (real-time)—از پشتیبانی مشتریان گرفته تا رزرو و جستجوی اطلاعات—هر ثانیه سکوت باعث از بین رفتن اعتماد و کاهش نرخ تبدیل میشود.
اصلاحات فنی که یک ثانیه را کاهش داد
تیم از خط لوله (pipeline) کاملاً متوالی دست کشید و اجازه داد هر مرحله به صورت موازی اجرا شود و به محض اینکه دادههای کافی به دست آورد، مرحله بعدی را تغذیه کند.
- آشکارسازی عصبی فعالیت صوتی (VAD). یک مدل عصبی کوچک جریان صوتی را زیر نظر میگیرد و زمان پایان جمله گوینده را پیشبینی میکند، که پنجره آشکارسازی را از حدود ۸۰۰ میلیثانیه به ۲۸۰ میلیثانیه کاهش میدهد.
- متن به گفتار جریانی (TTS). سیستم به جای انتظار برای پاسخ متنی کامل، اولین عبارت را بلافاصله به سنتزکننده ارسال (stream) میکند، بنابراین صوت در حالی که بقیه پاسخ هنوز در حال تولید است، شروع میشود.
- پیشفراخوانی حدسی قصد (Speculative intent pre-fetching). در حالی که کاربر هنوز در حال صحبت است، مدل قصد احتمالی او را پیشبینی کرده و از قبل از بخش بکاند (backend) پرسوجو میکند. اگر حدس درست باشد، پاسخ در لحظه پایان صحبت کاربر آماده است؛ اگر اشتباه باشد، پاسخ جایگزین (fallback) همچنان سریع ارائه میشود.
اعداد چه میگویند و در آینده باید به چه چیزی توجه کرد
با طراحی همپوشان، زمان کل پاسخ به زیر ۱.۸ ثانیه کاهش یافت و نرخ تبدیل قرار ملاقات ۳۰ درصد افزایش یافت.
این رویکرد پیچیدگی را افزایش میدهد: جریانهای موازی و پرسوجوهای حدسی، منابع محاسباتی بیشتری مصرف میکنند و در صورت اشتباه بودن پیشبینیها، نیازمند مدیریت خطای دقیق هستند. تیمهایی که به دنبال مسیر مشابهی هستند، باید هزینه سختافزار را در برابر افزایش مورد انتظار در تعامل کاربر بسنجند.
