أعلن فريق ذكاء اصطناعي صوتي عن نجاحه في خفض زمن استجابة الطرف إلى الطرف (end-to-end) في المكالمات الهاتفية الحقيقية إلى أقل من 1.8 ثانية، وهو ما يمثل انخفاضاً بنسبة 55% عن نموذجه الأولي الأول. وقد ساهمت تدفقات المعالجة المتداخلة، والكاشف العصبي لنشاط الصوت، وتوليد الكلام من النص عبر البث (streaming text-to-speech)، والاستدعاء المسبق التخميني للقصد (speculative intent pre-fetching) في تحقيق هذا التقدم، مما أدى إلى رفع معدلات تحويل المواعيد بنسبة 30% تقريباً.
لماذا يهم زمن الاستجابة للمساعدات الصوتية
تجعل التوقفات الطويلة المتصلين يتساءلون عما إذا كان النظام لا يزال يستمع. في الاختبارات المبكرة، كان النموذج الأولي ينتظر 2.9 ثانية قبل الرد، مما دفع المتصلين لتكرار كلامهم أو إنهاء المكالمة، وهي علامة واضحة على أن التأخير كان يقطع تدفق المحادثة. بالنسبة لأي خدمة في الوقت الفعلي — مثل دعم العملاء، أو الحجز، أو البحث عن المعلومات — فإن كل ثانية من الصمت تقوض الثقة وتقلل من معدلات التحويل.
التعديلات التقنية التي اختصرت ثانية كاملة
تخلى الفريق عن سلسلة العمليات المتسلسلة بدقة، وسمح لكل مرحلة بالعمل بالتوازي، بحيث تغذي المرحلة التالية بمجرد حصولها على قدر كافٍ من البيانات.
- الكشف العصبي عن نشاط الصوت (VAD). يقوم نموذج عصبي صغير بمراقبة البث الصوتي والتنبؤ بالوقت الذي ينهي فيه المتحدث جملته، مما قلص نافذة الكشف من حوالي 800 مللي ثانية إلى 280 مللي ثانية.
- تحويل النص إلى كلام عبر البث (TTS). بدلاً من انتظار الإجابة النصية الكاملة، يقوم النظام ببث العبارة الأولى إلى المُخلق الصوتي فوراً، بحيث يبدأ الصوت بينما لا تزال بقية الإجابة قيد التوليد.
- الاستدعاء المسبق التخميني للقصد. بينما لا يزال المستخدم يتحدث، يتنبأ النموذج بالقصد المحتمل ويستعلم من النظام الخلفي (backend) مسبقاً. إذا كان التخمين صحيحاً، تكون الإجابة جاهزة في اللحظة التي ينتهي فيها النطق؛ وإذا كان خاطئاً، فإن الحل البديل يصل بسرعة أيضاً.
ما تظهره الأرقام وما يجب مراقبته لاحقاً
بفضل التصميم المتداخل، انخفض إجمالي وقت الاستجابة إلى أقل من 1.8 ثانية، وارتفعت معدلات تحويل المواعيد بنسبة 30%.
يضيف هذا النهج نوعاً من التعقيد؛ فالتدفقات المتوازية والاستعلامات التخمينية تستهلك قدرات حوسبة أكبر وتتطلب معالجة دقيقة للأخطاء عندما تخطئ التوقعات. لذا، يجب على الفرق التي تسعى لسلوك المسار نفسه الموازنة بين تكلفة الأجهزة والزيادة المتوقعة في تفاعل المستخدمين.
