צוות AI קולי הודיע כי הצליח להוריד את שיהוי התגובה (latency) מקצה לקצה בשיחות טלפון אמיתיות למעלה מ-1.8 שניות — ירידה של 55% לעומת אב-הטיפוס הראשון שלו. זרמי עיבוד חופפים, גלאי פעילות קולית עצבי, סינתזה של טקסט לדיבור בסטרימינג (streaming text-to-speech) ומשיכה מוקדמת ספקולטיבית של כוונה (speculative intent pre-fetching) היו הגורמים לשיפור, והעלו את שיעורי ההמרה לקביעת תורים בכ-30%.
למה שיהוי חשוב עבור עוזרים קוליים
הפסקות ארוכות גורמות למתקשרים לתהות אם המערכת עדיין מקשיבה. בבדיקות מוקדמות, אב-הטיפוס המתין 2.9 שניות לפני שענה. המתקשרים חזרו על דבריהם או ניתקו את השיחה, סימן ברור לכך שהעיכוב פגע בזרימה השיחתית. בכל שירות בזמן אמת — שירות לקוחות, הזמנות, חיפוש מידע — כל שנייה של שתיקה שוחקת את האמון ומורידה את יחס ההמרה.
השינויים הטכניים שחסכו שנייה אחת
הצוות זנח את צינור העיבוד (pipeline) הסדרתי והחליט לתת לכל שלב לרוץ במקביל, תוך הזנת השלב הבא ברגע שיש לו מספיק נתונים.
- זיהוי פעילות קולית עצבי (VAD). מודל עצבי קטן עוקב אחר זרם האודיו וחוזה מתי הדובר מסיים משפט, מה שמקצר את חלון הזיהוי מכ-800 מילישניות ל-280 מילישניות בלבד.
- טקסט לדיבור בסטרימינג (TTS). במקום להמתין לתשובה הטקסטואלית המלאה, המערכת מעבירה בסטרימינג את המשפט הראשון לסינתסייזר באופן מיידי, כך שהאודיו מתחיל בזמן ששאר התשובה עדיין נוצרת.
- משיכה מוקדמת ספקולטיבית של כוונה (Speculative intent pre-fetching). בזמן שהמשתמש עדיין מדבר, המודל חוזה את הכוונה הסבירה ומבצע שאילתה ל-backend מראש. אם הניחוש נכון, התשובה מוכנה ברגע שהאמירה מסתיימת; אם הוא שגוי, מנגנון הגיבוי (fallback) עדיין מגיע במהירות.
מה המספרים מראים ומה כדאי לעקוב אחריו בהמשך
בעזרת העיצוב החופף, זמן התגובה הכולל ירד מתחת ל-1.8 שניות ושיעורי ההמרה לקביעת תורים עלו ב-30%.
הגישה הזו מוסיפה מורכבות: זרמים מקבילים ושאילתות ספקולטיביות צורכים יותר כוח מחשוב ודורשים טיפול קפדני בשגיאות כאשר החיזויים אינם מדויקים. צוותים השוקלים את אותו הנתיב חייבים לשקול את עלות החומרה מול השיפור הצפוי במעורבות המשתמשים.
