הפער בין שיחה אנושית לאינטראקציה עם בינה מלאכותית מצטמצם, אך השיהוי (latency) נותר חסם מרכזי להשגת חוויה סוחפת (immersion) אמיתית. Smallest.ai מתמודדת עם האתגר הזה על ידי מעבר מ-LLMs מאסיביים ואיטיים למודלי קול קטנים, ייעודיים ומהירים במיוחד, שנועדו לחקות דפוסי קוגניציה אנושיים.

מעבר לשיהוי של מודלי שפה גדולים

סוכני קול מבוססי בינה מלאכותית כיום סובלים לעיתים קרובות מעיכוב של "הנחיה ואז עיבוד" (prompt-then-process). בתהליך עבודה סטנדרטי של LLM, המערכת ממתינה לקליפ שמע שלם, מעבדת את הטקסט ולאחר מכן מייצרת תגובה. כפי שמציין Sudarshan Kamath, המייסד והמנכ"ל של Smallest.ai, ההפסקה הזו היא סימן מובהק לכך שהמשתמש מדבר עם מכונה.

הגישה של Smallest.ai מחקה את הנוירוביולוגיה האנושית: הקשבה, חשיבה ודיבור בו-זמנית. מודל הקול הקטן והקנייני שלהם תוכנן לטפל באינטליגנציה בזמן אמת עם השהיית תגובה אפסית כמעט. על ידי התמקדות במודלים קטנים וייעודיים במקום במודלים בסיסיים (foundational) מאסיביים, הסטארט-אפ שואף לאפשר הפרעות לשיחה וזרימה טבעית, במטרה למעשה "לפרוץ את מבחן טורינג" באמצעות מהירות ודיוק (nuance).

ארכיטקטורת מודל כפול עבור אינטליגנציה ארגונית

Smallest.ai מציעה סטנדרט חדש לארכיטקטורה של סוכני AI. במקום לאלץ מודל גדול אחד לטפל בהכל, החברה דוגלת במערכת דו-שכבתית:

  1. מודל הקול הקטן: שכבת אינטליגנציה בזמן אמת המנהלת את הניואנסים השיחתיים המיידיים והזורמים, כולל מבטאים, שפות מגוונות וסביבות רועשות.
  2. ה-LLM ה"אופליין": מודל בסיסי (foundational) גדול יותר שנקרא לשימוש רק כאשר השאילתה חורגת מבסיס הידע הספציפי של המודל הקטן.

כאשר המודל הקטן נתקל בבעיה מורכבת, הוא מחקה סוכן אנושי על ידי השארת המתקשר ב"המתנה" לזמן קצר כדי לחקור את הנושא באמצעות ה-LLM הגדול יותר. גישה היברידית זו מבטיחה שחוויית השיחה תישאר רציפה גם כאשר נדרשת חשיבה (reasoning) ברמה גבוהה.

מיצוב שוק ונוף תחרותי

עם סבב גיוס Series A של 13 מיליון דולר בהובלת Seligman Ventures — המביא את סך המימון ליותר מ-21 מיליון דולר — Smallest.ai ממצבת את עצמה כתשתית החיונית לכלכלת ה-voice AI. הסטארט-אפ אינו שואף לבנות פלטפורמות תמיכה בלקוחות מקצה לקצה; במקום זאת, הוא מספק את שכבת הקול הייעודית שחברות כמו RingCentral ו-Truecaller כבר משתמשות בה.

בעוד שמתחרים כמו ElevenLabs מתמקדים רבות בדיבוב אודיו ופודקאסטים, ואחרים כמו Cartesia או Sarvam מכוונים לנישות אזוריות ספציפיות, Smallest.ai ממוקדת באופן חד בשיחות בזמן אמת עבור סוכנים ארגוניים. Kamath טוען שעבור סטארט-אפים של תמיכה בלקוחות כמו Sierra ו-Decagon, השגת קול באיכות גבוהה (high-fidelity) ובשיהוי נמוך היא הסחת דעת מהליבה העסקית שלהם, מה שהופך את מודל ה-"plug-and-play" הייעודי של Smallest.ai לצורך אסטרטגי.

נקודות מפתח

  • יעילות ייעודית: Smallest.ai משתמשת במודלי קול קטנים וייעודיים כדי להשיג שיהוי אפסי כמעט, תוך הימנעות מהעיכובים המובנים של LLMs מסורתיים בקנה מידה גדול.
  • אינטליגנציה היברידית: החברה מיישמת אסטרטגיית מודל כפול, תוך שימוש במודלים קטנים ומהירים לאינטראקציה בזמן אמת וב-LLMs גדולים יותר למשימות מורכבות הדורשות חשיבה עמוקה.
  • התמקדות בתשתית: במקום להתחרות ישירות בפלטפורמות תמיכה בלקוחות, Smallest.ai מספקת את שכבת טכנולוגיית הקול הקריטית המאפשרת סוכני AI טבעיים ודמויי אדם יותר.

שורה תחתונה

הגיוס של Smallest.ai בסך 13 מיליון דולר מממן מחסנית (stack) voice-AI דו-שכבתית שנבנתה למטרה זו, אשר מחליפה את האוניברסליות של LLMs מאסיביים במהירות של מודלים זעירים וממוקדי-משימה. ההבטחה ברורה: להפוך את שיחות ה-AI לטבעיות כמו שיחה עם אדם על ידי ביטול ההפסקה המביכה שמגדירה כיום את רוב העוזרים הקוליים. האם היתרונות יעלו על העומס ההנדסי הנוסף יהפוך לברור כאשר ארגונים יתחילו להטמיע את הטכנולוגיה בתהליכי שיחות בעולם האמיתי.