شکاف بین گفتگوی انسانی و تعامل با هوش مصنوعی در حال بسته شدن است، اما تأخیر (latency) همچنان مانعی بزرگ برای غوطه‌وری واقعی است. Smallest.ai با فاصله گرفتن از مدل‌های زبانی بزرگ (LLM) سنگین و کند و حرکت به سمت مدل‌های صوتی کوچک، تخصصی و فوق‌سریع که برای تقلید از الگوهای شناختی انسانی طراحی شده‌اند، با این چالش مقابله می‌کند.

عبور از تأخیر مدل‌های زبانی بزرگ

عامل‌های صوتی هوش مصنوعی فعلی اغلب از تأخیر «ابتدا دستور، سپس پردازش» رنج می‌برند. در یک جریان کاری استاندارد LLM، سیستم منتظر می‌ماند تا یک فایل صوتی کامل دریافت شود، متن را پردازش کند و سپس پاسخ را تولید کند. همان‌طور که Sudarshan Kamath، مؤسس و مدیرعامل Smallest.ai اشاره می‌کند، این وقفه نشانه‌ای آشکار است که کاربر در حال صحبت با یک ماشین است.

رویکرد Smallest.ai از نوروبیولوژی انسانی تقلید می‌کند: گوش دادن، فکر کردن و صحبت کردن به‌طور همزمان. مدل صوتی اختصاصی آن‌ها برای مدیریت هوش در لحظه (real-time) با تقریباً صفر بودن تأخیر در پاسخگویی طراحی شده است. این استارتاپ با تمرکز بر مدل‌های کوچک و تخصصی به جای مدل‌های پایه عظیم، قصد دارد امکان قطع کردن صحبت (interruptions) و جریان گفتگوی طبیعی را فراهم کند و به‌طور مؤثر هدف خود را «شکستن آزمون تورینگ» از طریق سرعت و ظرافت قرار داده است.

معماری دو-مدلی برای هوش سازمانی

Smallest.ai در حال پیشنهاد یک استاندارد جدید برای معماری عامل‌های هوش مصنوعی است. این شرکت به جای وادار کردن یک مدل بزرگ واحد برای انجام همه کارها، از یک سیستم دو لایه حمایت می‌کند:

  1. مدل صوتی کوچک (The Small Voice Model): یک لایه هوش در لحظه که ظرافت‌های گفتگوی فوری و روان، از جمله لهجه‌ها، زبان‌های مختلف و محیط‌های پر سر و صدا را مدیریت می‌کند.
  2. مدل زبانی بزرگ «آفلاین» (The "Offline" LLM): یک مدل پایه بزرگتر که تنها زمانی فراخوانده می‌شود که پرسش خارج از پایگاه دانش تخصصی مدل کوچک باشد.

زمانی که مدل کوچک با مسئله‌ای پیچیده روبرو می‌شود، با قرار دادن موقت تماس‌گیرنده در حالت «انتظار» (hold) برای تحقیق درباره موضوع از طریق LLM بزرگتر، از یک عامل انسانی تقلید می‌کند. این رویکرد ترکیبی تضمین می‌کند که تجربه گفتگو حتی زمانی که استدلال سطح بالا مورد نیاز است، بدون وقفه باقی بماند.

جایگاه‌سازی در بازار و چشم‌انداز رقابتی

با جذب سرمایه ۱۳ میلیون دلاری در دور سری A به رهبری Seligman Ventures — که مجموع تأمین مالی را به بیش از ۲۱ میلیون دلار می‌رساند — Smallest.ai در حال تثبیت جایگاه خود به عنوان زیرساخت ضروری برای اقتصاد هوش مصنوعی صوتی است. این استارتاپ به دنبال ساخت پلتفرم‌های پشتیبانی مشتری سرتاسری (end-to-end) نیست؛ در عوض، لایه صوتی تخصصی را فراهم می‌کند که شرکت‌هایی مانند RingCentral و Truecaller در حال حاضر از آن استفاده می‌کنند.

در حالی که رقبایی مانند ElevenLabs تمرکز شدیدی بر دوبله صوتی و پادکست دارند و دیگرانی مانند Cartesia یا Sarvam بازارهای منطقه‌ای خاصی را هدف قرار می‌دهند، Smallest.ai به‌طور دقیق بر عامل‌های گفتگوی سازمانی در لحظه تمرکز کرده است. Kamath استدلال می‌کند که برای استارتاپ‌های پشتیبانی مشتری مانند Sierra و Decagon، بی‌نقص کردن صدای با کیفیت بالا و با تأخیر کم، حواس‌پرتی از کسب‌وکار اصلی آن‌هاست؛ همین امر مدل تخصصی و «آماده استفاده» (plug-and-play) Smallest.ai را به یک ضرورت استراتژیک تبدیل می‌کند.

نکات کلیدی

  • کارایی تخصصی: Smallest.ai از مدل‌های صوتی کوچک و اختصاصی برای دستیابی به تأخیر نزدیک به صفر استفاده می‌کند و از تأخیرهای ذاتی مدل‌های زبانی بزرگ سنتی اجتناب می‌کند.
  • هوش ترکیبی: این شرکت از یک استراتژی دو-مدلی بهره می‌برد؛ استفاده از مدل‌های کوچک و سریع برای تعامل در لحظه و از LLMهای بزرگتر برای وظایف پیچیده و استدلال عمیق.
  • تمرکز بر زیرساخت: Smallest.ai به جای رقابت مستقیم با پلتفرم‌های پشتیبانی مشتری، لایه فناوری صوتی حیاتی را فراهم می‌کند که عامل‌های هوش مصنوعی طبیعی‌تر و انسان‌گونه‌تر را ممکن می‌سازد.

خلاصه نهایی

جذب سرمایه ۱۳ میلیون دلاری Smallest.ai، هزینه‌های یک پشته (stack) هوش مصنوعی صوتی دو-لایه و هدفمند را تأمین می‌کند که جامعیت مدل‌های LLM عظیم را با سرعت مدل‌های کوچک و وظیفه‌محور معاوضه می‌کند. وعده روشن است: با حذف وقفه ناخوشایندی که در حال حاضر ویژگی اکثر دستیارهای صوتی است، مکالمات هوش مصنوعی را به اندازه صحبت با یک انسان طبیعی جلوه دهید. اینکه آیا مزایا بر هزینه‌های مهندسی اضافی غلبه خواهد کرد یا خیر، با شروع شرکت‌ها به ادغام این فناوری در جریان‌های تماس در دنیای واقعی مشخص خواهد شد.