Розрив між людським спілкуванням та взаємодією з ШІ скорочується, але затримка (latency) залишається головним бар'єром на шляху до справжнього ефекту занурення. Smallest.ai вирішує цю проблему, відмовляючись від масивних і повільних LLM на користь спеціалізованих, надшвидких малих голосових моделей, розроблених для імітації когнітивних патернів людини.

Подолання затримки великих мовних моделей

Сучасні голосові ШІ-агенти часто страждають від затримки за принципом «спочатку запит — потім обробка». У стандартному робочому процесі LLM система чекає на завершення аудіозапису, обробляє текст, а потім генерує відповідь. Як зазначає засновник і генеральний директор Smallest.ai Сударшан Камат (Sudarshan Kamath), ця пауза є явним свідченням того, що користувач спілкується з машиною.

Підхід Smallest.ai імітує людську нейробіологію: одночасне слухання, мислення та говоріння. Їхня власна мала голосова модель розроблена для забезпечення інтелекту в реальному часі з практично нульовою затримкою відповіді. Зосереджуючись на малих спеціалізованих моделях, а не на масивних фундаментальних, стартап прагне забезпечити можливість переривання розмови та природний потік спілкування, фактично намагаючись «пройти тест Тюрінга» завдяки швидкості та нюансам.

Двомодельна архітектура для корпоративного інтелекту

Smallest.ai пропонує новий стандарт архітектури ШІ-агентів. Замість того, щоб змушувати одну велику модель виконувати все, компанія виступає за двоступеневу систему:

  1. Мала голосова модель (The Small Voice Model): рівень інтелекту в реальному часі, який керує безпосередніми, плавними нюансами розмови, включаючи акценти, різні мови та шумне середовище.
  2. «Офлайн» LLM (The "Offline" LLM): більша фундаментальна модель, до якої звертаються лише тоді, коли запит виходить за межі специфічної бази знань малої моделі.

Коли мала модель стикається зі складною проблемою, вона імітує людину-оператора, ненадовго переводячи дзвінок у режим «очікування», щоб дослідити питання за допомогою більшої LLM. Такий гібридний підхід гарантує, що процес спілкування залишається безперервним навіть тоді, коли потрібні високорівневі міркування.

Позиціонування на ринку та конкурентне середовище

Завдяки раунду серії А на суму 13 мільйонів доларів під керівництвом Seligman Ventures — що довело загальний обсяг фінансування до понад 21 мільйона доларів — Smallest.ai позиціонує себе як необхідну інфраструктуру для економіки голосового ШІ. Стартап не прагне створювати комплексні платформи підтримки клієнтів; натомість він надає спеціалізований голосовий рівень, який вже використовують такі компанії, як RingCentral та Truecaller.

У той час як конкуренти, такі як ElevenLabs, зосереджуються на дубляжі аудіо та подкастингу, а інші, як-от Cartesia або Sarvam, орієнтуються на конкретні регіональні ніші, Smallest.ai максимально сфокусована на корпоративних розмовних агентах у реальному часі. Камат стверджує, що для стартапів у сфері підтримки клієнтів, таких як Sierra та Decagon, вдосконалення високоякісного голосу з низькою затримкою є відволіканням від їхньої основної діяльності, що робить спеціалізовану модель Smallest.ai за принципом «підключи та працюй» (plug-and-play) стратегічною необхідністю.

Ключові висновки

  • Спеціалізована ефективність: Smallest.ai використовує малі спеціалізовані голосові моделі для досягнення майже нульової затримки, уникаючи неминучих затримок традиційних великомасштабних LLM.
  • Гібридний інтелект: Компанія застосовує двомодельну стратегію, використовуючи швидкі малі моделі для взаємодії в реальному часі та більші LLM для складних завдань, що потребують глибоких міркувань.
  • Фокус на інфраструктурі: Замість прямої конкуренції з платформами підтримки клієнтів, Smallest.ai надає критично важливий технологічний голосовий рівень, який дозволяє створювати більш природних, схожих на людей ШІ-агентів.

Підсумок

Залучені Smallest.ai 13 мільйонів доларів фінансують спеціально розроблений двоступеневий стек голосового ШІ, який замінює універсальність масивних LLM швидкістю крихітних, орієнтованих на конкретні завдання моделей. Обіцянка зрозуміла: зробити розмови з ШІ такими ж природними, як спілкування з людиною, усунувши незручну паузу, яка наразі притаманна більшості голосових помічників. Чи переваги переважатимуть додаткові інженерні витрати, стане зрозуміло, коли підприємства почнуть впроваджувати цю технологію в реальні потоки дзвінків.