Команда разработчиков голосового ИИ объявила, что им удалось снизить сквозную задержку ответа при реальных телефонных звонках до менее чем 1,8 секунды — это на 55 % меньше, чем у их первого прототипа. Такого результата удалось достичь благодаря перекрывающимся потокам обработки, нейронному детектору голосовой активности, потоковому синтезу речи и спекулятивному предварительному извлечению намерений, что также повысило коэффициент конверсии в запись примерно на 30 %.

Почему задержка важна для голосовых ассистентов

Длительные паузы заставляют звонящих сомневаться, слушает ли их система. В ходе ранних тестов прототип отвечал с задержкой в 2,9 секунды. Люди повторяли свои слова или вешали трубку — явный признак того, что лаг нарушает естественность беседы. Для любого сервиса, работающего в реальном времени — будь то поддержка клиентов, бронирование или поиск информации — каждая секунда молчания подрывает доверие и снижает конверсию.

Технические улучшения, позволившие сократить время ожидания

Команда отказалась от строго последовательного конвейера обработки в пользу параллельной работы каждого этапа, который передает данные следующему, как только их становится достаточно.

  • Нейронное детектирование голосовой активности (VAD). Небольшая нейронная модель отслеживает аудиопоток и предсказывает, когда говорящий закончит предложение, сокращая окно обнаружения примерно с 800 мс до 280 мс.
  • Потоковый синтез речи (TTS). Вместо того чтобы ждать полного текстового ответа, система немедленно передает первую фразу синтезатору, поэтому аудио начинает воспроизводиться еще в процессе генерации остальной части ответа.
  • Спекулятивное предварительное извлечение намерений. Пока пользователь еще говорит, модель предсказывает вероятное намерение и заранее отправляет запрос к бэкенду. Если догадка верна, ответ готов в тот момент, когда фраза заканчивается; если нет, резервный вариант все равно поступает быстро.

Что говорят цифры и на что обратить внимание в будущем

Благодаря архитектуре с перекрывающимися потоками общее время ответа сократилось до менее чем 1,8 секунды, а коэффициент конверсии в запись вырос на 30 %.

Такой подход усложняет систему: параллельные потоки и спекулятивные запросы потребляют больше вычислительных ресурсов и требуют тщательной обработки ошибок в случае неверных предсказаний. Командам, планирующим использовать этот же путь, придется взвесить затраты на оборудование и ожидаемый рост вовлеченности пользователей.