На этой неделе Tencent представила модель WeMM-Embedding — мультимодальную систему с 2 миллиардами параметров, которая уже интегрирована в процессы поиска, рекомендаций и электронной коммерции WeChat. Этот релиз важен, так как он демонстрирует модель, обеспечивающую реальное качество поиска, низкую задержку и небольшие размеры индексов.

Почему так много шума вокруг «истории внедрения»

Большинство новых моделей ИИ появляются с глянцевыми таблицами бенчмарков, сравнивающими показатели на отобранных наборах данных. Эти цифры помогают исследователям доказать свою правоту, но они редко переводятся в метрики, на которых работают продукты: скорость ответа на запрос, объем потребляемой памяти индексом и то, насколько хорошо модель справляется с зашумленным пользовательским контентом. WeMM меняет правила игры, являясь компонентом промышленного уровня с первого дня. Это не лабораторный эксперимент, ожидающий, когда какая-нибудь команда внедрит его в свои процессы; модель уже работает в Channels, Moments и электронной коммерции.

Технические особенности, на которые стоит обратить внимание разработчикам

  • Настоящая мультимодальность — модель объединяет текст, изображения, видеокадры и миниатюры документов в едином пространстве эмбеддингов. Пользователь может ввести «закат» и получить соответствующий видеоклип, фотографию или новостную статью без необходимости объединять отдельные конвейеры только для текста или только для зрения.

  • Размер имеет значение, но не так, как вы думаете — при 2 млрд параметров модель считается «маленькой» по сравнению с моделями объемом более 9 млрд параметров, которые доминируют в таблицах лидеров. Тем не менее, она укладывается в бюджет задержек, необходимый для интерактивных сервисов. Модель, которая помещается на вашем оборудовании, может превзойти более крупную и медленную модель в реальной системе.

  • Matryoshka-эмбеддинги обеспечивают гибкость размерности — WeMM поддерживает «Matryoshka»-эмбеддинги, что означает, что одна и та же сеть может выдавать векторы разной длины, например, 256 или 512 измерений. Тесты показывают, что снижение размерности с 512 до 256 сохраняет почти всю производительность поиска, сокращая при этом использование памяти вдвое, что напрямую снижает затраты на хранение и ускоряет поиск ближайших соседей.

Три прагматичных правила построения систем поиска

  1. Проверяйте на собственных данных — бенчмарки чистые, а производственные данные — хаотичные. Если ваши пользователи загружают скриншоты, рукописные заметки или видео низкого разрешения, протестируйте модель именно на такой смеси, прежде чем решать, подходит она вам или нет.

  2. Рассматривайте длину вектора как рычаг управления затратами — более длинные векторы увеличивают как вычислительную сложность поиска по сходству, так и дисковое пространство для индекса. Начинайте с минимальной размерности, которая все еще соответствует вашим целевым показателям качества. Увеличивайте её только тогда, когда увидите явное падение полноты (recall) или точности (precision).

  3. Избегайте разрозненных конвейеров — создание отдельных энкодеров для каждой модальности вынуждает вас вручную разрабатывать схемы взвешивания для финального этапа ранжирования. Универсальный слой эмбеддингов устраняет необходимость в таком «связующем» коде, снижает инженерные накладные расходы и упрощает A/B-тестирование.

Более широкие ставки

Для компаний, полагающихся на поиск или рекомендации, выбор модели эмбеддингов может определить расходы на инфраструктуру. Бюджеты на задержку становятся всё более жесткими по мере роста ожиданий пользователей; модель, добавляющая даже несколько миллисекунд к каждому запросу, может вывести сервис за пределы допустимой производительности, что приведет к оттоку пользователей.

Решение Tencent открыть веса под лицензией Apache 2.0 также меняет кривую затрат для разработчиков. Вместо того чтобы вести переговоры о проприетарных контрактах или создавать модель с нуля, команды могут скачать чекпоинт, дообучить его на специфических для их домена данных и оценить его на нескольких проблемных случаях.

Где модель может оказаться недостаточно эффективной

Модель обрабатывает четыре модальности — текст, изображения, видео и документы — но не охватывает все возможные типы входных данных.

За чем следить дальше

Итог

WeMM демонстрирует, что мультимодальная модель эмбеддингов умеренного размера может справляться с ежедневными запросами, если она создана с учетом производственных ограничений. Для разработчиков посыл ясен: отдавайте приоритет качеству поиска в реальных условиях, держите размерность векторов минимально возможной и объединяйте модальности в единый слой эмбеддингов. Эти решения помогут сократить задержки, уменьшить расходы на хранение и, в конечном счете, обеспечить лучший пользовательский опыт.