Tencent цього тижня випустила модель WeMM-Embedding — мультимодальну систему з 2 мільярдами параметрів, яка вже інтегрована в конвеєри пошуку, рекомендацій та електронної комерції WeChat. Цей реліз є важливим, оскільки він демонструє модель, що забезпечує якість пошуку в реальних умовах, низьку затримку та невеликий розмір індексів.
Чому навколо «історії впровадження» такий ажіотаж
Більшість нових моделей ШІ з'являються з блискучими таблицями бенчмарків, які порівнюють показники на підібраних наборах даних. Ці цифри допомагають дослідникам довести свою правоту, але вони рідко транслюються в метрики, що визначають роботу продуктів: швидкість повернення результату запиту, обсяг пам'яті, який споживає індекс, і те, наскільки добре модель справляється з шумним контентом, створеним користувачами. WeMM змінює правила гри, будучи компонентом промислового рівня з першого дня. Це не лабораторний експеримент, що чекає на впровадження іншою командою; вона вже забезпечує роботу Channels, Moments та електронної комерції.
Технічні особливості, на які варто звернути увагу розробникам
Справжня мультимодальність — модель обробляє текст, зображення, відеокадри та мініатюри документів у єдиному просторі ембедінгів. Користувач може ввести «захід сонця» і отримати відповідний відеокліп, фотографію або статтю новин без необхідності з'єднувати окремі конвеєри лише для тексту або лише для зору.
Розмір має значення, але не так, як ви думаєте — з 2 мільярдами параметрів модель є «малою» порівняно з моделями на 9+ мільярдів параметрів, які домінують у рейтингах. Проте вона відповідає бюджетам затримки, необхідним для інтерактивних сервісів. Модель, яка поміщається у ваше обладнання, може перевершити більшу та повільнішу модель у живій системі.
Ембедінги Matryoshka забезпечують гнучкість розмірності — WeMM підтримує ембедінги «Matryoshka», що означає, що одна й та сама мережа може видавати вектори різної довжини, наприклад, 256 або 512 вимірів. Тести показують, що зменшення розмірності з 512 до 256 зберігає майже повну продуктивність пошуку, одночасно скорочуючи використання пам'яті вдвічі, що безпосередньо знижує витрати на зберігання та прискорює пошук найближчих сусідів.
Три прагматичні правила для побудови систем пошуку
Перевіряйте на власних даних — бенчмарки чисті; дані в продакшені — хаотичні. Якщо ваші користувачі завантажують скриншоти, рукописні нотатки або відео низької роздільної здатності, запустіть модель саме на такій сумі, перш ніж вирішувати, чи підходить вона вам.
Розглядайте довжину вектора як важіль витрат — більші вектори збільшують як обчислювальні ресурси, необхідні для пошуку подібності, так і дисковий простір для індексу. Починайте з найменшої розмірності, яка все ще відповідає вашій цільовій якості. Збільшуйте її лише тоді, коли побачите явне падіння повноти (recall) або точності (precision).
Уникайте ізольованих конвеєрів — створення окремих енкодерів для кожної модальності змушує вас вручну розробляти схеми зважування для фінального етапу ранжування. Універсальний шар ембедінгів усуває цей допоміжний код, зменшує інженерні витрати та спрощує A/B тестування.
Ширші наслідки
Для компаній, які покладаються на пошук або рекомендації, вибір моделі ембедінгів може визначати витрати на інфраструктуру. Бюджети затримки стають жорсткішими в міру зростання очікувань користувачів; модель, яка додає навіть кілька мілісекунд до кожного запиту, може виштовхнути сервіс за межі прийнятної продуктивності, що призведе до відтоку клієнтів.
Рішення Tencent відкрити ваги під ліцензією Apache 2.0 також змінює криву витрат для розробників. Замість того, щоб вести переговори про пропрієтарні контракти або створювати модель з нуля, команди можуть завантажити чекпоінт, донавчати його на специфічних для домену даних і оцінювати на кількох випадках помилок.
Де модель може мати недоліки
Модель обробляє чотири модальності — текст, зображення, відео та документи — але не охоплює всі можливі типи вхідних даних.
За чим стежити далі
Висновок
WeMM демонструє, що мультимодальна модель ембедінгів скромного розміру може справлятися з щоденними запитами, якщо вона побудована з урахуванням виробничих обмежень. Для розробників меседж чіткий: надавайте пріоритет якості пошуку в реальних умовах, тримайте розмірність векторів якомога меншою, наскільки це можливо, і об'єднуйте модальності в єдиний шар ембедінгів. Ці рішення дозволять зменшити затримку, скоротити витрати на зберігання та, зрештою, забезпечити кращий досвід для кінцевих користувачів.
