Найпопулярніша модель на Hugging Face — це зовсім не чат-бот, а модель sentence-embedding із 22 мільйонами параметрів, випущена у 2021 році, яку завантажили 256 мільйонів разів. Ці цифри свідчать про просту річ: більшість реальних робочих навантажень ШІ виконуються на крихітних, придатних для CPU моделях, а не на великих мовних моделях (LLM), які привертають увагу заголовків.
Три моделі, що домінують у продакшені
all-MiniLM-L6-v2 – 256 мільйонів завантажень
Ця модель із 22 млн параметрів перетворює фрагмент тексту на щільний вектор. Вектор можна порівнювати з іншими для вимірювання схожості, що є основою для семантичного пошуку, рекомендаційних систем та конвеєрів виявлення дублікатів.
Чому вона всюди:
- Працює на CPU — дорогий GPU не потрібен.
- Швидка для пакетної обробки — може створювати ембедінги для мільйонів речень за лічені хвилини.
- Безкоштовне локальне розміщення — усуває витрати на хмарні сервіси та проблеми з конфіденційністю даних.
cross-encoder/ms-marco-MiniLM-L6-v2 – 87 мільйонів завантажень
Ця модель діє як реранкер. Вона приймає запит і потенційний документ разом і повертає оцінку релевантності. У типовому RAG-стеку робочий процес виглядає так:
- Швидкий етап — MiniLM відбирає 50 найкращих кандидатів.
- Точний етап — перерахунок оцінок (rescoring) цих 50 елементів за допомогою cross-encoder покращує якість відповіді.
Менша кількість «лайків» на сторінці моделі свідчить про те, що більшість користувачів викликають її програмно, а не переглядають хаб, проте обсяг завантажень підтверджує її статус фактичного інструменту для підвищення точності в робочих конвеєрах.
amazon/chronos-2 – 35 мільйонів завантажень
Chronos-2 сприймає дані часових рядів як текст, дозволяючи єдиній базовій моделі прогнозувати продажі, навантаження на сервер або будь-який числовий сигнал без спеціального навчання під конкретне завдання. Кількість завантажень у десятки мільйонів для спеціалізованого прогнозатора свідчить про великий попит на рішення за принципом «навчіть один раз, запускайте будь-де», особливо в організаціях, які інакше змушені були б підтримувати цілий «зоопарк» індивідуальних моделей для кожного показника.
Що ці цифри означають для ШІ-команд
Графіки завантажень виявляють розрив між медійним хайпом та операційною реальністю. LLM домінують у пресрелізах, але справжніми «робочими конячками», які підтримують роботу сервісів, є:
- Embedding-моделі, які перетворюють сирий текст у вектори для пошуку.
- Cross-encoders, які уточнюють ці вектори для отримання точних рейтингів.
- Базові прогнозатори, які застосовують одну модель до багатьох числових рядів.
Висновок очевидний: якщо ви створюєте ШІ, який має масштабуватися, дивіться глибше хайпу. Моделі, що домінують у графіках завантажень Hugging Face, забезпечують безперебійну роботу систем у продакшені, і саме вони й надалі визначатимуть напрямки реальних витрат на ШІ.
