The 180M-Parameter LLM on a 10-Dollar Chip
Новий проєкт під назвою p-for-llm робить дещо вражаюче. Він запускає модель на 180,9 мільйона параметрів на мікроконтролері ESP32-P4. Цей чип коштує від шести до десяти доларів.
Більшість вірусних ШІ-проєктів на малих чипах зосереджені на простих завданнях. Вони демонструють модель, яка пише короткі оповідання. Такі моделі часто мають дуже мало параметрів і не мають реальної користі.
p-for-llm — інший. Він прагне до практичної користі.
Ось як це працює:
- Він використовує архітектуру Mixture-of-Experts (MoE).
- Для кожного токена роутер обирає одного експерта з 29.
- Інші 28 експертів залишаються неактивними.
- Це економить обчислювальну потужність, зберігаючи високий рівень знань.
- Він використовує тернарні ваги, щоб вмістити модель у малий обсяг пам'яті.
- Модель генерує приблизно 9 токенів на секунду.
Процес навчання також вартий уваги. Розробник використав одну споживчу відеокарту RTX 5060 Ti. Тут немає величезної лабораторії чи величезного бюджету. Лише одна людина з відеокартою середнього сегмента та терпінням.
Є один нюанс, про який варто знати. Модель ще не є повністю автономною. Під час запуску ви повинні завантажити ваги на плату через USB. Це ще не автономний пристрій, який завантажується з SD-карти.
Це все ще не хмарна демоверсія. Обчислення відбуваються локально на чипі. Це величезний крок вперед порівняно з проєктами, які просто передають дані на сервер.
Чому це важливо?
Малі моделі зазвичай впираються в стіну. Вони можуть бути цікавими, але не здатні виконувати інструкції. p-for-llm намагається подолати цей бар'єр. Він підтримує промпти ChatML і демонструє перші ознаки виклику інструментів (tool calling).
Цей проєкт показує, що справжній прогрес часто відбувається тихо. Поки вірусні проєкти полюють на заголовки, серйозні розробники публікують свої обмеження та примітки.
Я особисто протестую це обладнання, щоб перевірити ці показники.
Додаткова спільнота для навчання: https://t.me/GyaanSetuAi
