В то время как Cerebras создает специализированные ИИ-чипы, французский стартап Kog выжимает максимум производительности из GPU, которыми уже владеют предприятия. Переписывая низкоуровневое программное обеспечение для существующего оборудования дата-центров, Kog устраняет задержки, замедляющие рабочие процессы ИИ.
Под сомнение необходимости специализированных ИИ-чипов
Индустрия ИИ переключилась на специализированные чипы для инференса. Генеральный директор Kog Gaël Delalleau утверждает, что убеждение, будто стандартные GPU не справляются с декодированием, ошибочно. Современные GPU — Nvidia H200, AMD MI300X — обладают пропускной способностью памяти, которую текущее ПО оставляет неиспользуемой.
Kog Inference Engine (KIE) от Kog нацелен на «сверхбыстрое декодирование одиночных запросов», что является обязательным условием для приложений реального времени. В недавней демонстрации компания достигла скорости 3000 токенов в секунду (TPS) с использованием Laneformer 2B — open-source модели с 2 миллиардами параметров, оптимизированной под их стек. В демо используется небольшая модель, но Kog планирует распространить этот успех на гораздо более крупные LLM.
«Хакерский» подход к разработке GPU
В отличие от аппаратно-независимых провайдеров, таких как ZML, Kog копает глубоко. Команда занимается реверс-инжинирингом GPU на уровнях ассемблера и бинарного кода, рассматривая кремний как набор физических законов, которые необходимо освоить.
Такой низкоуровневый подход позволяет извлечь каждую каплю эффективности, но это требует времени. Имея небольшую команду из 11 инженеров, Kog тратит недели или месяцы на изучение каждой новой архитектуры GPU перед добавлением поддержки. Этот метод обеспечивает высочайшую производительность, но ограничивает скорость охвата нового оборудования.
Ориентация на высокоценные сценарии использования ИИ
Kog фокусируется на секторах, где задержка означает потерю выручки:
- Разработка ПО: Такие инструменты, как Claude Code, могут зависать на минуты. Kog стремится превратить «часы ожидания» в почти мгновенные результаты.
- Генеративный дизайн приложений и игр: Конвейеры создания приложений по промптам требуют быстрой итерации, чтобы удерживать пользователей и обеспечивать поток доходов.
Следующей вехой компании станет 10-кратное ускорение на первой крупной масштабной модели. При поддержке Scaleway, Bpifrance и программы French Tech 2030, Kog позиционирует себя как ключевого игрока в стремлении Европы к суверенитету в области ИИ.
Основные выводы
- Оптимизация важнее железа: Kog доводит пропускную способность памяти GPU Nvidia H200 и AMD MI300X до предела с помощью экстремальной низкоуровневой программной инженерии.
- Преодоление барьера задержки: Стартап нацелен на 30-кратное увеличение скорости инференса LLM для профессиональных рабочих процессов в реальном времени, таких как автоматизированное написание кода и генеративный дизайн.
- Глубокая инженерия: Применяя «хакерский» подход, Kog проводит реверс-инжиниринг ассемблера и бинарного кода GPU, чтобы достичь производительности, недоступной стандартным стекам.
Французский стартап Kog заявляет, что его Kog Inference Engine нацелен на ускорение декодирования больших языковых моделей (LLM) до 30 раз на тех же GPU Nvidia H200 или AMD MI300X, которыми уже владеют операторы дата-центров.
Почему погоня за скоростью важна именно сейчас
Инференс LLM сейчас ограничивает возможности таких продуктов, как ассистенты автодополнения кода, генераторы контента «на лету» и интерактивные инструменты для дизайна игр. В таких условиях разрыв между промптом пользователя и ответом модели напрямую влияет на продуктивность и выручку. Высокоуровневые API, такие как CUDA, оставляют значительную часть пропускной способности памяти GPU неиспользуемой, особенно во время пошагового декодирования, которое преобладает в сценариях реального времени.
Низкоуровневое решение от Kog
Kog обходит традиционные программные уровни и взаимодействует напрямую с кремнием. Его инженеры проводят реверс-инжиниринг GPU на уровне ассемблера, рассматривая оборудование как набор ограничений, которым нужно следовать, а не как «черный ящик», который нужно абстрагировать. Результатом является кастомный путь выполнения, который обеспечивает поток данных через каналы памяти GPU почти на полной мощности.
В недавней демонстрации компания запустила Laneformer 2B — open-source модель с 2 миллиардами параметров, оптимизированную под их стек, — и сообщила о высокой пропускной способности токенов. Модель скромна по сравнению с более крупными коммерческими системами, но прирост скорости показывает, что специализированный программный стек может извлечь из того же оборудования.
Инженерный компромисс
Преимущества сопряжены с резким ростом затрат. Команда Kog из 11 инженеров тратит недели или месяцы на изучение каждой новой архитектуры GPU, прежде чем она сможет получить поддержку. Такая глубина обеспечивает высокую производительность на целевых картах, но это также означает, что Kog не может мгновенно добавить поддержку каждого нового GPU, выходящего на рынок. Клиенты получают выгоду только в том случае, если их парки оборудования включают GPU Nvidia H200 или AMD MI300X, которые Kog уже оптимизировал.
Кто окажется в выигрыше
- Инструменты для разработки ПО — Продукты, генерирующие код, такие как Claude Code, часто зависают на несколько минут, пока модель обрабатывает запрос. Сокращение этого времени ожидания до нескольких секунд сделало бы процесс интерактивной разработки гораздо более плавным.
- Конвейеры генеративного дизайна — Студиям, превращающим текстовые промпты в прототипы приложений или игровые ассеты, необходима быстрая итерация, чтобы поддерживать вовлеченность создателей. Ускоренное декодирование сокращает циклы проектирования и повышает показатели конверсии.
В обоих секторах задержка напрямую конвертируется в потерянные оплачиваемые часы или отток клиентов, поэтому 30-кратное увеличение скорости может стать решающим конкурентным преимуществом.
Общая картина
Стратегия Kog идет вразрез с отраслевым трендом на создание специализированных ИИ-чипов. Такие компании, как Cerebras, вкладывают миллиарды в чипы, обещающие более высокую пропускную способность на ватт. Kog утверждает, что современным GPU уже достаточно пропускной способности памяти для декодирования; недостающим звеном является программное обеспечение, способное эффективно ее использовать. Если это утверждение подтвердится в масштабе, разработчики смогут отложить дорогостоящую модернизацию оборудования и полагаться на обновление ПО для достижения инференса в режиме, близком к реальному времени.
Потенциальные препятствия
- Бремя обслуживания — Каждое новое поколение GPU потребует повторного реверс-инжиниринга. По мере диверсификации рынка небольшой команде может не хватить ресурсов.
- Масштабируемость на более крупные модели — В демо-версии использовалась модель с 2 млрд параметров. Масштабирование тех же методов на гораздо более крупные системы может столкнуться с ограничениями объема памяти или потребовать дополнительных инженерных хитростей, которые еще не раскрыты.
- Альтернативные пути — Облачные провайдеры уже предлагают инстансы, оптимизированные для инференса, которые объединяют специализированные чипы и ПО. Для некоторых рабочих нагрузок незначительная выгода от стека Kog может не перевесить удобство управляемого сервиса.
За чем следить
- Первое внедрение крупной модели — Kog заявляет, что их следующим важным этапом станет 10-кратное ускорение на «крупной масштабной модели». Разрыв между демо-версией на 2 млрд параметров и моделью корпоративного уровня станет самым серьезным испытанием данного подхода.
- Расширение поддержки оборудования — Добавление поддержки новых GPU или других ускорителей покажет, сможет ли низкоуровневая модель поспевать за стремительным темпом выхода нового оборудования.
Итог
Kog показывает, что выжать максимум из существующих GPU можно, если переписать программный стек с нуля. Обещание 30-кратного ускорения декодирования LLM может изменить подходы разработчиков к ценообразованию и архитектуре ИИ-сервисов — при условии, что компания сможет поддерживать интенсивные инженерные усилия, необходимые для работы с каждым новым чипом.
