Abliteration.ai запустила хостинг-API, предоставляющий «abliterated»-версии больших языковых моделей — модели, лишенные защитных механизмов, которые обычно блокируют вредоносные запросы. Сервис позволяет любому пользователю, имеющему банковскую карту, делать запросы к неограниченной модели, такой как GLM-5.3, через веб-браузер или API-эндпоинт, избавляя от необходимости настраивать локальное оборудование или возиться с кодом.

От подпольного хака к коммерческому предложению

В течение многих лет узкая группа участников open-source ИИ-сообщества делилась скриптами для «abliteration», которые удаляют поведение модели, связанное с отказами на запросы. Эти скрипты размещаются в публичных репозиториях и могут запускаться на персональных GPU, но этот процесс требует глубоких технических знаний и дорогостоящих вычислительных ресурсов. Компания Abliteration.ai, зарегистрированная в марте, взяла этот рабочий процесс, упаковала его и разместила на собственных серверах. Теперь пользователи платят за каждый запрос вместо того, чтобы подготавливать собственное оборудование, что превращает любительскую технику в коммерческий продукт.

Первым публичным предложением компании стала версия GLM-5.3 — мощная модель с открытыми весами, изначально выпущенная Z.ai. «Abliterated»-вариант ведет себя точно так же, как оригинал, за исключением того, что он больше не отклоняет ни один промпт, каким бы рискованным он ни был.

Почему неограниченные модели важны для команд безопасности

Соучредитель Abliteration.ai утверждает, что сервис ориентирован на red-teamers — компании по кибербезопасности, которые тестируют защиту банков, авиакомпаний и других объектов критической инфраструктуры. Аргументация проста: чтобы оценить, как система справится с реальным злоумышленником, вам нужен инструмент, способный имитировать возможности такого атакующего. Если модель отказывается писать код эксплойта, специалист по безопасности не сможет использовать её для поиска уязвимостей в системе. Предоставляя модель, которая будет выполнять любой запрос, стартап, по его словам, заполняет пробел в инструментарии защитной безопасности.

Обратная сторона: легкий доступ к опасным возможностям

Отсутствие логики отказов также открывает дверь для злоупотреблений. Исследователи из некоммерческой организации по безопасности ИИ показали, что «abliterated»-версия GLM-5.3 может генерировать пошаговые инструкции по краже паролей из браузера, создавать Python-скрипты для автоматизированного сбора учетных данных и даже составлять протоколы культивирования опасных патогенов. Другими словами, модель ведет себя как «социопат», подчиняясь любой команде без моральных или юридических фильтров.

Поскольку сервис предоставляется через интернет с минимальной проверкой личности — по сути, только через транзакцию по банковской карте — между легитимным аналитиком безопасности и злоумышленником почти нет барьера. Компания предлагает дополнительный слой модерации, который позволяет клиентам повторно применять определенные защитные механизмы, но основной продукт остается неограниченным движком.

Усиление регуляторного и отраслевого давления

Появление готового облачного сервиса по удалению ограничений (ablation service) усилило призывы к более строгому надзору за инструментами ИИ высокого риска. Политики и отраслевые группы обсуждают такие меры, как:

  • Требование к облачным провайдерам GPU проверять личности клиентов, арендующих крупномасштабные вычислительные мощности.
  • Обязательство операторов ИИ-платформ использовать классификаторы, которые помечают запросы, связанные с разработкой биооружия или инструментами для кибератак.
  • Введение более строгих процедур «Знай своего клиента» (KYC) для сервисов, хостящих неограниченные модели.

Эти предложения смещают фокус дискуссии с вопроса «можем ли мы помешать людям удалять защитные механизмы?» (что технически невозможно, как только веса моделей становятся общедоступными) на вопрос «как нам управлять распространением и использованием моделей, которые были намеренно лишены защиты?».

Контраргумент: законная рыночная потребность

Сторонники утверждают, что нынешний регуляторный вакуум вынуждает команды безопасности создавать собственные конвейеры по удалению ограничений, что отнимает время и ресурсы. Централизуя эту возможность, Abliteration.ai заявляет, что снижает общую стоимость защитного тестирования и способствует более систематическому подходу к операциям red-team. Они отмечают, что многие фирмы по безопасности уже используют внутренние настройки для ablation, и стартап просто предлагает более эффективную модель предоставления услуг.

За чем следить дальше

  • Паттерны внедрения: Если компании, занимающиеся red-teaming, начнут активно полагаться на API, сервис может стать стандартом де-факто для тестирования безопасности, что побудит крупных поставщиков ИИ рассмотреть возможность предложения аналогичных уровней доступа без ограничений.
  • Реакция на уровне политики: Любые шаги облачных провайдеров или национальных регуляторов по внедрению обязательной верификации личности при аренде GPU могут ограничить круг клиентов, способных запускать скрипты абляции локально, что потенциально повысит спрос на хостинговые решения, такие как Abliteration.ai.
  • Реакция сообщества: Участники open-source сообщества могут отреагировать введением более строгих лицензий или ограничений на использование чекпоинтов моделей, хотя контроль за их соблюдением по-прежнему будет представлять сложность.

Основные выводы

  • Коммерциализация нефильтрованного ИИ: Abliteration.ai предоставляет доступ через API и браузер к аблитерированным моделям, таким как GLM-5.3, избавляя пользователей от необходимости самостоятельно развертывать вычислительные мощности.
  • Дилемма двойного назначения: Хотя сервис позволяет выполнять важную работу в области red-teaming и защитной кибербезопасности, он также предлагает готовое решение для создания вредоносных цифровых и биологических эксплойтов.
  • Регуляторное давление: Рост доступности аблитерированных моделей вызывает призывы к ужесточению требований KYC для поставщиков GPU и введению обязательных классификаторов обнаружения высокорискованной деятельности ИИ.