Почему дело дошло до суда

ANI подала в суд, заметив, что ответы ChatGPT на запросы о недавних индийских новостях напоминают её собственные статьи, опубликованные в августе и сентябре 2024 года. Агентство утверждало, что большая языковая модель воспроизводит её защищенный авторским правом текст — утверждение, которое, если оно будет подтверждено, вынудит OpenAI приостановить работу или существенно ограничить использование своих моделей в Индии.

OpenAI ответила, что две упомянутые модели — GPT-4 и более новая GPT-4o — обучались на данных с датами отсечки в апреле 2022 года и апреле 2024 года. Статьи ANI появились после этих дат, поэтому они не могли входить в исходный обучающий набор. Судья Амит Бансал заявил, что совпадение, скорее всего, произошло благодаря технологии Retrieval-Augmented Generation (RAG), которая подтягивает актуальный веб-контент в ответ в режиме реального времени, а не из-за того, что модель «запомнила» статьи.

Юридический поворот: обучение как «исследование»

Это дело имеет значение, поскольку суд широко истолковал индийское исключение в авторском праве для «частного или личного использования, включая исследования». Обе стороны согласились, что OpenAI использовала материалы ANI на начальном этапе обучения, но судья расценил это использование как «преобразующее» (transformative). Иными словами, модель извлекала только грамматику, синтаксис и статистические закономерности, не затрагивая само содержание.

Суд установил два строгих условия:

  • Копии, используемые для обучения, должны поступать из законных источников, а не из пиратских архивов или сервисов с платным доступом (paywalls), к которым у пользователя нет доступа.
  • Материалы должны оставаться внутри собственной среды разработчика; их нельзя публиковать или распространять.

Применив трехэтапный тест на справедливость, судья пришел к выводу, что использование OpenAI ограничивалось обучением, не обнаружил доказательств того, что модель запоминала дословные фрагменты, и отметил, что ANI не понесло прямых экономических убытков, поскольку две компании работают в разных сегментах рынка.

Как это вписывается в мозаику мировых судебных решений

Позиция Индии теперь отражает несколько дел в США, где поддерживается преобразующий подход к результатам работы ИИ. В деле Kadrey v. Meta суд постановил, что сгенерированный текст, который не копирует точные формулировки, не является нарушением, в то время как давнее решение по делу Google Books признало ограниченное исключение «поиск и отображение» для проектов по оцифровке. Другие иски в США, такие как дело Raw Story, были отклонены из-за отсутствия доказуемого вреда, но спор вокруг Anthropic напомнил судьям, что использование пиратских данных все еще может повлечь за собой ответственность.

В Европе мнения резко расходятся. Суды в Мюнхене постановили, что воспроизведение текстов песен, встроенных в веса модели, является нарушением, в то время как лондонский трибунал недавно отклонил иск против Stability AI по аналогичным основаниям. Решение Высокого суда Дели добавляет еще один важный аспект: если обучение ограничено законными источниками, а результат не является дословной копией, эта деятельность может подпадать под исключение для исследований.

На что стоит обратить внимание разработчикам

  • RAG против обучения — Разграничение судом «запоминания» (обучения) и поиска в реальном времени (RAG) говорит о том, что будущие споры будут сосредоточены на том, поступает ли ответ из статической базы знаний или извлекается из сети в прямом эфире. Разработчикам, возможно, придется четче разграничивать эти понятия в документации к продукту.
  • Происхождение источников — Требование об использовании «законных источников» может подтолкнуть компании к ужесточению процессов курирования данных, использованию контрактов или лицензий, подтверждающих легитимность каждого фрагмента текста.
  • Использование только внутри компании — Компании, планирующие коммерциализировать результаты работы моделей, должны строго хранить обучающие данные внутри организации. Передача необработанных корпусов данных партнерам или широкой публике может лишить их возможности использовать защиту, основанную на исследовательских целях.
  • Тест на экономический ущерб — Поскольку суд сделал акцент на отсутствии прямого финансового ущерба, истцам нужно будет доказать конкретные убытки, а не просто предполагаемое размывание бренда.
  • Законодательная реакция — Индийские законодатели следят за дебатами об авторском праве в сфере ИИ. Любая поправка, сужающая исключение для исследований, может иметь обратную силу и затронуть уже развернутые модели, что спровоцирует волну аудитов на соответствие нормативным требованиям.

Контраргумент, который все еще преследует ИИ

Жалоба ANI высветила реальную проблему: по мере того как LLM становятся все более искусными в повторении специфических формулировок, грань между «преобразующим» использованием и «копированием» может стираться. Критики утверждают, что RAG, хотя технически и является функцией поиска, все равно выдает защищенный авторским правом контент без разрешения, что потенциально нарушает право на «доведение до всеобщего сведения».

Прецедент с мировыми последствиями

Классифицировав обучение моделей как допустимую исследовательскую деятельность, Высокий суд Дели дал понять, что Индия не будет автоматически блокировать разработку больших языковых моделей на основании авторского права, при условии, что разработчики соблюдают законность источников и ограничивают процесс обучения внутренним использованием. Такое толкование может побудить компании расширять свою деятельность в Индии, понимая, что одно из ключевых правовых препятствий смягчилось.

Для регуляторов в других странах это решение предлагает своего рода шаблон: определить узкое, четко документированное исключение для исследовательских целей, установить прозрачные стандарты подбора источников и потребовать, чтобы обработка обучающих данных осуществлялась исключительно внутри организации. Страны, принявшие подобные формулировки, смогут обеспечить своим национальным экосистемам ИИ определенность, необходимую для привлечения инвестиций.

Итог: Решение Высокого суда Дели не дает карт-бланш на сбор любого текста для обучения ИИ, но оно устанавливает, что согласно индийскому законодательству дисциплинированное и соответствующее закону обучение квалифицируется как исследовательская деятельность. Это толкование может стать ориентиром для судов по всему миру, когда те будут решать, является ли обучение машин пониманию языка защищенной научной деятельностью или же это потенциальное нарушение авторских прав.