Министерство юстиции США предприняло значительное юридическое вмешательство в продолжающуюся «войну за авторские права» между медиагигантами и разработчиками ИИ. Утверждая, что обучение больших языковых моделей (LLM) на защищенных авторским правом данных является «добросовестным использованием» (fair use), Минюст обеспечил мощный юридический щит для таких компаний, как OpenAI и Microsoft.
Аргументация Минюста: обучение против результата
В основе объединенного иска с участием The New York Times лежит фундаментальное различие между тем, как обучается ИИ, и тем, что он производит. The New York Times утверждает, что миллионы её статей использовались без разрешения для обучения таких моделей, как GPT-4, что нанесло ущерб в миллиарды долларов и привело к созданию продуктов, напрямую конкурирующих с газетой.
Однако в недавнем заявлении Минюста утверждается, что нарушение авторских прав происходит на этапе выдачи результата, а не на этапе поглощения данных. Ведомство заявляет, что, хотя во время фазы обучения копируются целые произведения, эти копии никогда не становятся общедоступными. Кроме того, Минюст утверждает, что результаты работы таких моделей, как GPT-4, «зачастую, если не всегда, не имеют существенного сходства» с оригинальным исходным материалом. Разделяя процесс обучения и генерируемый контент, Минюст пытается отделить акт машинного обучения от юридической концепции замещения рынка.
«Аналогия с Хемингуэем» и человеческое творчество
Чтобы сделать концепцию машинного обучения более понятной, Минюст привел литературную аналогию с писательницей Джоан Дидион. В документе отмечается, что в подростковом возрасте Дидион копировала рассказы Эрнеста Хемингуэя, чтобы анализировать структуру его предложений и учиться мастерству. Минюст утверждает, что если бы закон рассматривал обучение машин как нарушение, писательница вроде Дидион теоретически могла бы нести ответственность каждый раз при публикации новой работы, поскольку процесс обучения был бы неразрывно связан с её последующим творчеством.
Ведомство далее утверждает, что введение строгой ответственности за обучение ИИ парадоксальным образом подавит то самое творчество, которое закон об авторском праве призван защищать. Поскольку люди всё чаще используют LLM для написания черновиков и редактирования оригинальных произведений, Минюст предполагает, что запрет на обучение без масштабных схем лицензирования парализует инновации в сфере ИИ.
Вызов Бюро по авторским правам США
Позиция Минюста прямо противоречит недавним выводам Бюро по авторским правам США. Бывший регистратор Шира Перлмуттер ранее выступала против защиты по принципу «добросовестного использования» в широком смысле, отмечая, что ИИ работает в масштабах и со скоростью, далеко выходящими за рамки человеческих возможностей, и часто создает коммерческие продукты, которые напрямую конкурируют с авторами оригинального контента.
Минюст перешел в наступление против этой оценки, заявляя, что отчет Перлмуттер не имеет обязательной юридической силы и не учитывает сложившуюся судебную практику, требующую анализа каждого случая в отдельности. Ведомство предупреждает, что установление широкой ответственности фактически принудит к введению режима лицензирования, который сделает разработку передовых моделей ИИ юридически и финансово невозможной.
Основные выводы
- Разделение обучения и результата: Минюст утверждает, что копирование текста для обучения не является нарушением, если выходные данные модели не демонстрируют «существенного сходства» с оригинальными произведениями.
- Защита инноваций: Ведомство предупреждает, что требование лицензий на все обучающие данные будет подавлять творчество и препятствовать разработке LLM, помогающих людям в создании контента.
- Ключевой юридический прецедент: Это вмешательство создает конфликт с высокими ставками между Минюстом и Бюро по авторским правам США, подготавливая почву для окончательного судебного решения о будущем генеративного ИИ.
ARTICLE: Министерство юстиции США подало заключение amicus curiae по иску The New York Times о нарушении авторских прав, утверждая, что копирование защищенного текста для обучения больших языковых моделей (LLM) квалифицируется как добросовестное использование. Это заявление предоставляет таким компаниям, как OpenAI и Microsoft, юридический щит, который может оградить их от выплат по искам о возмещении ущерба, сумма которых, по оценкам газеты, исчисляется миллиардами.
Почему это дело важно именно сейчас
В иске объединяются несколько претензий, согласно которым разработчики ИИ без разрешения загружали миллионы газетных статей в свои модели, а затем выпускали продукты, напрямую конкурирующие с репортажами самой Times. Если суд отклонит аргумент Минюста о добросовестном использовании, компании в сфере ИИ могут столкнуться с огромными расходами на лицензирование или быть вынуждены остановить разработку следующего поколения разговорных агентов.
Основной аргумент Минюста
В документе рабочий процесс ИИ разделен на два отдельных этапа. Во-первых, модель поглощает огромные массивы текстов; во-вторых, она генерирует ответы на запросы пользователей. Департамент утверждает, что нарушение авторских прав возникает только тогда, когда защищенное авторским правом произведение воспроизводится таким образом, что оно становится доступным общественности. Поскольку копии, используемые для обучения, никогда не покидают серверы разработчика, сам процесс поглощения данных не достигает этого порога.
Минюст США (DOJ) также опирается на тест на «существенное сходство» — давний стандарт авторского права. Ведомство утверждает, что текст, выдаваемый такими моделями, как GPT-4, «часто, если не всегда,» достаточно отличается от любого отдельного источника, чтобы истец не мог доказать необходимое сходство. Короче говоря, в документе утверждается, что юридический акцент должен быть сделан на конечном результате, а не на внутреннем процессе обучения.
Литературная аналогия для иллюстрации тезиса
Чтобы сделать технический аргумент более понятным, в иске приводится история о девочке-подростке, которая копировала рассказы Эрнеста Хемингуэя, чтобы изучить его стиль. Минюст заявляет, что если бы закон рассматривал такое учебное упражнение как нарушение, на писательницу могли бы подать в суд каждый раз, когда она публиковала бы новое произведение, даже если бы оно было оригинальным. Департамент предупреждает, что распространение этой логики на ИИ «парализует саму творческую деятельность, которую закон об авторском праве призван защищать».
Ставки для разработчиков ИИ и создателей контента
- Риск для инноваций: Требование лицензий на каждый фрагмент текста, используемый при обучении, может привести к настолько высокому росту затрат, что создание передовых моделей станет финансово нецелесообразным.
- Творческий процесс: Писатели-люди все чаще полагаются на LLM для написания черновиков, редактирования и мозгового штурма. Если процесс обучения будет признан незаконным, эти инструменты могут исчезнуть, что изменит способы производства контента во всех отраслях.
- Влияние на рынок: Газетная индустрия утверждает, что модели ИИ, способные отвечать на вопросы или генерировать тексты, похожие на новости, подрывают ценность оригинальной журналистики, потенциально оттягивая на себя рекламные доходы и подписки.
Контраргумент Бюро по авторским правам
В недавнем отчете Бюро по авторским правам США, подготовленном при бывшем регистраторе Шире Перлмуттер, была высказана позиция против безоговорочной защиты на основании принципа «добросовестного использования» (fair use). Бюро выделило три фактора, которые отличают ИИ от человеческого обучения: огромный объем копируемого материала, скорость его обработки и тот факт, что полученные модели могут быть упакованы и проданы как коммерческие продукты, напрямую конкурирующие с авторами первоисточников.
Минюст опровергает эти доводы, отмечая, что отчет не имеет обязательной юридической силы и что существующая судебная практика уже требует анализа каждого конкретного факта на предмет добросовестного использования. Ведомство предупреждает, что установление «широкой ответственности» фактически принудит отрасль к режиму лицензирования, который «сделает разработку передовых моделей ИИ юридически и финансово невозможной».
Что может произойти дальше
Окружной суд, рассматривающий дело Times, должен будет сопоставить позицию Минюста о добросовестном использовании с выводами Бюро по авторским правам. Решение в пользу Минюста создаст прецедент, согласно которому обучающие данные могут собираться без явного разрешения, при условии, что результаты работы модели не будут иметь существенного сходства с оригиналами. Решение в пользу газеты может спровоцировать волну лицензионных переговоров, что потенциально изменит экономику исследований в области ИИ.
Итог
Подача иска Минюстом превращает вопрос о том, является ли обучение ИИ добросовестным использованием, в судебную битву с высокими ставками. Исход определит, смогут ли разработчики продолжать создавать мощные языковые модели на основе существующих текстов или же им придется искать дорогостоящие лицензии на каждый фрагмент используемого материала. Это решение вызовет резонанс в технологическом секторе, медиаиндустрии и всей креативной экономике в целом.
