Anthropic офіційно розпочала впровадження водяних знаків у текст для свого сімейства моделей Claude, щоб підвищити прозорість ШІ та відповідати новим нормативним вимогам. Хоча компанія обіцяє безперешкодну інтеграцію, розгортається дедалі гостріша дискусія щодо впливу на лінгвістичну точність та юридичних наслідків виявлення авторства ШІ.

Механізми прихованого водяного знака

Підхід Anthropic моделюється за методологією SynthID-Text від Google DeepMind. На відміну від традиційного водяного знака, який може додавати видимі мітки або приховані символи Unicode, ця система працює на ймовірнісному рівні великої мовної моделі (LLM). Вона працює шляхом тонкого коригування джерела випадковості, що використовується під час вибору токенів. Регулюючи ймовірність вибору конкретних слів, система створює статистично виявлюваний патерн, який можна ідентифікувати за допомогою спеціалізованого програмного забезпечення без зміни візуального вигляду тексту.

Anthropic стверджує, що цей процес не має помітного впливу на креативність або читабельність результатів Claude. Щоб мінімізувати ризики в середовищах, що потребують високої точності, компанія зазначає, що водяні знаки є «рідшими» у фрагментах, насичених фактами, де словниковий запас обмежений семантичною необхідністю.

Лінгвістична критика: точність проти патернізації

Попри запевнення Anthropic, відомі технологічні критики, такі як Джон Грубер із Daring Fireball, стверджують, що твердження про «непомітність» є помилковим. Суть аргументу полягає в семантичних нюансах: жодні два синоніми не є ідеально взаємозамінними. Якщо алгоритм водяного знака надає пріоритет конкретному токену для підтримки статистичного патерну, він може оминути точніше слово на користь статистично «правильного» для водяного знака.

Грубер припускає, що це може призвести до поступової деградації якості тексту, зазначаючи, що поточні метрики, які використовуються для перевірки таких систем, як SynthID — наприклад, оцінки користувачів «палець вгору/вниз» — є недостатніми. Користувач навряд чи покарає модель за вибір слова "grey" замість "overcast", навіть якщо останнє забезпечує кращу стилістичну глибину, а це означає, що «якість» тексту може погіршуватися так, як стандартні бенчмарки не здатні зафіксувати.

Юридичні наслідки та «липкість» знаків

Впровадження створює значні труднощі для професійних секторів, зокрема для юриспруденції. Згідно з Artificial Lawyer, хоча більшість клієнтів байдужі до допомоги ШІ, можливість довести участь ШІ стає фактором відповідальності у випадках, коли використання ШІ прямо заборонено суддею або клієнтом.

Критичним технічним викликом є «стійкість» цих водяних знаків. Оскільки мітки вбудовані в сам текст, вони можуть поширюватися через документи. Контракт, складений людиною, що містить пункт, згенерований ШІ, нестиме цей водяний знак далі, потенційно «забруднюючи» майбутні шаблони. Крім того, оскільки юристи використовують кілька LLM, документи з часом можуть містити накладаються водяні знаки від різних постачальників, що створить кошмар для форензики під час аудитів прозорості.

Відповідність нормам та обхід захисту

Цей крок значною мірою зумовлений необхідністю дотримання Закону ЄС про ШІ (EU AI Act), хоча Anthropic застосовує цю функцію глобально, щоб уникнути регіональної фрагментації. Усі моделі Claude, випущені після 2 серпня, вже підтримують водяні знаки, а старіші моделі заплановані до модернізації. Однак ефективність системи залишається спірною; інструменти на кшталт Declaude вже використовуються для видалення цих міток шляхом перефразування, що свідчить про те, що хоча водяні знаки можуть задовольнити регуляторів, їм може бути важко зупинити навмисний обхід.

Основні висновки

  • Ймовірнісне виявлення: Anthropic використовує метод у стилі SynthID, який змінює випадковість вибору токенів, а не додає видимих символів, що робить водяний знак статистично виявлюваним, але візуально прихованим.
  • Компроміси щодо якості: Критики стверджують, що примусовий вибір конкретних слів для підтримки патерну водяного знака неминуче приносить у жертву семантичну точність і стилістичні нюанси.
  • Юридична відповідальність: «Липка» природа водяних знаків означає, що текст, згенерований ШІ, може переносити виявлювані патерни в майбутні документи, створюючи ризики прозорості для юридичних фірм та галузей з високим рівнем регулювання.