Anthropic wprowadza teraz ukryty wzorzec statystyczny — SynthID-Text — do każdej odpowiedzi modelu Claude. Firma twierdzi, że ten krok spełnia wymogi Kodeksu Przejrzystości (Transparency Code) unijnego aktu o sztucznej inteligencji (EU AI Act) i daje programistom sposób na udowodnienie, że dany tekst pochodzi z modelu AI. Znak wodny przetrwa powierzchowne edytowanie, nie naruszając przy tym płynności tekstu dla ludzkich czytelników.
Dlaczego dodawany jest znak wodny
Europejscy regulatorzy naciskają na dostawców dużych modeli językowych (LLM), aby treści generowane przez AI były możliwe do odróżnienia od tekstów napisanych przez ludzi. Kodeks Przejrzystości EU AI Act, który wkrótce zostanie wyegzekwowany w całej Unii, zobowiązuje deweloperów do dostarczenia niezawodnej metody wykrywania każdego tekstu produkowanego przez ich modele. Anthropic odpowiedział na to, wdrażając technikę SynthID-Text, opisaną po raz pierwszy przez Google DeepMind w zeszłym roku.
Decyzja ta wywołała falę dyskusji na platformach Reddit i X, gdzie użytkownicy obawiali się, że znak wodny może obniżyć jakość wyników lub stać się tylną furtką do inwigilacji. Anthropic odpowiada, że wzorzec jest niewidoczny dla czytelników, nie powoduje opóźnień i może zostać wyłączony w przypadku prywatnych wdrożeń. Poprzez opublikowanie szczegółów technicznych firma ma nadzieję uspokoić spekulacje i wyznaczyć standard dla całej branży.
Jak działa SynthID-Text
Tradycyjne detektory AI skanują tekst w poszukiwaniu lingwistycznych dziwactw — powtarzających się fraz, nietypowej interpunkcji czy statystycznych odchyleń od ludzkiego stylu pisania. Sygnały te znikają natychmiast, gdy człowiek przeredaguje akapit, co czyni detektory mało wiarygodnymi. SynthID-Text, w przeciwieństwie do nich, wprowadza ukryty sygnał podczas etapu wyboru tokenów przez model.
Gdy Claude wybiera między dwoma równie prawdopodobnymi tokenami — na przykład „overcast” a „grey” — system kieruje decyzję w stronę tego, który pasuje do wcześniej obliczonego wzorca binarnego. W skali całego dokumentu te drobne przesunięcia tworzą sekwencję bitów, którą API do wykrywania może później wyodrębnić. Wzorzec jest celowo mało inwazyjny: wybrany synonim jest wciąż w pełni naturalnym słowem, więc płynność tekstu pozostaje niezmieniona. Ponieważ znak wodny znajduje się w strumieniu tokenów, a nie w warstwie tekstu powierzchniowego, przetrwa on większość procesów przetwarzania, które nie polegają na zastąpieniu każdego tokenu.
Odporność na edycję: co przetrwa, a co nie
Częstym zarzutem jest to, że użytkownicy mogą po prostu edytować tekst wygenerowany przez AI, aby usunąć znak wodny. Wewnętrzne testy Anthropic opisują trzy scenariusze edycji:
- Lekka edycja – poprawianie literówek, zamiana kilku przymiotników lub zmiana kolejności zdań. Statystyczny podpis znaku wodnego pozostaje w dużej mierze nienaruszony, ponieważ większość tokenów nie ulega zmianie.
- Intensywna edycja wspomagana przez Claude – polecanie modelowi Claude przeredagowania szkicu, który już zawiera zdania wygenerowane przez AI. Jeśli użytkownik zachowa kontrolę nad większością sformułowań, sygnał znaku wodnego słabnie proporcjonalnie do ilości nowego, wybranego przez człowieka tekstu.
- Całkowite przeredagowanie – zastąpienie każdego tokenu nową generacją lub ręcznym przeredagowaniem. W tym momencie oryginalny znak wodny zostaje zniszczony, ale wynikowy tekst nie spełnia już unijnej definicji „treści generowanej przez AI”, ponieważ nie pozostaje w nim żaden ślad po oryginalnym wyniku modelu.
Wniosek: znak wodny opiera się powierzchownemu szlifowaniu, ale nie pełnej regeneracji treści.
Generowanie kodu: gdzie znajduje się znak wodny
Claude jest powszechnie używany jako asystent programowania, tworząc wszystko — od jednolinijkowych fragmentów kodu po pełne moduły full-stack. Języki programowania pozostawiają niewiele miejsca na wybór synonimów; zamiana tokenu takiego jak „for” na „while” zmieniłaby logikę. Anthropic spodziewa się zatem, że znak wodny będzie pojawiał się niemal wyłącznie w sekcjach, w których model ma swobodę w doborze słów — w komentarzach, docstringach i tekstach wyjaśniających towarzyszących kodowi.
Ponieważ funkcjonalna część kodu pozostaje nienaruszona, programiści nie powinni odczuć spadku poprawności ani wydajności. Obecność znaku wodnego ogranicza się do tekstu pomocniczego, który pomaga ludziom zrozumieć kod, co spełnia wymóg przejrzystości bez kompromisów w zakresie użyteczności.
Skutki dla branży
Anthropic nie działa w pojedynkę. Kilku innych deweloperów LLM podpisało ten sam Kodeks Praktyki (Code of Practice), który wzywa do ustandaryzowanego API do wykrywania treści. Jeśli harmonogram egzekwowania przepisów przez UE przebiegnie zgodnie z planem, znakowanie wodne może stać się domyślną warstwą w stosie LLM, podobnie jak dziś szyfrowanie w transmisji danych. Firmy, które zignorują ten wymóg, ryzykują kary, utratę dostępu do rynku europejskiego lub przymusowe wycofanie swoich usług.
Punkty sporne
Krytycy argumentują, że ukryty podpis, nawet jeśli jest niewidoczny, mógłby zostać wykorzystany do śledzenia lub przypisywania autorstwa wykraczającego poza wymogi regulacyjne. Obawiają się również wyników fałszywie dodatnich: detection API, które błędnie oznaczy tekst napisany przez człowieka, może podważyć zaufanie do platform polegających na tym sygnale. Anthropic uznaje te ryzyka i zapowiada, że algorytm detekcji będzie open-source, co umożliwi niezależne audyty i kalibrację.
Innym praktycznym zmartwieniem jest narzut obliczeniowy związany z generowaniem znaku wodnego. Anthropic informuje, że dodatkowe przetwarzanie zwiększa czas wnioskowania o mniej niż ułamek procenta – jest to twierdzenie, które wkrótce zostaną zweryfikowane przez zewnętrzne benchmarki.
Na co warto zwrócić uwagę
- Wdrożenie API – Anthropic planuje udostępnić publiczny endpoint, który będzie wyodrębniać ukryty wzorzec bitowy z dowolnego wyniku generowanego przez Claude. Deweloperzy będą mogli zintegrować to sprawdzenie z procesami moderacji treści.
- Działania na rzecz standaryzacji – Organy regulacyjne i grupy branżowe opracowują wspólny format metadanych znaku wodnego, co może ułatwić detekcję między modelami.
- Badania empiryczne – Niezależni badacze zaczynają sprawdzać odporność SynthID-Text na narzędzia do adversarialnego przepisywania tekstu. Ich wyniki wpłyną na to, jak duże zaufanie platformy będą pokładać w tym sygnale.
Podsumowanie
Przyjęcie SynthID-Text przez Anthropic daje społeczności AI konkretne narzędzie do spełnienia nadchodzących europejskich przepisów dotyczących przejrzystości, przy jednoczesnym zachowaniu jakości wyników Claude. Znak wodny przetrwa codzienną korektę, ale znika, gdy tekst zostanie w pełni wygenerowany na nowo; znajduje się on również w niekodujących częściach wyników programistycznych, gdzie nie zakłóca funkcjonalności. To, czy to podejście stanie się normą branżową, zależy od tego, jak dobrze detection API poradzi sobie w rzeczywistych warunkach oraz czy uda się rozwiązać obawy dotyczące prywatności i fałszywych alarmów.
