Anthropic voegt nu een verborgen statistisch patroon toe — SynthID-Text — aan elk Claude-antwoord. Het bedrijf stelt dat deze stap voldoet aan de Transparency Code van de EU AI Act en ontwikkelaars een manier biedt om te bewijzen dat een tekst afkomstig is van een AI-model. Het watermerk blijft behouden bij lichte bewerkingen, terwijl de tekst voor menselijke lezers ongewijzigd blijft.

Waarom het watermerk wordt toegevoegd

Europese toezichthouders hebben aanbieders van large-language-modellen (LLM's) onder druk gezet om door AI gegenereerde inhoud onderscheidbaar te maken van menselijke teksten. De Transparency Code van de EU AI Act, die binnenkort in de hele Unie wordt gehandhaafd, verplicht ontwikkelaars om een betrouwbare detectiemethode te leveren voor elke tekst die hun modellen produceren. Anthropic heeft hierop gereageerd door de SynthID-Text-techniek te adopteren, die vorig jaar voor het eerst werd beschreven door Google DeepMind.

De beslissing leidde tot een storm aan discussies op Reddit en X, waar gebruikers vreesden dat het watermerk de kwaliteit van de output zou kunnen verslechteren of een achterdeur voor surveillance zou kunnen worden. Anthropic werpt tegen dat het patroon onzichtbaar is voor lezers, geen vertraging (latency) veroorzaakt en kan worden uitgeschakeld voor private implementaties. Door de technische details te publiceren, hoopt het bedrijf speculatie te sussen en een benchmark voor de sector te stellen.

Hoe SynthID-Text werkt

Traditionele AI-detectoren zoeken naar taalkundige eigenaardigheden — herhaalde formuleringen, vreemde interpunctie of statistische afwijkingen van menselijk schrijven. Die signalen verdwijnen zodra een mens een paragraaf herschrijft, waardoor de detectoren onbetrouwbaar worden. SynthID-Text verbergt daarentegen een gecodeerd signaal tijdens de stap van tokenselectie door het model.

Wanneer Claude kiest tussen twee even plausibele tokens — zeg "bewolkt" versus "grijs" — stuurt het systeem de beslissing in de richting van de token die past bij een vooraf berekend binair patroon. Over de lengte van een document creëren deze sturingen een reeks bits die een detectie-API later kan extraheren. Het patroon heeft bewust een lage impact: het gekozen synoniem is nog steeds een volkomen natuurlijk woord, waardoor de tekststroom ongewijzigd blijft. Omdat het watermerk in de tokenstroom zit en niet in de oppervlaktetekst, overleeft het de meeste downstream-verwerkingen, zolang niet elk token wordt vervangen.

Bewerkingsbestendigheid: wat blijft behouden en wat niet

Een veelgehoorde kritiek is dat gebruikers door AI gegenereerde teksten simpelweg kunnen bewerken om het watermerk te wissen. Intern onderzoek van Anthropic schetst drie bewerkingsscenario's:

  • Lichte bewerking – het corrigeren van typefouten, het omwisselen van een paar bijvoeglijke naamwoorden of het aanpassen van de zinsvolgorde. De statistische handtekening van het watermerk blijft grotendeels intact omdat de meeste tokens ongewijzigd blijven.
  • Zware Claude-ondersteunde bewerking – Claude opdracht geven om een concept te herschrijven dat al door AI gegenereerde zinnen bevat. Als de gebruiker de controle behoudt over het grootste deel van de bewoording, verzwakt het signaal van het watermerk in verhouding tot de hoeveelheid nieuwe, door mensen gekozen tekst.
  • Volledige herschrijving – elk token vervangen door een nieuwe generatie of een handmatige herschrijving. Op dat punt is het oorspronkelijke watermerk vernietigd, maar voldoet de resulterende tekst niet langer aan de EU-definitie van "door AI gegenereerd", omdat er geen spoor meer is van de oorspronkelijke output van het model.

De conclusie: het watermerk is bestand tegen lichte polijsting, maar niet tegen een volledige regeneratie van de inhoud.

Codegeneratie: waar het watermerk zich bevindt

Claude wordt op grote schaal gebruikt als programmeerassistent en produceert alles van eendregelige snippets tot full-stack modules. Programmeertalen laten weinig ruimte voor synoniemkeuze; het vervangen van een token als for door while zou de logica veranderen. Anthropic verwacht daarom dat het watermerk bijna uitsluitend verschijnt in secties waar het model de vrijheid heeft om woorden te kiezen — commentaar, docstrings en verklarende teksten die de code vergezellen.

Omdat het functionele deel van de code ongemoeid blijft, zouden ontwikkelaars geen afname in correctheid of prestaties moeten merken. De aanwezigheid van het watermerk is beperkt tot de bijbehorende tekst die mensen helpt de code te begrijpen, waardoor aan de transparantievereiste wordt voldaan zonder de bruikbaarheid in gevaar te brengen.

Gevolgen voor de sector

Anthropic handelt niet alleen. Verschillende andere LLM-ontwikkelaars hebben hetzelfde Code of Practice ondertekend, waarin wordt gepleit voor een gestandaardiseerde detectie-API. Als de handhavingsplanning van de EU volgens plan verloopt, zou watermarking een standaardlaag in de LLM-stack kunnen worden, vergelijkbaar met hoe encryptie dat vandaag de dag is voor gegevensoverdracht. Bedrijven die de vereiste negeren, riskeren boetes, verlies van markttoegang in Europa of gedwongen verwijdering van hun diensten.

Discussiepunten

Critici stellen dat een verborgen handtekening, zelfs als deze onzichtbaar is, hergebruikt zou kunnen worden voor tracking of attributie die verder gaat dan de naleving van regelgeving. Ze vrezen ook voor vals-positieven: een detectie-API die door mensen geschreven tekst verkeerd labelt, zou het vertrouwen in platforms die op dit signaal vertrouwen kunnen ondermijnen. Anthropic erkent deze risico's en stelt dat het detectie-algoritme open-source zal zijn, wat onafhankelijke audits en kalibratie mogelijk maakt.

Een andere praktische zorg is de computationele overhead van het genereren van het watermerk. Anthropic meldt dat de extra verwerking minder dan een fractie van een procent aan de inferentietijd toevoegt, een bewering die binnenkort door externe benchmarks zal worden getest.

Volgende ontwikkelingen

  • API rollout – Anthropic is van plan een publieke endpoint vrij te geven die het verborgen bitpatroon uit elke Claude-output extraheert. Ontwikkelaars zullen de controle kunnen integreren in content-moderatie pipelines.
  • Standaardisatiepogingen – Toezichthouders en brancheorganisaties werken aan een gemeenschappelijk formaat voor watermerkmetadata, wat detectie over verschillende modellen heen gemakkelijker zou kunnen maken.
  • Empirische studies – Onafhankelijke onderzoekers beginnen de veerkracht van SynthID-Text te testen tegen adversariële herschrijftools. Hun bevindingen zullen bepalen hoeveel vertrouwen platforms in het signaal stellen.

De kern

De adoptie van SynthID-Text door Anthropic geeft de AI-gemeenschap een concreet hulpmiddel om te voldoen aan de aanstaande Europese transparantieregels, terwijl de kwaliteit van de Claude-output intact blijft. Het watermerk blijft behouden bij dagelijks redigeren, maar verdwijnt wanneer tekst volledig wordt geregenereerd, en het bevindt zich in de niet-code delen van programmeeroutput, waar het de functionaliteit niet verstoort. Of deze aanpak de industriestandaard wordt, hangt af van hoe goed de detectie-API presteert in de praktijk en of zorgen over privacy en vals alarm kunnen worden weggenomen.