Anthropic এখন প্রতিটি Claude রেসপন্সে একটি লুকানো পরিসংখ্যানগত প্যাটার্ন—SynthID-Text—সংযুক্ত করছে। কোম্পানিটি বলছে যে এই পদক্ষেপটি EU AI Act-এর Transparency Code মেনে চলে এবং ডেভেলপারদের একটি টেক্সট যে AI মডেল থেকে এসেছে তা প্রমাণ করার একটি উপায় দেয়। এই ওয়াটারমার্কটি সাধারণ এডিটিংয়ের পরেও টিকে থাকে, অথচ মানুষের পড়ার জন্য গদ্য বা লেখার শৈলী অপরিবর্তিত রাখে।
কেন এই ওয়াটারমার্ক যুক্ত করা হচ্ছে
ইউরোপীয় নিয়ন্ত্রক সংস্থাগুলো লার্জ-ল্যাঙ্গুয়েজ-মডেল (LLM) প্রদানকারীদের AI-জেনারেটেড কন্টেন্টকে মানুষের লেখা থেকে আলাদা করার জন্য চাপ দিচ্ছে। EU AI Act-এর Transparency Code, যা শীঘ্রই পুরো ব্লকে কার্যকর হতে যাচ্ছে, ডেভেলপারদের তাদের মডেল দ্বারা তৈরি যেকোনো টেক্সটের জন্য একটি নির্ভরযোগ্য শনাক্তকরণ পদ্ধতি সরবরাহ করতে বাধ্য করে। Anthropic গত বছর Google DeepMind-এর বর্ণনা করা SynthID-Text প্রযুক্তিটি গ্রহণ করার মাধ্যমে এর উত্তর দিয়েছে।
এই সিদ্ধান্তটি Reddit এবং X-এ আলোচনার ঝড় তুলেছে, যেখানে ব্যবহারকারীরা আশঙ্কা করছেন যে ওয়াটারমার্কটি আউটপুটের মান কমিয়ে দিতে পারে বা নজরদারির একটি ব্যাকডোর হয়ে উঠতে পারে। Anthropic পাল্টা যুক্তি দিচ্ছে যে এই প্যাটার্নটি পাঠকদের কাছে অদৃশ্য, এতে কোনো ল্যাটেন্সি (latency) বাড়ে না এবং ব্যক্তিগত ব্যবহারের জন্য এটি বন্ধ করে রাখা সম্ভব। প্রযুক্তিগত বিবরণ প্রকাশ করার মাধ্যমে কোম্পানিটি এই জল্পনা প্রশমিত করতে এবং শিল্পের জন্য একটি মানদণ্ড স্থাপন করতে চায়।
SynthID-Text কীভাবে কাজ করে
প্রথাগত AI ডিটেক্টরগুলো ভাষাগত বৈশিষ্ট্যগুলো স্ক্যান করে—যেমন বারবার ব্যবহৃত শব্দগুচ্ছ, অদ্ভুত বিরামচিহ্ন, বা মানুষের লেখার তুলনায় পরিসংখ্যানগত বিচ্যুতি। একজন মানুষ যখন একটি অনুচ্ছেদ পুনরায় লিখে ফেলে, তখন সেই সংকেতগুলো হারিয়ে যায়, যা ডিটেক্টরগুলোকে অনির্ভরযোগ্য করে তোলে। এর বিপরীতে, SynthID-Text মডেলের টোকেন-সিলেকশন (token-selection) ধাপের সময় একটি গোপন সংকেত অন্তর্ভুক্ত করে।
যখন Claude দুটি সমানভাবে সম্ভাব্য টোকেনের মধ্যে একটি বেছে নেয়—ধরা যাক “overcast” বনাম “grey”—তখন সিস্টেমটি সিদ্ধান্তটিকে এমন একটি টোকেনের দিকে ঠেলে দেয় যা একটি পূর্ব-গণনা করা বাইনারি প্যাটার্নের সাথে মিলে যায়। একটি ডকুমেন্টের পুরো দৈর্ঘ্যের মধ্যে, এই ছোট পরিবর্তনগুলো বিটের একটি অনুক্রম তৈরি করে যা পরবর্তীতে একটি ডিটেকশন API দিয়ে বের করা সম্ভব। এই প্যাটার্নটি উদ্দেশ্যমূলকভাবে খুব সামান্য প্রভাব ফেলে: নির্বাচিত সমার্থক শব্দটি এখনও একটি সম্পূর্ণ স্বাভাবিক শব্দ, তাই টেক্সটের প্রবাহ অপরিবর্তিত থাকে। যেহেতু ওয়াটারমার্কটি উপরিভাগের টেক্সটের পরিবর্তে টোকেন স্ট্রিমে থাকে, তাই এটি বেশিরভাগ ডাউনস্ট্রিম প্রসেসিংয়ের পরেও টিকে থাকে যা প্রতিটি টোকেন পরিবর্তন করে না।
এডিটিং প্রতিরোধ ক্ষমতা: কী টিকে থাকে আর কী থাকে না
একটি সাধারণ সমালোচনা হলো যে ব্যবহারকারীরা ওয়াটারমার্ক মুছে ফেলার জন্য AI-জেনারেটেড গদ্যটি সহজেই এডিট করতে পারে। Anthropic-এর অভ্যন্তরীণ পরীক্ষা তিনটি এডিটিং সিনারিও বা পরিস্থিতির কথা উল্লেখ করেছে:
- Light editing – টাইপো ঠিক করা, কয়েকটি বিশেষণ পরিবর্তন করা বা বাক্যের ক্রম পরিবর্তন করা। ওয়াটারমার্কের পরিসংখ্যানগত স্বাক্ষর অনেকটা অক্ষত থাকে কারণ বেশিরভাগ টোকেন অপরিবর্তিত থাকে।
- Heavy Claude-assisted editing – একটি ড্রাফট পুনরায় লেখার জন্য Claude-কে নির্দেশ দেওয়া যাতে ইতিমধ্যে AI-জেনারেটেড বাক্য রয়েছে। যদি ব্যবহারকারী বেশিরভাগ শব্দচয়নের ওপর নিয়ন্ত্রণ বজায় রাখেন, তবে নতুন মানুষের লেখা টেক্সটের পরিমাণের অনুপাতে ওয়াটারমার্কের সংকেত দুর্বল হয়ে পড়ে।
- Complete rewriting – প্রতিটি টোকেনকে নতুন জেনারেশন বা ম্যানুয়াল পুনর্লিখন দিয়ে প্রতিস্থাপন করা। সেই পর্যায়ে মূল ওয়াটারমার্কটি ধ্বংস হয়ে যায়, তবে ফলাফলস্বরূপ প্রাপ্ত টেক্সটটি আর EU-এর “AI-generated” সংজ্ঞার আওতায় পড়ে না কারণ মূল মডেল আউটপুটের কোনো চিহ্ন অবশিষ্ট থাকে না।
সারকথা: ওয়াটারমার্কটি সাধারণ পরিমার্জন প্রতিরোধ করতে পারে কিন্তু কন্টেন্টের সম্পূর্ণ পুনর্প্রক্রিয়াকরণ (regeneration) করতে পারে না।
কোড জেনারেশন: যেখানে ওয়াটারমার্কটি থাকে
Claude ব্যাপকভাবে কোডিং অ্যাসিস্ট্যান্ট হিসেবে ব্যবহৃত হয়, যা এক লাইনের স্নিপেট থেকে শুরু করে ফুল-স্ট্যাক মডিউল পর্যন্ত সবকিছু তৈরি করে। প্রোগ্রামিং ল্যাঙ্গুয়েজে সমার্থক শব্দ নির্বাচনের সুযোগ খুব কম থাকে; “for” এর বদলে “while” এর মতো একটি টোকেন পরিবর্তন করলে লজিক বদলে যাবে। তাই Anthropic আশা করছে যে ওয়াটারমার্কটি মূলত সেই অংশগুলোতে দেখা যাবে যেখানে মডেলের শব্দ নির্বাচনের স্বাধীনতা রয়েছে—যেমন কমেন্ট (comments), ডকস্ট্রিং (docstrings) এবং কোডের সাথে থাকা ব্যাখ্যামূলক গদ্য।
যেহেতু কোডের কার্যকরী অংশ অপরিবর্তিত থাকে, তাই ডেভেলপাররা সঠিকতা বা পারফরম্যান্সে কোনো ঘাটতি দেখতে পাবেন না। ওয়াটারমার্কের উপস্থিতি কেবল সেই আনুষঙ্গিক টেক্সটের মধ্যে সীমাবদ্ধ যা মানুষকে কোড বুঝতে সাহায্য করে, যা উপযোগিতা বজায় রেখে স্বচ্ছতার প্রয়োজনীয়তা পূরণ করে।
শিল্পখাতে এর প্রভাব
Anthropic একা কাজ করছে না। বেশ কিছু অন্যান্য LLM ডেভেলপার একই Code of Practice স্বাক্ষর করেছে যা একটি মানসম্মত ডিটেকশন API-এর আহ্বান জানায়। যদি EU-এর প্রয়োগের সময়সীমা পরিকল্পনা অনুযায়ী অগ্রসর হয়, তবে ওয়াটারমার্কিং LLM স্ট্যাকে একটি ডিফল্ট লেয়ার হয়ে উঠতে পারে, ঠিক যেমন বর্তমানে ডেটা ট্রান্সমিশনের জন্য এনক্রিপশন ব্যবহৃত হয়। যে কোম্পানিগুলো এই প্রয়োজনীয়তাকে অবহেলা করবে তারা জরিমানা, ইউরোপে বাজার প্রবেশের সুযোগ হারানো বা তাদের পরিষেবাগুলো জোরপূর্বক সরিয়ে ফেলার ঝুঁকির সম্মুখীন হতে পারে।
বিতর্কের বিষয়সমূহ
সমালোচকরা যুক্তি দিচ্ছেন যে একটি লুকানো সিগনেচার, এমনকি তা অদৃশ্য হলেও, নিয়ন্ত্রক কমপ্লায়েন্সের বাইরে ট্র্যাকিং বা অ্যাট্রিবিউশনের জন্য পুনরায় ব্যবহার করা হতে পারে। তারা 'ফলস পজিটিভ' (false positives) নিয়েও শঙ্কিত: একটি ডিটেকশন API যদি মানুষের লেখা টেক্সটকে ভুলভাবে চিহ্নিত করে, তবে সেই সিগন্যালের ওপর নির্ভরশীল প্ল্যাটফর্মগুলোর প্রতি মানুষের আস্থা কমে যেতে পারে। Anthropic এই ঝুঁকিগুলো স্বীকার করেছে এবং জানিয়েছে যে ডিটেকশন অ্যালগরিদমটি ওপেন-সোর্স হবে, যা স্বাধীন অডিট এবং ক্যালিব্রেশন করার সুযোগ দেবে।
আরেকটি ব্যবহারিক উদ্বেগ হলো ওয়াটারমার্ক তৈরির ক্ষেত্রে কম্পিউটেশনাল ওভারহেড (computational overhead)। Anthropic জানিয়েছে যে অতিরিক্ত প্রসেসিংয়ের ফলে ইনফারেন্স টাইম (inference time) মাত্র এক শতাংশের সামান্য ভগ্নাংশ বৃদ্ধি পায়, যা শীঘ্রই থার্ড-পার্টি বেঞ্চমার্কের মাধ্যমে যাচাই করা হবে।
পরবর্তীতে যা নজর রাখা প্রয়োজন
- API রোলআউট – Anthropic একটি পাবলিক এন্ডপয়েন্ট (public endpoint) প্রকাশ করার পরিকল্পনা করছে যা যেকোনো Claude আউটপুট থেকে লুকানো বিট প্যাটার্ন বের করে আনতে পারবে। ডেভেলপাররা এই যাচাইকরণ প্রক্রিয়াটি কন্টেন্ট-মডারেশন পাইপলাইনে যুক্ত করতে পারবেন।
- মানকীকরণ প্রচেষ্টা (Standardization efforts) – নিয়ন্ত্রক সংস্থা এবং শিল্প গোষ্ঠীগুলো ওয়াটারমার্ক মেটাডেটার জন্য একটি সাধারণ ফরম্যাট তৈরি করছে, যা ক্রস-মডেল ডিটেকশনকে সহজতর করতে পারে।
- অভিজ্ঞতামূলক গবেষণা (Empirical studies) – স্বতন্ত্র গবেষকরা অ্যাডভারসারিয়াল রিরাইটিং টুলগুলোর (adversarial rewriting tools) বিরুদ্ধে SynthID-Text-এর সহনশীলতা পরীক্ষা করতে শুরু করেছেন। তাদের প্রাপ্ত ফলাফল নির্ধারণ করবে প্ল্যাটফর্মগুলো এই সিগন্যালের ওপর কতটা আস্থা রাখতে পারে।
মূল কথা
Anthropic-এর SynthID-Text গ্রহণ করার ফলে AI কমিউনিটি একটি সুনির্দিষ্ট টুল পেয়েছে, যা Claude-এর আউটপুট কোয়ালিটি ঠিক রেখে ইউরোপের আসন্ন স্বচ্ছতা সংক্রান্ত নিয়মগুলো মেনে চলতে সাহায্য করবে। এই ওয়াটারমার্কটি সাধারণ প্রুফরিডিংয়ের পরেও টিকে থাকে, কিন্তু টেক্সটটি সম্পূর্ণভাবে পুনরায় জেনারেট করা হলে তা হারিয়ে যায়; এছাড়া এটি প্রোগ্রামিং আউটপুটের নন-কোড অংশে থাকে যাতে এটি কার্যকারিতায় কোনো বাধা সৃষ্টি না করে। এই পদ্ধতিটি শিল্পের মানদণ্ড হয়ে উঠবে কি না, তা নির্ভর করছে বাস্তব পরিস্থিতিতে ডিটেকশন API কতটা কার্যকরভাবে কাজ করে এবং গোপনীয়তা ও ফলস অ্যালার্ম সংক্রান্ত উদ্বেগগুলো সমাধান করা সম্ভব হয় কি না তার ওপর।
