Anthropic ได้ฝังรูปแบบทางสถิติที่ซ่อนอยู่—SynthID-Text—ลงในทุกคำตอบของ Claude แล้ว บริษัทระบุว่าการดำเนินการนี้เป็นไปเพื่อตอบสนองต่อ Transparency Code ของ EU AI Act และช่วยให้นักพัฒนาสามารถพิสูจน์ได้ว่าข้อความนั้นมาจากโมเดล AI ลายน้ำนี้จะยังคงอยู่แม้จะมีการแก้ไขเล็กน้อย โดยไม่กระทบต่อสำนวนภาษาสำหรับผู้อ่านที่เป็นมนุษย์
ทำไมจึงต้องมีการเพิ่มลายน้ำ
หน่วยงานกำกับดูแลของยุโรปได้กดดันผู้ให้บริการโมเดลภาษาขนาดใหญ่ (LLM) ให้ทำให้เนื้อหาที่สร้างโดย AI สามารถแยกแยะออกจากงานเขียนของมนุษย์ได้ Transparency Code ของ EU AI Act ซึ่งกำลังจะเริ่มบังคับใช้ทั่วทั้งกลุ่มสหภาพยุโรป กำหนดให้ผู้พัฒนาต้องจัดหาวิธีการตรวจจับที่เชื่อถือได้สำหรับข้อความใดก็ตามที่โมเดลของตนผลิตขึ้น Anthropic จึงตอบรับด้วยการนำเทคนิค SynthID-Text ที่ Google DeepMind ได้อธิบายไว้เมื่อปีที่แล้วมาใช้
การตัดสินใจนี้ทำให้เกิดการถกเถียงอย่างกว้างขวางบน Reddit และ X โดยผู้ใช้กังวลว่าลายน้ำอาจทำให้คุณภาพของผลลัพธ์ลดลง หรือกลายเป็นช่องทางลับสำหรับการสอดแนม Anthropic โต้แย้งว่ารูปแบบดังกล่าวเป็นสิ่งที่ผู้อ่านมองไม่เห็น ไม่ทำให้เกิดความล่าช้า (latency) และสามารถปิดใช้งานได้สำหรับการใช้งานแบบส่วนตัว การเปิดเผยรายละเอียดทางเทคนิคนี้ บริษัทหวังว่าจะช่วยลดการคาดเดาและสร้างมาตรฐานให้กับอุตสาหกรรม
SynthID-Text ทำงานอย่างไร
เครื่องมือตรวจจับ AI แบบดั้งเดิมจะสแกนหาความผิดปกติทางภาษา เช่น การใช้สำนวนซ้ำๆ เครื่องหมายวรรคตอนที่แปลกประหลาด หรือความเบี่ยงเบนทางสถิติจากการเขียนของมนุษย์ สัญญาณเหล่านี้จะหายไปทันทีที่มนุษย์เขียนย่อหน้าใหม่ ทำให้เครื่องมือตรวจจับขาดความน่าเชื่อถือ ในทางตรงกันข้าม SynthID-Text จะฝังสัญญาณลับในระหว่างขั้นตอนการเลือกโทเคน (token-selection) ของโมเดล
เมื่อ Claude ต้องเลือกระหว่างโทเคนสองคำที่มีความหมายใกล้เคียงกัน เช่น “overcast” เทียบกับ “grey” ระบบจะผลักดันการตัดสินใจไปยังคำที่สอดคล้องกับรูปแบบไบนารี (binary pattern) ที่คำนวณไว้ล่วงหน้า เมื่อพิจารณาตลอดความยาวของเอกสาร การผลักดันเหล่านี้จะสร้างลำดับของบิต (bits) ที่ API สำหรับการตรวจจับสามารถดึงออกมาได้ในภายหลัง รูปแบบนี้ถูกออกแบบมาให้มีผลกระทบต่ำอย่างตั้งใจ: คำพ้องความหมายที่ถูกเลือกยังคงเป็นคำที่เป็นธรรมชาติอย่างสมบูรณ์ ดังนั้นการไหลลื่นของข้อความจึงไม่เปลี่ยนแปลง เนื่องจากลายน้ำอยู่ในกระแสของโทเคน (token stream) ไม่ใช่ในข้อความที่ปรากฏ (surface text) มันจึงสามารถทนทานต่อการประมวลผลในขั้นตอนต่อๆ ไปส่วนใหญ่ที่ไม่ได้ทำการแทนที่ทุกโทเคน
ความทนทานต่อการแก้ไข: สิ่งใดที่อยู่รอดและสิ่งใดที่ไม่รอด
ข้อวิจารณ์ที่พบบ่อยคือ ผู้ใช้อาจเพียงแค่แก้ไขข้อความที่สร้างโดย AI เพื่อลบลายน้ำออก การทดสอบภายในของ Anthropic ได้สรุปสถานการณ์การแก้ไขไว้สามรูปแบบ:
- การแก้ไขเล็กน้อย (Light editing) – การแก้ไขคำผิด การเปลี่ยนคำคุณศัพท์บางคำ หรือการปรับลำดับประโยค ลายน้ำที่เป็นลายเซ็นทางสถิติจะยังคงอยู่เกือบครบถ้วนเนื่องจากโทเคนส่วนใหญ่ไม่มีการเปลี่ยนแปลง
- การแก้ไขหนักโดยใช้ Claude ช่วย (Heavy Claude-assisted editing) – การสั่งให้ Claude เขียนร่างใหม่ที่มีประโยคที่สร้างโดย AI อยู่แล้ว หากผู้ใช้ยังคงควบคุมการใช้คำส่วนใหญ่ไว้ สัญญาณของลายน้ำจะอ่อนกำลังลงตามสัดส่วนของข้อความใหม่ที่มนุษย์เป็นผู้เลือก
- การเขียนใหม่ทั้งหมด (Complete rewriting) – การแทนที่ทุกโทเคนด้วยการสร้างใหม่ทั้งหมดหรือการเขียนใหม่ด้วยมือ ในจุดนั้นลายน้ำเดิมจะถูกทำลายลง แต่ข้อความที่ได้จะไม่เข้าข่ายนิยามของ “AI-generated” ตามมาตรฐานของ EU อีกต่อไป เนื่องจากไม่มีร่องรอยของผลลัพธ์จากโมเดลเดิมหลงเหลืออยู่
บทสรุปคือ: ลายน้ำสามารถทนทานต่อการขัดเกลาทั่วไป แต่ไม่สามารถทนทานต่อการสร้างเนื้อหาขึ้นมาใหม่ทั้งหมดได้
การสร้างโค้ด: จุดที่ลายน้ำอาศัยอยู่
Claude ถูกใช้อย่างแพร่หลายในฐานะผู้ช่วยเขียนโค้ด โดยผลิตตั้งแต่โค้ดสั้นๆ เพียงบรรทัดเดียวไปจนถึงโมดูลแบบ full-stack ภาษาโปรแกรมมีพื้นที่ให้เลือกคำพ้องความหมายน้อยมาก การเปลี่ยนโทเคนอย่าง “for” เป็น “while” จะทำให้ตรรกะเปลี่ยนไป ดังนั้น Anthropic จึงคาดว่าลายน้ำจะปรากฏเกือบจะเฉพาะในส่วนที่โมเดลมีอิสระในการเลือกคำเท่านั้น เช่น คอมเมนต์ (comments), docstrings และข้อความอธิบายที่มาพร้อมกับโค้ด
เนื่องจากส่วนที่เป็นฟังก์ชันของโค้ดไม่ถูกแตะต้อง นักพัฒนาจึงไม่ควรพบปัญหาเรื่องความถูกต้องหรือประสิทธิภาพที่ลดลง การมีอยู่ของลายน้ำจะจำกัดอยู่เพียงข้อความประกอบที่ช่วยให้มนุษย์เข้าใจโค้ด ซึ่งเป็นการตอบสนองต่อข้อกำหนดด้านความโปร่งใสโดยไม่กระทบต่อการใช้งาน
ผลกระทบต่อเนื่องในอุตสาหกรรม
Anthropic ไม่ได้ดำเนินการเพียงลำพัง ผู้พัฒนา LLM รายอื่นๆ อีกหลายรายได้ลงนามใน Code of Practice ฉบับเดียวกันที่เรียกร้องให้มี API สำหรับการตรวจจับที่เป็นมาตรฐาน หากกรอบเวลาการบังคับใช้ของ EU ดำเนินไปตามแผน การทำลายน้ำ (watermarking) อาจกลายเป็นเลเยอร์พื้นฐานใน LLM stack เช่นเดียวกับการเข้ารหัสข้อมูล (encryption) ในปัจจุบัน บริษัทที่เพิกเฉยต่อข้อกำหนดนี้อาจเสี่ยงต่อการถูกปรับ การสูญเสียโอกาสในการเข้าถึงตลาดในยุโรป หรือถูกบังคับให้ถอนบริการออกไป
ประเด็นที่ยังเป็นข้อถกเถียง
นักวิจารณ์โต้แย้งว่าลายเซ็นที่ซ่อนอยู่ แม้จะมองไม่เห็นด้วยตาเปล่า แต่อาจถูกนำไปใช้ในทางอื่นเพื่อการติดตามหรือการระบุตัวตนที่เกินกว่าขอบเขตของการปฏิบัติตามกฎระเบียบ พวกเขายังเกรงว่าจะเกิด false positives: กล่าวคือ หาก detection API ระบุข้อความที่เขียนโดยมนุษย์ผิดพลาด อาจทำลายความเชื่อมั่นในแพลตฟอร์มที่ต้องพึ่งพาสัญญาณดังกล่าว Anthropic ยอมรับความเสี่ยงเหล่านี้และระบุว่าอัลกอริทึมการตรวจจับจะเป็นแบบ open-source เพื่อเปิดโอกาสให้มีการตรวจสอบและปรับเทียบ (calibration) โดยหน่วยงานอิสระ
อีกหนึ่งความกังวลในทางปฏิบัติคือภาระการประมวลผล (computational overhead) ในการสร้างลายน้ำ Anthropic รายงานว่าการประมวลผลเพิ่มเติมนี้เพิ่มเวลาในการประมวลผล (inference time) ไม่ถึงเศษเสี้ยวของเปอร์เซ็นต์ ซึ่งเป็นข้อกล่าวอ้างที่ผลการทดสอบ (benchmarks) จากหน่วยงานภายนอกจะทำการพิสูจน์ในเร็วๆ นี้
สิ่งที่ต้องจับตามองต่อไป
- การเปิดตัว API – Anthropic วางแผนที่จะปล่อย public endpoint ที่สามารถดึงรูปแบบบิต (bit pattern) ที่ซ่อนอยู่จากผลลัพธ์ใดๆ ของ Claude ได้ นักพัฒนาจะสามารถรวมการตรวจสอบนี้เข้ากับขั้นตอนการตรวจสอบเนื้อหา (content-moderation pipelines) ได้
- ความพยายามในการกำหนดมาตรฐาน – หน่วยงานกำกับดูแลและกลุ่มอุตสาหกรรมกำลังร่างรูปแบบมาตรฐานสำหรับ metadata ของลายน้ำ ซึ่งอาจช่วยให้การตรวจจับข้ามโมเดลทำได้ง่ายขึ้น
- การศึกษาเชิงประจักษ์ – นักวิจัยอิสระเริ่มทำการตรวจสอบความทนทานของ SynthID-Text ต่อเครื่องมือเขียนใหม่เชิงรุก (adversarial rewriting tools) ผลการศึกษาของพวกเขาจะเป็นตัวกำหนดว่าแพลตฟอร์มต่างๆ จะให้ความเชื่อมั่นในสัญญาณนี้มากน้อยเพียงใด
บทสรุป
การนำ SynthID-Text มาใช้ของ Anthropic ช่วยให้ชุมชน AI มีเครื่องมือที่เป็นรูปธรรมในการปฏิบัติตามกฎระเบียบด้านความโปร่งใสของยุโรปที่กำลังจะมาถึง ในขณะที่ยังคงรักษาคุณภาพของผลลัพธ์จาก Claude ไว้ได้อย่างครบถ้วน ลายน้ำนี้จะยังคงอยู่แม้ผ่านการพิสูจน์อักษรทั่วไป แต่จะหายไปเมื่อข้อความถูกสร้างขึ้นใหม่ทั้งหมด นอกจากนี้ ลายน้ำจะอยู่ในส่วนที่ไม่ใช่โค้ดของผลลัพธ์การเขียนโปรแกรม ซึ่งจะไม่รบกวนการทำงานของโค้ด การที่แนวทางนี้จะกลายเป็นมาตรฐานของอุตสาหกรรมหรือไม่นั้น ขึ้นอยู่กับว่า detection API จะทำงานได้ดีเพียงใดในสภาพแวดล้อมการใช้งานจริง และข้อกังวลเกี่ยวกับความเป็นส่วนตัวและการแจ้งเตือนที่ผิดพลาด (false alarms) จะได้รับการแก้ไขหรือไม่
