Google DeepMind ได้เปิดตัวโครงการนำร่องที่ใช้การทดสอบประสิทธิภาพแบบ cryptographic double-blind benchmarking เพื่อประเมินโมเดล Gemini Flash Lite โดยไม่ต้องเปิดเผยคำสั่งทดสอบ (test prompts) หรือค่าน้ำหนักของโมเดล (model weights) การประเมินนี้ดำเนินการภายใน Confidential Space ของ Google Cloud ดังนั้นผู้ประเมินจึงไม่เห็นโมเดล และโมเดลก็ไม่เห็นคำถาม ซึ่งเป็นแนวทางที่อาจช่วยกู้คืนความน่าเชื่อถือให้กับรายงานประสิทธิภาพของ AI ได้
ทำไมการปนเปื้อนของชุดทดสอบ (benchmark contamination) จึงสำคัญ
หากโมเดลถูกฝึกฝนด้วยข้อมูลที่จะปรากฏในชุดทดสอบในภายหลัง คะแนนที่ได้จะไม่ใช่การวัดความสามารถในการใช้เหตุผล แต่จะกลายเป็นการวัดความสามารถในการจดจำแทน ดังนั้น ผลลัพธ์ที่สมบูรณ์แบบจากการทดสอบที่มีการปนเปื้อนจึงไม่ได้บอกอะไรเกี่ยวกับความสามารถที่แท้จริงเลย นักวิจัยต้องเผชิญกับสภาวะย้อนแย้งมานาน: พวกเขาต้องส่งข้อมูลทดสอบให้ผู้ให้บริการโมเดลเพื่อตรวจสอบชุดทดสอบ ซึ่งเสี่ยงต่อการถูกเปิดเผยข้อมูลก่อนเวลาอันควร หรือต้องปฏิเสธการเข้าถึงจากภายนอกเพื่อปกป้องค่าน้ำหนักที่เป็นความลับ ซึ่งจะทำให้การตรวจสอบไม่สามารถยืนยันได้ ความล่าช้าในการประเมิน Anthropic’s Fable 5 บนชุดทดสอบ ARC-AGI เมื่อเร็วๆ นี้ แสดงให้เห็นว่านโยบายการเก็บรักษาข้อมูลที่เข้มงวดสามารถขัดขวางการประเมินที่เป็นอิสระได้อย่างไร
โซลูชันด้วยการเข้ารหัส
โครงการนำร่องนี้เปลี่ยนจากการใช้สัญญาทางกฎหมายและคำสัญญาเรื่อง “การไม่บันทึกข้อมูล” (zero-logging) มาเป็นการใช้มาตรการป้องกันทางเทคนิคแทน Confidential Space สร้างสภาพแวดล้อมที่แยกส่วนด้วยฮาร์ดแวร์ (hardware-isolated enclave) เพื่อรันโมเดล Gemini Flash Lite ผู้ประเมินจะอัปโหลดชุดทดสอบ ซึ่ง enclave จะทำการปิดผนึกไว้ใน “กล่อง” การเข้ารหัสที่โมเดลไม่สามารถเปิดได้ ในขณะเดียวกัน ค่าน้ำหนักของโมเดลจะยังคงถูกเข้ารหัสไว้ภายใน enclave ทำให้ผู้ประเมินมองไม่เห็น Enclave จะสร้างหลักฐานทางคณิตศาสตร์ที่พิสูจน์ได้ว่าโมเดลไม่เคยเข้าถึงคำสั่ง (prompts) ในระหว่างการประมวลผล (inference) ผลลัพธ์ที่ได้คือการทดสอบแบบ double-blind อย่างแท้จริง: ทั้งสองฝ่ายต่างรักษาความลับของตนไว้ ในขณะที่บุคคลที่สามจะได้รับตัวชี้วัดประสิทธิภาพที่สามารถตรวจสอบได้
ใครจะได้รับประโยชน์
- หน่วยงานกำกับดูแลและผู้ตรวจสอบ สามารถเรียกร้องหลักฐานความสามารถได้โดยไม่ต้องบังคับให้ผู้ให้บริการเปิดเผยความลับทางการค้า
- องค์กรในด้านความมั่นคงปลอดภัยไซเบอร์ การป้องกันประเทศ หรือโดเมนใดก็ตามที่จัดการข้อมูลลับ สามารถทดสอบเครื่องมือ AI ได้โดยไม่ต้องเสี่ยงต่อการรั่วไหลของข้อมูล
- นักพัฒนาโมเดล ยังคงรักษาความได้เปรียบทางการแข่งขันไว้ได้ โดยไม่จำเป็นต้องเลือกระหว่างความโปร่งใสและการปกป้องข้อมูลอีกต่อไป
หากแนวทางนี้สามารถขยายผลได้ มันอาจกลายเป็นวิธีการมาตรฐานสำหรับการรับรองโมเดลระดับแนวหน้า (frontier models) ซึ่งจะเปลี่ยนอุตสาหกรรมจากการตกลงกันด้วยความเชื่อใจ ไปสู่การรับประกันด้วยหลักการทางคณิตศาสตร์
จุดที่อาจเกิดปัญหา
ระบบนี้พึ่งพาชุดเทคโนโลยี confidential computing ของ Google Cloud ดังนั้นองค์กรที่ต้องการใช้ผู้ให้บริการคลาวด์รายอื่นอาจประสบปัญหาในการเชื่อมต่อระบบ (integration) การรันโมเดลภายใน enclave จะเพิ่มความหน่วง (latency) และจำกัดตัวเร่งความเร็วฮาร์ดแวร์ที่มีให้ ซึ่งอาจส่งผลต่อคะแนนชุดทดสอบ นอกจากนี้ แม้ว่าหลักฐานการเข้ารหัสจะรับประกันว่าโมเดลไม่เห็นคำสั่ง แต่ก็ไม่ได้ป้องกันการดัดแปลงอื่นๆ เช่น การทำ fine-tuning หลังจากเริ่มการทดสอบ นักวิจารณ์อาจโต้แย้งว่าโซลูชันนี้แก้ปัญหาได้เพียงส่วนเล็กๆ ของปัญหาเรื่องความสามารถในการทำซ้ำ (reproducibility) ที่กว้างกว่านั้น
สิ่งที่ต้องจับตามองต่อไป
- การนำไปใช้ที่มากกว่าโครงการนำร่อง – ห้องปฏิบัติการ AI และผู้ให้บริการคลาวด์รายอื่นอาจสร้าง enclave ที่เข้ากันได้ เพื่อทดสอบว่าโมเดลสามารถถูกตรวจสอบข้ามแพลตฟอร์มได้หรือไม่
- หน่วยงานกำหนดมาตรฐาน – กลุ่มความปลอดภัยของ AI อาจกำหนดให้การตรวจสอบด้วยการเข้ารหัสแบบ double-blind เป็นส่วนหนึ่งของกรอบการรับรองมาตรฐาน
- การแลกเปลี่ยนด้านประสิทธิภาพ (Performance trade-offs) – การรันชุดทดสอบในโลกความเป็นจริงจะเผยให้เห็นว่าภาระงานส่วนเกิน (overhead) ของการประมวลผลแบบ confidential นั้นยอมรับได้หรือไม่สำหรับโมเดลขนาดใหญ่
บทสรุป
ด้วยการล็อกทั้งข้อมูลทดสอบและโมเดลไว้ภายในสภาพแวดล้อมการเข้ารหัสที่ต่างฝ่ายต่างมองไม่เห็นกัน โครงการนำร่องของ Google DeepMind จึงเสนอแนวทางที่เป็นรูปธรรมสู่การทดสอบประสิทธิภาพ AI ที่น่าเชื่อถือ วิธีนี้ไม่ได้กำจัดความท้าทายในการตรวจสอบทั้งหมด แต่ช่วยขจัดแหล่งที่มาของความลำเอียงที่ชัดเจนที่สุด นั่นคือการปนเปื้อนของชุดทดสอบ (benchmark contamination) โดยไม่ต้องบังคับให้ฝ่ายใดฝ่ายหนึ่งต้องสละสินทรัพย์ที่มีค่าที่สุดของตน หากชุมชนยอมรับเทคนิคนี้ รายงานความก้าวหน้าของ AI ในอนาคตอาจสามารถเชื่อถือได้ตามข้อมูลที่ปรากฏจริง
