Google ได้เปลี่ยนกฎกติกาใหม่ หากคุณถ่ายภาพผ่าน Google Lens เมื่อสัปดาห์ที่แล้ว ฝึกพูดวลีภาษาสเปนออกเสียงผ่าน Google Translate หรือขอให้ Maps ช่วยหาที่กินมื้อเที่ยง เนื้อหาเหล่านั้นอาจกำลังอยู่ในคิวเพื่อนำไปฝึกฝนโมเดล AI เชิงสร้างสรรค์ (generative AI models) ของบริษัท เมื่อเร็วๆ นี้ Google ได้ปรับโครงสร้างสถาปัตยกรรมความเป็นส่วนตัวใหม่ เพื่อให้รูปภาพ คลิปเสียง และวิดีโอที่ผู้ใช้อัปโหลดผ่านระบบนิเวศของบริษัทสามารถถูกเก็บรักษาและนำไปใช้เพื่อสร้างระบบการเรียนรู้ของเครื่อง (machine learning systems) ได้ นี่คือการเปลี่ยนทิศทางอย่างจงใจ จากการดึงข้อมูล (scraping) จากหน้าเว็บสาธารณะ ไปสู่การเก็บเกี่ยวการปฏิสัมพันธ์ที่มีความตั้งใจสูง (high-intent interactions) ที่ผู้คนมีกับผลิตภัณฑ์ของ Google ในทุกๆ วัน
การเปลี่ยนแปลงนโยบายอย่างเงียบเชียบ
นี่ไม่ใช่การอัปเดตข้อกำหนดการให้บริการตามปกติ เป็นเวลาหลายปีที่วิธีการมาตรฐานในการฝึกโมเดล AI ขนาดใหญ่คือการรวบรวมข้อมูล (crawling) จากหน้าเว็บสาธารณะหลายพันล้านหน้า โดยการรวบรวมข้อความ รูปภาพ และลิงก์ที่เปิดเผยต่อโลกอยู่แล้ว แต่วิธีการนั้นมีข้อจำกัด เนื่องจากเว็บสาธารณะมีอยู่อย่างจำกัด และในหลายๆ ด้าน ข้อมูลสาธารณะที่มีค่าที่สุดก็ได้ถูกดึงออกมาและป้อนเข้าสู่ระบบที่มีอยู่เดิมไปหมดแล้ว คู่แข่งอย่าง Meta ก็เพิ่งจะหันมาใช้เนื้อหาที่ผู้ใช้สร้างขึ้น (user-generated content) และตอนนี้ Google ก็กำลังเคลื่อนที่ไปในทิศทางเดียวกัน
การอัปเดตนี้ส่งถึงผู้ใช้ผ่านอีเมลแจ้งลูกค้า ซึ่งได้แนะนำการควบคุมความเป็นส่วนตัวใหม่สองรายการ ได้แก่ Search Services History และ Personalized Recommendations หากมองเพียงผิวเผิน สิ่งเหล่านี้ดูเหมือนเป็นเครื่องมือปรับแต่งเฉพาะบุคคลมาตรฐานที่มีไว้เพื่อช่วยให้การค้นหาครั้งต่อไปของคุณรวดเร็วขึ้นหรือปรับปรุงคำแนะนำให้ดีขึ้น อย่างไรก็ตาม เมื่ออ่านรายละเอียดตัวอักษรเล็กๆ จะเห็นขอบเขตที่ชัดเจน Google ระบุว่าสื่อที่บันทึกไว้สามารถนำไปใช้เพื่อ "พัฒนาและปรับปรุงบริการและเทคโนโลยีของ Google รวมถึงโมเดล AI และมาตรการความปลอดภัย" การใช้คำนั้นกว้างมาก การตั้งค่าเริ่มต้นคือ "เปิด" และการเลือกยกเลิก (opting out) นั้นกำหนดให้คุณต้องรู้ว่าต้องไปหาที่ไหน
สิ่งที่ Google ต้องการจากคุณจริงๆ
ขอบเขตการเก็บข้อมูลครอบคลุมเกือบทุกบริการหลักของ Google ที่คุณใช้งาน เมื่อนักท่องเที่ยวใช้ Google Lens ส่องป้ายถนนในต่างประเทศหรือเมนูอาหาร ข้อมูลภาพที่ได้รับจะไม่หายไปเฉยๆ หลังจากแสดงผลลัพธ์ เมื่อนักเรียนใช้ Google Translate เพื่อฝึกพูดออกเสียง ไฟล์เสียงที่บันทึกระหว่างเซสชันเหล่านั้นก็มีสิทธิ์ถูกเก็บรักษาไว้ คำสั่งเสียงที่ส่งผ่าน Search Live หรือการค้นหาด้วยเสียงมาตรฐานก็อยู่ภายใต้นโยบายเดียวกัน แม้แต่การใช้งานปกติกับ Maps, Shopping, Flights, Hotels และ News ก็สามารถสร้างสื่อที่ Google จัดประเภทว่าเป็นข้อมูลสำหรับฝึกฝนได้ในขณะนี้
ก่อนหน้านี้ ผู้ใช้ที่ให้ความสำคัญกับความเป็นส่วนตัวสามารถใช้สวิตช์ Web & App Activity เพื่อจำกัดปริมาณข้อมูลการปฏิสัมพันธ์ที่ Google จะเก็บไว้ แต่กลยุทธ์นั้นใช้ไม่ได้อีกต่อไป Google ได้แยกการตั้งค่าใหม่เหล่านี้ออกจาก Web & App Activity อย่างชัดเจน โดย Search Services History เป็นการควบคุมแบบอิสระ ซึ่งจะถูกเปิดไว้เป็นค่าเริ่มต้น และไม่ว่าคุณจะเลือกตั้งค่าอะไรไว้ในแดชบอร์ดความเป็นส่วนตัวเมื่อสองหรือสามปีที่แล้ว ก็จะไม่สามารถหยุดไม่ให้สื่อที่เกี่ยวข้องกับการค้นหาของคุณถูกจัดเก็บเพื่อการฝึก AI ได้ สวิตช์ปิดแบบเดิมไม่สามารถควบคุมวงจรเฉพาะส่วนนี้ได้อีกต่อไป
วิธีการปฏิเสธการเข้าร่วมอย่างแท้จริง
Google มีวิธีให้คุณยกเลิกด้วยตนเอง แต่ภาระทั้งหมดตกอยู่ที่คุณ ไม่มีปุ่มเปิด-ปิดสำหรับทั้งบัญชีที่จะปิดการเก็บข้อมูลเพื่อฝึก AI ได้ในคลิกเดียว คุณจำเป็นต้องเข้าไปที่หน้าเฉพาะสองหน้าในแดชบอร์ดบัญชี Google ของคุณ ได้แก่ หน้า Search Services History และหน้า Search Services Personalization
เมื่อคุณเข้าไปใน Search Services History แล้ว ให้เลื่อนลงไปจนพบช่องทำเครื่องหมาย "Save Media" จากนั้นให้ติ๊กออก การดำเนินการเพียงครั้งเดียวนี้คือสิ่งที่ป้องกันไม่ให้รูปภาพ เสียง และวิดีโอในอนาคตถูกจัดเก็บและอาจถูกนำไปป้อนเข้าสู่การฝึกโมเดล อย่าทึกทักเอาเองว่าการปิด Web & App Activity จะจัดการเรื่องนี้ให้คุณ เพราะมันจะไม่เป็นเช่นนั้น การแยกส่วนการตั้งค่านี้ทำอย่างชัดเจนและสังเกตเห็นได้ยาก ซึ่งหมายความว่าผู้ใช้จำนวนมากจะเชื่อว่าพวกเขาได้ยกเลิกการเข้าร่วมแล้ว ทั้งที่ความจริงยังไม่ได้ทำ
หลังจากที่คุณปิดการบันทึกสื่อแล้ว ให้ตั้งค่าความต้องการการลบอัตโนมัติ (auto-delete) ในขณะที่คุณยังอยู่ในแดชบอร์ดเดียวกัน Google มีให้เลือกสามทางเลือก ได้แก่ ลบข้อมูลหลังจาก 3 เดือน, 18 เดือน หรือ 36 เดือน หากคุณต้องการการควบคุมที่เข้มงวดที่สุด ให้เลือกช่วงเวลาสามเดือน นั่นคือรอบการล้างข้อมูลที่สั้นที่สุดที่ Google อนุญาตผ่านการควบคุมนี้ และมันจะช่วยจำกัดข้อมูลย้อนหลังจากการปฏิสัมพันธ์ของคุณ โปรดจำไว้ว่าการปิด Save Media จะหยุดการเก็บข้อมูลในอนาคตเท่านั้น สิ่งใดก็ตามที่ Google ได้บันทึกไว้ภายใต้การตั้งค่าก่อนหน้านี้อาจยังคงอยู่ในที่จัดเก็บ เว้นแต่คุณจะลบประวัติที่มีอยู่ด้วยตนเองผ่านเครื่องมือจัดการบัญชีแบบเดียวกัน
หากคุณจัดการบัญชีครอบครัวที่ใช้ร่วมกันหรือพื้นที่ทำงาน (workspace) ที่มีผู้คนหลายคนใช้งานบริการของ Google ทุกคนที่มีสิทธิ์เข้าถึงควรตรวจสอบการตั้งค่าเหล่านี้ด้วยตนเอง การควบคุมการปรับแต่งเฉพาะบุคคล (Personalization controls) จะผูกติดกับบัญชี ไม่ใช่ตัวอุปกรณ์ และการเลือกเข้าร่วม (opt-in) โดยค่าเริ่มต้นจะมีผลครอบคลุมทั้งหมด
สิ่งนี้บอกอะไรเราเกี่ยวกับก้าวต่อไปของ AI
การเปลี่ยนแปลงนโยบายนี้เป็นสัญญาณที่ชัดเจนว่าอุตสาหกรรมกำลังมุ่งหน้าไปในทิศทางใด ข้อมูลบนเว็บสาธารณะถูกนำมาใช้เป็นข้อมูลสำหรับฝึกฝนจนแทบจะหมดสิ้นแล้ว พรมแดนถัดไปในการพัฒนาโมเดลภาษาขนาดใหญ่ (large language models) และระบบมัลติโมดัล (multimodal systems) คือข้อมูลที่เป็นกรรมสิทธิ์ซึ่งสร้างขึ้นโดยผู้คนจริงๆ ภายในแพลตฟอร์มแบบปิด การค้นหาด้วยภาพของคุณมีบริบทเชิงพื้นที่ (spatial context) การฝึกแปลภาษาของคุณมีรูปแบบการออกเสียงและเจตนาในการสนทนา คำสั่งเสียงของคุณมีน้ำเสียง การใช้สำนวน และความเร่งด่วนที่ข้อความบนเว็บแบบคงที่ (static web text) ไม่สามารถเลียนแบบได้
สำหรับนักพัฒนา ผู้ก่อตั้ง และใครก็ตามที่เฝ้าดูภูมิทัศน์การแข่งขัน นัยสำคัญนั้นตรงไปตรงมา "คูเมืองข้อมูล" (data moat) ที่แบ่งแยกโมเดลภาษาขนาดใหญ่รุ่นหนึ่งออกจากอีกรุ่นหนึ่ง กำลังถูกขุดขึ้นมาจากปฏิสัมพันธ์ส่วนตัวและการอัปโหลดของผู้ใช้งานในแพลตฟอร์มนั้นๆ มากขึ้นเรื่อยๆ การรวบรวมข้อมูลเว็บแบบโอเพนซอร์ส (Open-source web crawls) ยังคงมีประโยชน์ แต่ข้อมูลที่มีมูลค่าสูงสุดในตอนนี้คือข้อมูลประเภทที่คุณสร้างขึ้นในขณะที่ล็อกอินเข้าสู่บริการและกำลังพยายามทำบางสิ่งบางอย่างให้สำเร็จ
บทสรุป
แนวทางความเป็นส่วนตัวแบบเดิมของคุณนั้นล้าสมัยไปแล้ว ระบอบการใช้ข้อมูลฝึกฝนใหม่ของ Google กำหนดให้คุณต้องเลือกยกเลิกการเข้าร่วม (opt-out) อย่างเจาะจงและตั้งใจภายใน Search Services History โดยการยกเลิกการเลือกช่อง Save Media การดำเนินการดังกล่าว เมื่อรวมกับการตั้งค่าลบข้อมูลอัตโนมัติ (auto-delete) ในระยะเวลาที่สั้น เป็นวิธีเดียวที่เชื่อถือได้ในการป้องกันไม่ให้รูปภาพ เสียง และวิดีโอที่คุณอัปโหลดเข้าไปอยู่ในกระบวนการฝึกฝน AI ของ Google ช่วยกันบอกต่อด้วย เพราะค่าเริ่มต้นไม่ได้ถูกตั้งไว้เพื่อประโยชน์ของคุณอีกต่อไปแล้ว