เครื่องมือ Deep Research ใหม่ของ Claude สามารถประมวลผลได้ถึง 6.57 ล้านโทเคน ในการเรียกใช้งานเพียงครั้งเดียว ซึ่งเป็นสิ่งที่ต้องใช้ทรัพยากรการประมวลผลมหาศาลเท่านั้นจึงจะรองรับได้ ระบบนี้ไม่ใช่โมเดลภาษาแบบโมโนลิทิก (monolithic language model) แต่ทำงานในรูปแบบไปป์ไลน์ JavaScript แบบ map-reduce ที่กระจายการค้นหาออกไป ดึงข้อมูล นำข้อกล่าวอ้างไปตรวจสอบกับผู้ตรวจสอบอิสระสามราย และสังเคราะห์ออกมาเป็นรายงาน

ทำไมสถาปัตยกรรมนี้ถึงสำคัญ

ผู้ช่วยวิจัยที่ขับเคลื่อนด้วย AI ส่วนใหญ่มักนำเสนออินเทอร์เฟซแบบ "ถาม-ตอบ" (ask-and-answer) เพียงอย่างเดียว ซึ่งปล่อยให้โมเดลสร้างข้อความและแหล่งอ้างอิงออกมาในคราวเดียว แต่ Deep Research ของ Claude พลิกรูปแบบนั้นโดยสิ้นเชิง โดยการแบ่งงานออกเป็นขั้นตอนที่แยกจากกันและมีการกำหนดประเภท (typed stages) อย่างชัดเจน และบังคับให้โมเดลต้องปฏิบัติตาม software harness นักออกแบบสร้างมันขึ้นมาเพื่อควบคุมการเกิดอาการประสาทหลอน (hallucinations) ในขณะที่ยังคงสามารถให้คำตอบที่ละเอียดและมีแหล่งอ้างอิงครบถ้วน แนวทางนี้สืบทอดมาจากเฟรมเวิร์กการค้นหาบั๊กแบบอัตโนมัติ ที่ซึ่งมีการสร้างสมมติฐานขึ้นมาแล้วพยายามหาทางพิสูจน์ว่ามันผิดอย่างตั้งใจ ในเชิงการวิจัย ข้อกล่าวอ้างจะถูกสร้างขึ้น จากนั้นเอเจนต์ฝ่ายตรงข้าม (adversarial agents) สามรายจะพยายามทำลายข้อกล่าวอ้างนั้นก่อนที่จะไปถึงขั้นตอนการสังเคราะห์ขั้นสุดท้าย

ขั้นตอนการทำงานแบบ map-reduce

  1. Fan-out search – ตัวประสานงาน (orchestrator) จะสร้าง worker จำนวนมากที่ทำงานขนานกันเพื่อสอบถามแหล่งข้อมูลที่หลากหลาย
  2. Fetch data – Worker แต่ละตัวจะดึงข้อมูลส่วนย่อย (snippets), metadata และข้อมูลที่มีโครงสร้างที่หาได้
  3. Adversarial verification – เอเจนต์อิสระสามรายจะได้รับทุกข้อกล่าวอ้าง โดยแต่ละรายจะได้รับคำสั่งให้เลือกตอบว่า ปฏิเสธ (refuted) เป็นค่าเริ่มต้นหากไม่แน่ใจ ข้อกล่าวอ้างจะอยู่รอดได้ก็ต่อเมื่อได้รับคะแนนยืนยันที่เพียงพอเท่านั้น
  4. Synthesis – ข้อกล่าวอ้างที่ผ่านการตรวจสอบจะถูกนำมาประกอบกันเป็นรายงาน JSON สุดท้ายที่ผู้ใช้สามารถนำไปแสดงผลเป็นร้อยแก้วได้

เจาะลึกภายใน software harness

Harness คือเลเยอร์โค้ดบางๆ ที่กำหนดว่าโมเดลภาษาจะสามารถทำอะไรได้บ้าง กฎของมันจะปรากฏในรูปแบบของชุดงานที่มีโครงสร้างชัดเจน:

  • SCOPE – โมเดลจะได้รับคำอธิบายสั้นๆ เกี่ยวกับคำถามการวิจัย
  • SEARCH – โมเดลต้องส่งรายการตัวระบุแหล่งที่มา (source identifiers) เท่านั้น ห้ามส่งเป็นข้อความแบบอิสระ
  • EXTRACT – สำหรับแต่ละแหล่งที่มา โมเดลจะส่งคำพูดที่คัดลอกมาโดยตรง (verbatim quote) เพื่อสนับสนุนข้อกล่าวอ้างที่จะตามมา
  • VERDICT – โมเดลจะสร้างออบเจกต์ JSON ที่ประกอบด้วยข้อกล่าวอ้าง, คำพูดสนับสนุน และคะแนนความเชื่อมั่น
  • REPORT – ขั้นตอนสุดท้ายจะรวบรวมข้อกล่าวอ้างที่ผ่านการตรวจสอบทั้งหมดเข้าเป็นเอกสารฉบับเดียว

Harness นี้บังคับใช้ การผูกหลักฐาน (evidence binding): ข้อกล่าวอ้างใดที่ไม่มีคำพูดที่คัดลอกมาอย่างแม่นยำจะถูกคัดออกโดยอัตโนมัติ นอกจากนี้ยังมีการเปิดให้ปรับแต่ง ค่าคงที่เชิงนโยบาย (policy constants) ได้โดยไม่ต้องเปลี่ยนโค้ด เช่น จำนวนคะแนนยืนยันที่ข้อกล่าวอ้างต้องการ, จำนวนแหล่งข้อมูลที่ระบบสามารถอ่านได้ หรือจำนวนข้อกล่าวอ้างสูงสุดที่จะเข้าสู่ขั้นตอนการตรวจสอบ

จะมีขั้นตอนการคัดกรอง (triage step) อยู่ระหว่างการสกัดข้อมูลและการตรวจสอบ แทนที่จะส่งทุกข้อกล่าวอ้างไปยังเอเจนต์ฝ่ายตรงข้ามที่มีต้นทุนสูง ระบบจะจัดลำดับความสำคัญตามความสำคัญและคุณภาพของแหล่งที่มา จากนั้นจึงส่งเฉพาะ 25 อันดับแรกไปต่อ การคัดออกเช่นนี้ช่วยป้องกันไม่ให้การใช้โทเคนและต้นทุนการประมวลผลพุ่งสูงจนควบคุมไม่ได้

การตรวจสอบแบบโต้แย้งในทางปฏิบัติ

ขั้นตอนการตรวจสอบนั้นถูกออกแบบมาให้เข้มงวดอย่างตั้งใจ เอเจนต์ทั้งสามจะได้รับข้อกล่าวอ้างเดียวกันและคำพูดสนับสนุนจากแหล่งที่มา จากนั้นจะทำงานภายใต้ชุดคำสั่งที่บอกให้สันนิษฐานไว้ก่อนว่าข้อกล่าวอ้างนั้นเป็นเท็จ เว้นแต่จะพบหลักฐานที่ชัดเจน หากเอเจนต์รายใดไม่แน่ใจ จะลงคะแนนว่า ปฏิเสธ (refuted) ข้อกล่าวอ้างจะต้องรวบรวมคะแนน ยืนยัน (affirmed) ตามจำนวนที่กำหนดไว้จึงจะอยู่รอดได้

ระหว่างการทดสอบแบบไม่เป็นทางการ เลเยอร์การตรวจสอบแบบโต้แย้งสามารถตรวจพบข้อกล่าวอ้างที่อ่านค่าตัวชี้วัดแบบรวม (aggregate metric) ผิดเป็นคะแนนความแม่นยำ (precision score) เฉพาะเจาะจง โดยโมเดลได้สร้างข้อความที่ดูมั่นใจเกี่ยวกับความแม่นยำ แต่แหล่งข้อมูลรายงานเพียงแค่ตัวชี้วัดแบบรวมเท่านั้น

สิ่งที่การออกแบบนี้เผยให้เห็นเกี่ยวกับการสร้างระบบ AI

  1. แยกการควบคุมออกจากเหตุผล – โมเดลยังคงรับผิดชอบด้านการอนุมาน (inference) ในขณะที่ harness ทำหน้าที่บังคับระเบียบวินัยของกระบวนการ
  2. อินเทอร์เฟซแบบกำหนดประเภทช่วยลดอาการประสาทหลอน – การบังคับให้ส่งผลลัพธ์เป็น JSON และคำพูดที่คัดลอกมาอย่างแม่นยำ ช่วยกำจัดความคลาดเคลื่อนจากการเขียนข้อความแบบอิสระ
  3. การกรองข้อกล่าวอ้างก่อนขั้นตอนการตรวจสอบที่ต้องใช้ทรัพยากรสูง ช่วยลดการใช้โทเคนและต้นทุนการประมวลผล
  4. ปฏิบัติต่อข้อมูลนำเข้าจากภายนอกว่าไม่น่าเชื่อถือ – คำพูดจากทุกแหล่งที่มาจะถูกตรวจสอบซ้ำโดยเอเจนต์อิสระ เพื่อป้องกันไม่ให้เอกสารที่ผิดพลาดเพียงฉบับเดียวทำให้คำตอบทั้งหมดเสียหาย

หลักการเหล่านี้สะท้อนถึงการเปลี่ยนแปลงในวงกว้างไปสู่สถาปัตยกรรมแบบ “model-outside-the-model” ซึ่งใช้โค้ดแบบ deterministic ในการจัดการการประสานงาน (orchestration), การตรวจสอบความถูกต้อง (validation) และการจัดสรรทรัพยากร แทนที่จะใช้โมเดลภาษาแบบ probabilistic

ข้อเสียที่อาจเกิดขึ้นและคำถามที่ยังไม่มีคำตอบ

จุดแข็งของไปป์ไลน์นี้—นั่นคือความเข้มงวด—ก็นำมาซึ่งความท้าทายเช่นกัน

อีกประเด็นหนึ่งที่เป็นข้อถกเถียงคือการพึ่งพาการอ้างอิงคำพูดแบบคำต่อคำ เพราะความรู้ไม่ได้อยู่ในรูปแบบถ้อยคำที่ตายตัวเสมอไป ความเข้าใจเชิงลึกบางอย่างจะเกิดขึ้นได้ก็ต่อเมื่อมีการสังเคราะห์ข้อมูลจากเอกสารหลายฉบับเข้าด้วยกันเท่านั้น

สิ่งที่ควรจับตามองต่อไป

Claude’s Deep Research ยังอยู่ในระยะการวิจัย แต่สถาปัตยกรรมของมันบ่งบอกถึงอนาคตที่โมเดลภาษาขนาดใหญ่จะถูกฝังอยู่ใน pipeline ที่มีการควบคุมอย่างเข้มงวด แทนที่จะปล่อยให้ทำงานด้วยตัวเองโดยอิสระ ตัวบ่งชี้สำคัญที่ควรติดตาม ได้แก่:

  • ตัวชี้วัด Token-efficiency – ค่าพื้นฐานที่ 6.57M token จะลดลงหรือไม่ เมื่อระบบ (harness) มีตรรกะในการคัดกรอง (triage logic) ที่แม่นยำยิ่งขึ้น?
  • แนวโน้ม Latency – ระบบจะสามารถส่งรายงานฉบับสมบูรณ์กลับมาได้รวดเร็วเพียงใด เมื่อมี verification agents สามตัวทำงานร่วมกันในกระบวนการ?

บทสรุป

Claude’s Deep Research แสดงให้เห็นว่าโมเดลภาษาสามารถสร้างคำตอบที่น่าเชื่อถือและอ้างอิงจากแหล่งที่มาได้ เมื่อถูกจำกัดให้อยู่ใน pipeline หลายขั้นตอนที่มีระเบียบวินัย จุดเปลี่ยนที่แท้จริงไม่ใช่ขนาดของโมเดล แต่เป็นซอฟต์แวร์แวดล้อมที่บังคับให้โมเดลต้องพิสูจน์ทุกข้อกล่าวอ้าง จัดลำดับความสำคัญของหลักฐานก่อนที่จะใช้ compute และปฏิบัติกับ snippet จากภายนอกเสมือนเป็นสิ่งที่น่าสงสัย จนกว่าเอเจนต์ทั้งสามจะเห็นพ้องตรงกันเป็นอย่างอื่น สำหรับใครก็ตามที่กำลังสร้างเครื่องมือที่ขับเคลื่อนด้วย AI บทเรียนนี้ชัดเจนมาก: ปล่อยให้โมเดลเป็นคนคิด แต่ให้โค้ดเป็นตัวตัดสินว่าโมเดลสามารถพูดอะไรได้บ้าง