ผลการทดสอบประสิทธิภาพ (benchmark) ของ LLM agent 5 ตัวที่รันแบบ local บนการ์ดจอ RTX 5090 เพียงตัวเดียว แสดงให้เห็นว่าโมเดลแบบ mixture-of-experts (MoE) ขนาด 35 พันล้านพารามิเตอร์ สามารถทำผลงานได้เหนือกว่าโมเดลอื่นๆ ในงานเขียนโค้ดที่ใช้งานจริง การทดสอบนี้เป็นการเพิ่ม Tag Manager เข้าไปใน admin panel ที่มีอยู่เดิมโดยไม่ใช้ cloud API ใดๆ เลย และผลปรากฏว่า Qwen 3.6 35B-A3B เป็นผู้ชนะอย่างชัดเจน
ทำไมการทดสอบนี้ถึงสำคัญ
การรันโมเดลภาษาขนาดใหญ่ (LLM) บนฮาร์ดแวร์ส่วนตัวช่วยให้นักพัฒนาหลีกเลี่ยงค่าธรรมเนียม API และความกังวลด้านความเป็นส่วนตัวของข้อมูล อย่างไรก็ตาม คำว่า “local agents” ยังคงเป็นเพียงคำที่ใช้เรียกกันเก๋ๆ (buzzword): พวกมันสามารถแก้ไขไฟล์ เรียกใช้เครื่องมือ command-line และส่งมอบโค้ดที่พร้อมใช้งานจริง (production-ready) ได้โดยไม่ต้องมีมนุษย์คอยประคองหรือไม่? การเปรียบเทียบแบบลงมือทำจริงโดยตัดบริการคลาวด์ออกไปนี้ ช่วยให้นักพัฒนาเห็นภาพที่ชัดเจนว่าเทคโนโลยีในปัจจุบันอยู่ในระดับใด
ฮาร์ดแวร์และโจทย์การทดสอบ
โมเดลทั้ง 5 ตัวรันบนเวิร์กสเตชันเครื่องเดียวกัน ได้แก่ GPU RTX 5090 ซึ่งเป็นการ์ดจอระดับไฮเอนด์สำหรับผู้ใช้งานทั่วไป และไม่มีการใช้บริการภายนอก โจทย์การทดสอบนั้นตั้งใจให้เรียบง่ายแต่เป็นตัวแทนของงานจริง นั่นคือการเพิ่มส่วนประกอบ Tag Manager เข้าไปในส่วน admin ที่สร้างไว้แล้ว ความสำเร็จขึ้นอยู่กับว่าโมเดลจะสามารถค้นหาไฟล์ต้นฉบับที่ถูกต้อง แก้ไขไฟล์ และตรวจสอบได้หรือไม่ว่าฟีเจอร์ใหม่ที่เพิ่มเข้าไปนั้นทำงานร่วมกับฟังก์ชันเดิมได้โดยไม่ทำให้ระบบพัง
ประสิทธิภาพของโมเดล
- Qwen 3.6 35B-A3B (MoE) – ทำงานจนเสร็จสิ้นได้ด้วยตัวเอง เพิ่มการปรับปรุงที่สมเหตุสมผลแม้ไม่ได้ถูกร้องขอ และไม่ต้องมีการแก้ไขโค้ด (patch) ภายหลังการรัน
- Qwen 3.6 27B (dense) – ทำงานสำเร็จ แต่ต้องใช้ขั้นตอนการโต้ตอบมากกว่าเดิมประมาณสองเท่า และบางครั้งก็ตีความคำสั่งผิดพลาด
- GLM-4.7-Flash (dense) – สร้างโค้ดที่ใช้งานได้จริง แต่ใช้รูปแบบการจับคู่ไฟล์ที่ไม่ถูกต้องและละเลยการตรวจสอบความปลอดภัย ทำให้โค้ดมีความเสี่ยง
- Qwythos-9B – ไม่สามารถเรียกใช้เครื่องมือใดๆ ได้เลย ความล้มเหลวนี้อาจมาจากตัวโมเดลเองหรือจากการตั้งค่าแบบ local แต่การทดสอบไม่สามารถแยกแยะสาเหตุที่แน่ชัดได้
- Nemotron-3-Nano (hybrid) – ติดอยู่ในลูป โดยใช้เวลาถึง 40 รอบในการค้นหาโฟลเดอร์ที่เคยหาเจอไปแล้ว และไม่สามารถก้าวหน้าไปมากกว่านั้นได้
สิ่งที่ผลลัพธ์บ่งบอก
สถาปัตยกรรมไม่ใช่ตัวบ่งชี้ที่เชื่อถือได้เสมอไป
โมเดลแบบ MoE ซึ่งแบ่งพารามิเตอร์ออกเป็นเครือข่ายย่อยของผู้เชี่ยวชาญ (expert sub-networks) หลายชุด เป็นผู้ชนะอย่างขาดลอย ในขณะที่โมเดลแบบ dense และ hybrid มีผลลัพธ์คละกันระหว่างความสำเร็จและความล้มเหลวโดยสิ้นเชิง สิ่งนี้ชี้ให้เห็นว่าการเลือกสถาปัตยกรรมเพียงอย่างเดียวไม่สามารถรับประกันความสามารถในการใช้เครื่องมือได้
การใช้เครื่องมือยังคงเป็นอุปสรรคสำคัญ
ไม่มี agent ตัวใดในทั้ง 5 ตัวเลยที่ใช้เครื่องมือจับภาพหน้าจอ (screenshot tool) ที่จัดเตรียมไว้ให้สำหรับการทดสอบ ทุกตัวพยายามใช้วิธีการอื่นแทน ไม่ว่าจะเป็นการเดาชื่อไฟล์หรือพยายามใช้วิธีการอ้อมๆ ช่องว่างระหว่าง "ความสามารถในการสร้างโค้ด" กับ "ความสามารถในการควบคุมเครื่องมือภายนอก" ยังคงกว้างมาก
การรันแบบ local หมายถึงการต้องแก้บั๊กทั้งระบบ ไม่ใช่แค่ที่ตัวโมเดล
มีโมเดล 2 ตัวที่ต้องมีการแก้ไข prompt template หน้างานก่อนที่การทดสอบจะเริ่มขึ้นได้เสียอีก ความพยายามในการแก้บั๊กเฉพาะของแต่ละโมเดลนั้นใช้เวลามากกว่าการเขียนโค้ด Tag Manager จริงๆ เสียอีก ซึ่งตอกย้ำให้เห็นว่าการติดตั้งใช้งานแบบ local ในปัจจุบันยังมีความเปราะบางเพียงใด
ข้อควรระวัง
การทดสอบประสิทธิภาพนี้สะท้อนถึงการตั้งค่าฮาร์ดแวร์เพียงรูปแบบเดียว สถานการณ์การเขียนโค้ดเพียงรูปแบบเดียว และกลุ่มโมเดลจำนวนน้อยเท่านั้น ทั้งนี้ Qwen 3.6 35B-A3B เคยทำผลงานได้แย่ในการทดสอบรอบก่อนหน้า ซึ่งความล้มเหลวในตอนนั้นเป็นเพียงเหตุบังเอิญ ดังนั้น ผลลัพธ์เหล่านี้จึงเป็นเพียงตัวบ่งชี้ ไม่ใช่ข้อสรุปที่เบ็ดเสร็จเด็ดขาด
สิ่งที่ต้องจับตามองต่อไป
การทดสอบในรอบต่อๆ ไปจำเป็นต้องขยายชุดโจทย์ให้มากขึ้น รวมถึงเพิ่มชุดเครื่องมือ (toolchains) ที่หลากหลาย และทดสอบบนฮาร์ดแวร์ที่ครอบคลุมมากขึ้น ผู้ที่ติดตามเรื่องนี้ควรเฝ้าดูว่าโมเดลแบบ MoE จะสามารถทำผลงานได้เหนือกว่าการออกแบบแบบ dense และ hybrid อย่างสม่ำเสมอหรือไม่ และนักพัฒนาจะสามารถสร้าง wrapper ที่เชื่อถือได้เพื่อขจัดความจำเป็นในการต้องมานั่งแก้บั๊กด้วยตัวเองได้หรือไม่
บทสรุป: โมเดล MoE ขนาด 35B สามารถทำหน้าที่เป็นผู้ช่วยเขียนโค้ดแบบ local ที่มีความสามารถได้แล้ว แต่ระบบนิเวศในภาพรวม ทั้งการรวมเครื่องมือ (tool integration), วิศวกรรมพรอมต์ (prompt engineering) และสภาพแวดล้อมการรันที่เสถียร (stable runtimes) ยังคงตามหลังอยู่ จนกว่าองค์ประกอบเหล่านี้จะลงตัว นักพัฒนาควรเผื่อใจไว้บ้างเกี่ยวกับความคาดหวังเรื่อง local agent แบบ "plug-and-play"
