Laguna S 2.1 จาก Poolside: โมเดล Open-Weight ขนาดเล็กที่สร้างนิยามใหม่ให้แก่ AI สำหรับการเขียนโค้ด

Poolside ได้เปิดตัว Laguna S 2.1 ซึ่งเป็นโมเดลสำหรับการเขียนโค้ดแบบ open-weight ขนาดกะทัดรัดที่สามารถทำผลงานได้เหนือกว่าคู่แข่งที่มีขนาดใหญ่กว่าอย่างเห็นได้ชัด การให้ความสำคัญกับความพยายามในการทำงานแบบเอเจนต์ (agentic persistence) และการใช้เหตุผล (reasoning) มากกว่าจำนวนพารามิเตอร์ดิบๆ ทำให้การเปิดตัวครั้งนี้เป็นสัญญาณของการเปลี่ยนแปลงกระบวนทัศน์ในการพัฒนา LLM เฉพาะทาง

ทำผลงานเหนือกว่ายักษ์ใหญ่ระดับล้านล้านพารามิเตอร์

Laguna S 2.1 กำลังแสดงให้เห็นว่าขนาดของโมเดลไม่ใช่หนทางเดียวไปสู่ความฉลาด ในการทดสอบ Terminal-Bench 2.1 ซึ่งประเมินงานในเทอร์มินัลที่ต้องใช้เวลานาน โมเดลทำคะแนนได้ถึง 70.2% เมื่อเปิดใช้งาน "thinking mode" ผลงานนี้ทำให้มันตามหลังเพียงแค่โมเดล Hy3 ขนาด 295B-A21B มหาศาลของ Tencent เท่านั้น แต่ยังนำหน้าโมเดลระบบ open-weights ที่มีขนาดใหญ่กว่ามากอย่าง DeepSeek-V4-Pro-Max และ Nemotron 3 Ultra

ความแตกต่างนี้ยิ่งชัดเจนมากขึ้นในการทดสอบ Datacurve DeepSWE โดย Laguna S 2.1 ทำคะแนนได้ 40.4% ซึ่งเป็นผลลัพธ์ที่น่าทึ่งเมื่อเทียบกับโมเดล open-weight หลายรุ่นที่มีพารามิเตอร์มากกว่าหนึ่งล้านล้านตัว แต่กลับไม่สามารถทำคะแนนทะลุ 10% ได้ นอกจากนี้ โมเดลยังแสดงประสิทธิภาพระดับแนวหน้าใน SWE-Bench Multilingual, SWE-Bench Pro และ SWE Atlas ซึ่งพิสูจน์ให้เห็นถึงประโยชน์ในการใช้งานในเวิร์กโฟลว์วิศวกรรมซอฟต์แวร์ที่ซับซ้อน

พลังแห่งความพยายามและการ "คิด"

จุดต่างที่สำคัญของ Laguna S 2.1 คือ "thinking mode" ซึ่งช่วยเพิ่มอัตราการผ่านในครั้งเดียว (pass-at-one rates) ได้อย่างมหาศาล หากไม่มีขั้นตอนการใช้เหตุผลนี้ คะแนน Terminal-Bench จะลดฮวบจาก 70.2% เหลือเพียง 60.4% และคะแนน DeepSWE จะลดลงจาก 40.4% เหลือเพียง 16.5%

Poolside ให้เหตุผลว่า แทนที่จะเพียงแค่เพิ่มความฉลาด พวกเขาได้มุ่งเน้นไปที่การปรับปรุง "พฤติกรรม" (behaviors) ที่นำไปสู่ความสามารถ ซึ่งรวมถึงการเพิ่มการตรวจสอบ (verification) การลดแนวโน้มที่จะยอมรับข้อสันนิษฐานโดยไม่ตรวจสอบ และการส่งเสริมความพยายามในการทำงาน ในการทดสอบที่มีการบันทึกไว้ โมเดลสามารถสร้างเอนจินเบราว์เซอร์ที่ใช้งานได้จริงจากโฟลเดอร์ว่างเปล่าภายในเวลาเพียง 50 นาที และที่น่าประทับใจยิ่งกว่านั้นคือ มันสามารถค้นพบคำตอบของ Erdos Problem #397 ซึ่งเป็นปัญหาทางคณิตศาสตร์ที่ไม่มีใครแก้ได้ตั้งแต่ปี 1975 ได้ด้วยตัวเอง โดยใช้ขั้นตอนการใช้เหตุผลเพียง 40 ขั้นตอน และมีค่าใช้จ่ายเพียง 0.088 ดอลลาร์เท่านั้น

การฝึกฝนแบบเอเจนต์ในระดับสเกลใหญ่

การก้าวกระโดดของประสิทธิภาพจากเวอร์ชัน XS 2.1 ก่อนหน้ามาเป็น S 2.1 นั้น ขับเคลื่อนโดยการทำ post-training อย่างเข้มข้น มากกว่าการใช้ข้อมูล pre-training ใหม่ โดยขั้นตอนการฝึกฝนแบบเอเจนต์ (agentic training) ได้ใช้สภาพแวดล้อมที่แตกต่างกันถึง 409,000 สภาพแวดล้อม ซึ่งรวมถึง:

  • 83,000 สภาพแวดล้อมสำหรับงานเฉพาะทางในเทอร์มินัล
  • 168,000 สภาพแวดล้อมสำหรับเวิร์กโฟลว์วิศวกรรมซอฟต์แวร์
  • 38,000 คอมมิต (commits) จากโลกแห่งความเป็นจริง ซึ่งมาจากประมาณ 17,000 เรโพสิทอรี (repositories)

กระบวนการฝึกฝนนี้ได้รับการสนับสนุนจากคลัสเตอร์การประมวลผลขนาดมหึมาที่ประกอบด้วย Nvidia H200 GPU จำนวน 4,096 ตัว ที่น่าสังเกตคือ S 2.1 เป็นโมเดลรุ่นแรกในซีรีส์ที่ได้รับการฝึกฝนโดยใช้การเรียนรู้แบบเสริมกำลัง (reinforcement learning) ในความละเอียดระดับ FP8 และเพื่อป้องกัน "reward hacking"—ซึ่งเป็นกรณีที่โมเดลอาจพยายามค้นหา pull requests ที่มีอยู่แล้วแทนที่จะแก้ปัญหาด้วยตัวเอง—Poolside จึงได้นำระบบ sandbox แบบใหม่มาใช้เพื่อเลือกบล็อกการเข้าถึงเครือข่ายอย่างเฉพาะเจาะจง

การเข้าถึงและการปรับใช้

Laguna S 2.1 ถูกปล่อยออกมาภายใต้ใบอนุญาต OpenMDW 1.1 (ซึ่งได้รับการสนับสนุนโดย Linux Foundation) ซึ่งอนุญาตให้ใช้ในเชิงพาณิชย์ แก้ไข และแจกจ่ายต่อได้ นักพัฒนาสามารถเข้าถึงโมเดลได้ผ่าน Hugging Face หรือผ่านบริการโฮสต์อย่าง Baseten, Vercel AI Gateway และ OpenRouter โดย OpenRouter มีหน้าต่างบริบท (context window) ขนาดใหญ่ถึง 256K ให้ใช้ฟรี และมีระดับที่ต้องชำระเงินซึ่งรองรับได้สูงสุดถึงหนึ่งล้านโทเคน

สรุปประเด็นสำคัญ

  • ประสิทธิภาพเหนือกว่าขนาด: Laguna S 2.1 พิสูจน์ให้เห็นว่าพฤติกรรมแบบเอเจนต์ เช่น ความพยายามและการตรวจสอบ สามารถทำให้โมเดลขนาดเล็กทำผลงานได้เหนือกว่าระบบที่มีพารามิเตอร์ระดับล้านล้านตัว
  • การใช้เหตุผลเป็นสิ่งจำเป็น: "thinking mode" มีความสำคัญอย่างยิ่งสำหรับงานที่ซับซ้อน โดยช่วยเพิ่มประสิทธิภาพในการทดสอบการเขียนโค้ดหลักๆ ทั้งหมดอย่างมีนัยสำคัญ
  • ความสำเร็จของการฝึกฝนแบบเอเจนต์: ความแข็งแกร่งของโมเดลมาจากการทำ post-training ขนาดมหาศาลผ่านสภาพแวดล้อมเฉพาะทาง 409,000 แห่ง และคอมมิตโค้ดจากโลกแห่งความเป็นจริง