Laguna S 2.1 của Poolside: Mô hình mã nguồn mở (open-weight) nhỏ gọn định nghĩa lại AI lập trình
Poolside vừa phát hành Laguna S 2.1, một mô hình lập trình mã nguồn mở (open-weight) nhỏ gọn đang vượt xa các đối thủ lớn hơn đáng kể. Bằng cách ưu tiên khả năng kiên trì của tác nhân (agentic persistence) và khả năng suy luận thay vì chỉ tập trung vào số lượng tham số thô, bản phát hành này báo hiệu một sự thay đổi mô hình trong cách chúng ta tiếp cận việc phát triển các LLM chuyên dụng.
Vượt mặt các "gã khổng lồ" hàng nghìn tỷ tham số
Laguna S 2.1 đang chứng minh rằng quy mô mô hình không phải là con đường duy nhất dẫn đến trí tuệ. Trên thang đo Terminal-Bench 2.1, vốn đánh giá các tác vụ terminal chạy dài, mô hình đã đạt được điểm số 70,2% khi bật "chế độ suy nghĩ" (thinking mode). Hiệu suất này giúp nó đứng ngay sau mô hình Hy3 295B-A21B khổng lồ của Tencent, nhưng lại vượt qua các hệ thống mã nguồn mở lớn hơn nhiều như DeepSeek-V4-Pro-Max và Nemotron 3 Ultra.
Sự chênh lệch thậm chí còn trở nên rõ rệt hơn trên thang đo Datacurve DeepSWE. Laguna S 2.1 đạt 40,4%, một kết quả đáng kinh ngạc so với một số mô hình mã nguồn mở có hơn một nghìn tỷ tham số nhưng không thể vượt qua mốc 10%. Mô hình cũng cho thấy hiệu suất vượt trội trên SWE-Bench Multilingual, SWE-Bench Pro và SWE Atlas, chứng minh tính hữu dụng của nó trong các quy trình kỹ thuật phần mềm phức tạp.
Sức mạnh của sự kiên trì và khả năng "suy nghĩ"
Một điểm khác biệt cốt lõi của Laguna S 2.1 là "chế độ suy nghĩ" (thinking mode), giúp cải thiện đáng kể tỷ lệ vượt qua ngay lần thử đầu tiên (pass-at-one rates). Nếu không có bước suy luận này, điểm Terminal-Bench sẽ giảm mạnh từ 70,2% xuống 60,4%, và điểm DeepSWE giảm từ 40,4% xuống còn 16,5%.
Poolside lập luận rằng thay vì chỉ đơn thuần là tăng cường trí thông minh, họ đã tập trung vào việc cải thiện các "hành vi" dẫn đến năng lực. Điều này bao gồm việc tăng cường xác minh, giảm xu hướng mặc định các giả định và thúc đẩy sự kiên trì. Trong các thử nghiệm được ghi lại, mô hình đã xây dựng một công cụ duyệt web (browser engine) hoạt động được từ một thư mục trống chỉ trong 50 phút. Ấn tượng hơn nữa, nó đã tự mình tìm lại được lời giải cho Bài toán Erdos số 397—một bài toán toán học chưa có lời giải từ năm 1975—chỉ với 40 bước suy luận và chi phí vỏn vẹn 0,088 USD.
Huấn luyện tác nhân ở quy mô lớn
Bước nhảy vọt về hiệu suất từ phiên bản XS 2.1 trước đó lên S 2.1 được thúc đẩy bởi quá trình hậu huấn luyện (post-training) chuyên sâu thay vì dữ liệu tiền huấn luyện (pre-training) mới. Giai đoạn huấn luyện tác nhân đã sử dụng 409.000 môi trường riêng biệt, bao gồm:
- 83.000 môi trường cho các tác vụ chuyên biệt về terminal.
- 168.000 môi trường cho các quy trình kỹ thuật phần mềm.
- 38.000 commit thực tế được lấy từ khoảng 17.000 kho lưu trữ (repositories).
Quá trình huấn luyện này được hỗ trợ bởi một cụm tính toán khổng lồ gồm 4.096 GPU Nvidia H200. Đáng chú ý, S 2.1 là mô hình đầu tiên trong dòng này được huấn luyện bằng học tăng cường (reinforcement learning) với độ chính xác FP8. Để ngăn chặn tình trạng "reward hacking" (gian lận phần thưởng)—nơi mô hình có thể tìm kiếm các pull request có sẵn thay vì giải quyết tác vụ—Poolside đã triển khai một hệ thống sandbox mới để chặn truy cập mạng một cách có chọn lọc.
Khả năng tiếp cận và triển khai
Laguna S 2.1 được phát hành theo giấy phép OpenMDW 1.1 (được hỗ trợ bởi Linux Foundation), cho phép sử dụng thương mại, sửa đổi và phân phối lại. Các nhà phát triển có thể truy cập mô hình thông qua Hugging Face, hoặc qua các dịch vụ lưu trữ như Baseten, Vercel AI Gateway và OpenRouter. OpenRouter cung cấp cửa sổ ngữ cảnh (context window) lên tới 256K miễn phí, với gói trả phí hỗ trợ lên đến một triệu token.
Những điểm chính cần lưu ý
- Hiệu quả quan trọng hơn quy mô: Laguna S 2.1 chứng minh rằng các hành vi tác nhân như sự kiên trì và xác minh có thể cho phép các mô hình nhỏ vượt qua các hệ thống hàng nghìn tỷ tham số.
- Suy luận là yếu tố thiết yếu: "Chế độ suy nghĩ" đóng vai trò quan trọng đối với các tác vụ phức tạp, giúp tăng đáng kể hiệu suất trên tất cả các thang đo lập trình chính.
- Thành công từ huấn luyện tác nhân: Sức mạnh của mô hình bắt nguồn từ quá trình hậu huấn luyện quy mô lớn trên 409.000 môi trường chuyên biệt và các commit mã nguồn thực tế.
