Mô hình 398 tỷ tham số của VIDRAFT, Darwin-398B-JGOS, đã giành vị trí thứ ba trên bảng xếp hạng GPQA Diamond chỉ với 24 GPU. Kết quả này chứng minh rằng một startup nhỏ của Hàn Quốc có thể cạnh tranh với các phòng thí nghiệm AI lớn nhất thế giới trong một bài kiểm tra đòi hỏi khả năng lập luận khoa học thực thụ thay vì các câu trả lời được học thuộc lòng.
Tại sao GPQA Diamond lại quan trọng
GPQA Diamond đặt ra các câu hỏi khoa học ở trình độ sau đại học vốn không xuất hiện trên các trang web công cộng. Vì các câu trả lời không thể bị thu thập dữ liệu, mô hình phải lập luận qua vấn đề thay vì truy xuất một sự thật đã được lưu trữ. Điểm chuẩn này buộc mô hình phải sử dụng logic chứ không phải sự ghi nhớ.
Bảng xếp hạng hiện tại
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
Darwin vượt qua các mô hình từ Nvidia, DeepSeek và một số sản phẩm của Mỹ và Trung Quốc, mặc dù nó chỉ chạy trên một phần nhỏ lượng phần cứng thường thấy ở các dự án như vậy.
Phương pháp đằng sau chiến thắng
VIDRAFT không mua một trang trại GPU khổng lồ. Thay vào đó, nhóm đã sử dụng phương pháp “evolutionary merging” (hợp nhất tiến hóa), kết hợp lặp đi lặp lại nhiều mô hình mã nguồn mở và giữ lại các thành phần hoạt động tốt nhất. Việc chạy phương pháp này trên một cụm 24 GPU khiêm tốn đã tạo ra một mạng lưới 398 tỷ tham số chất lượng cao mà không cần đến khoản chi phí vốn khổng lồ thường thấy khi huấn luyện từ đầu.
Điều này có ý nghĩa gì đối với lĩnh vực AI
- Rào cản gia nhập được hạ thấp: Việc xây dựng AI đỉnh cao không còn đòi hỏi hàng nghìn GPU nữa.
Những lưu ý và quan điểm phản biện
Darwin vẫn theo sau hai vị trí dẫn đầu với khoảng cách hẹp, và kích thước 398 tỷ tham số của nó vẫn rất đồ sộ—việc huấn luyện hoặc vận hành mô hình vẫn đòi hỏi cơ sở hạ tầng đáng kể. Cách tiếp cận này dựa trên việc hợp nhất tiến hóa các mô hình mở trên một cụm nhỏ. GPQA Diamond đóng vai trò là điểm chuẩn.
Điều cần theo dõi tiếp theo
Bài học rút ra rất rõ ràng: các chiến lược hợp nhất mô hình thông minh có thể bù đắp cho năng lực tính toán thô, tái định hình việc ai có thể cạnh tranh ở những cấp độ nghiên cứu AI cao nhất.
