Z.ai đã thông báo vào ngày 14 tháng 8 rằng mô hình GLM-5.3 mới của họ sẽ không được phát hành dưới dạng trọng số mở (open weights) như đã hứa. Công ty sẽ duy trì mô hình này thông qua API và dịch vụ đăng ký trong hai tuần tới, lùi thời điểm cho phép tải xuống công khai sang khoảng ngày 28 tháng 8 trong khi tiến hành đánh giá an toàn. Z.ai cho biết sự chậm trễ này bắt nguồn từ khả năng tấn công bảo mật (offensive-security) mạnh mẽ ngoài mong đợi của mô hình—những kỹ năng có thể bị vũ khí hóa nếu mô hình được phép tải xuống tự do.

Tại sao việc trì hoãn này lại quan trọng

GLM-5.3 được quảng bá là một chuyên gia trong lĩnh vực lập trình, các tác vụ tác nhân dài hạn (long-horizon agent tasks) và an ninh mạng. Trong các bản phát hành trước đó, Z.ai đã cung cấp trọng số mô hình ngay lập tức, thu hút các nhà phát triển chạy các mô hình ngôn ngữ lớn trên phần cứng riêng của họ. Lần này, nút “Coming Soon” (Sắp ra mắt) trên trang tải xuống đã thay thế liên kết truy cập tức thì, báo hiệu một sự chuyển dịch từ tính cởi mở sang sự thận trọng.

Đội ngũ an toàn đã cảnh báo về mô hình này sau khi các thử nghiệm nội bộ cho thấy nó đạt được các kỹ năng tấn công bảo mật nhanh hơn dự kiến. Z.ai coi việc tạm dừng này là một bước đi có trách nhiệm: một đợt đánh giá kéo dài hai tuần để đánh giá rủi ro lạm dụng trước khi bất kỳ ai có thể sao chép trọng số và chạy mô hình ngoại tuyến.

Xu hướng chuyển dịch rộng hơn của ngành hướng tới các bản phát hành được kiểm soát

Z.ai không phải là đơn vị duy nhất đang thắt chặt quyền truy cập vào các tác nhân (agents) mạnh mẽ nhất của mình. Những động thái gần đây của ba phòng thí nghiệm hàng đầu khác cho thấy một sự đồng thuận ngày càng tăng rằng việc phân phối không hạn chế các mô hình sử dụng công cụ mạnh mẽ sẽ mang lại rủi ro thực sự.

  • OpenAI hiện yêu cầu xác minh danh tính để sử dụng mô hình tập trung vào an ninh mạng của mình, nhằm giới hạn đối tượng có thể truy vấn.
  • Anthropic đã giữ mô hình hiệu suất cao mới nhất của mình trong nội bộ, chỉ cung cấp thông qua các giao diện được kiểm soát.

Những hành động này cho thấy ngành công nghiệp đang chuyển trọng tâm từ các điểm số benchmark gây chú ý sang khả năng thực hiện các kế hoạch đa bước, thao tác với các công cụ bên ngoài và phục hồi sau lỗi của mô hình—những khả năng cũng thu hút các tác nhân độc hại.

Những gì đang được đặt lên bàn cân

Nếu các trọng số cuối cùng được phát hành dưới một giấy phép thông thoáng như MIT, các nhà nghiên cứu bảo mật có thể nghiên cứu các kỹ thuật của mô hình, phát triển các biện pháp đối phó và tích hợp công nghệ này vào các công cụ phòng thủ. Một bản phát hành mã nguồn mở sẽ củng cố nguyên tắc rằng sự minh bạch giúp cộng đồng luôn đi trước các mối đe dọa.

Ngược lại, một giấy phép hạn chế hơn sẽ báo hiệu rằng ngay cả những người ủng hộ trọng số mở nhất cũng thấy cần phải giới hạn những ai có thể chạy mô hình. Điều đó có thể tạo ra một tiền lệ, thúc đẩy lĩnh vực này hướng tới một nền kinh tế “truy cập qua API”.

Sự mâu thuẫn cốt lõi vẫn còn đó: một khi tệp mô hình được đăng tải công khai, nhà phát hành sẽ mất mọi khả năng ngăn chặn việc tái sử dụng độc hại. Một đợt đánh giá an toàn kéo dài hai tuần không thể xóa bỏ sự đánh đổi đó, nhưng nó giúp có thêm thời gian để soạn thảo các hướng dẫn, tích hợp các kiểm soát sử dụng hoặc điều chỉnh giấy phép.

Những điều cần theo dõi vào ngày 28 tháng 8

Hai câu hỏi cụ thể sẽ định hình chương tiếp theo cho GLM-5.3:

  1. Các trọng số có thực sự được phát hành đúng hạn không? Việc lỡ thời hạn sẽ ám chỉ những rào cản sâu sắc hơn về kỹ thuật hoặc chính sách, có thể khiến Z.ai phải kéo dài thời gian đánh giá.
  2. Giấy phép đi kèm với bản phát hành là gì? Một giấy phép MIT không đổi sẽ là một thắng lợi cho tính cởi mở; một sự chuyển dịch sang giấy phép được kiểm soát sẽ xác nhận sự thắt chặt kiểm soát của ngành đối với các mô hình tác nhân (agentic models).

Các nhà phát triển đang lên kế hoạch nghiên cứu liên quan đến bảo mật nên chuẩn bị để thử nghiệm mô hình trên một tác vụ tấn công thực tế ngay khi các trọng số được cung cấp. Điều đó sẽ tiết lộ liệu sự chậm trễ này chỉ đơn thuần là một biện pháp phòng ngừa hay là một tín hiệu cho thấy khả năng của mô hình thực sự vượt xa các công cụ phòng thủ hiện tại.

Điểm mấu chốt

Quyết định giữ lại trọng số của GLM-5.3 của Z.ai đánh dấu một bước ngoặt: các mô hình ngôn ngữ sử dụng công cụ mạnh mẽ không còn chỉ được coi trọng vì sự mượt mà trong giao tiếp, mà còn vì phạm vi các hành động mà chúng có thể tự động hóa. Khi nhiều phòng thí nghiệm ưu tiên hiệu suất tác nhân hơn, rủi ro về việc các khả năng đó bị sử dụng để chống lại những người phòng thủ ngày càng tăng. Những tuần tới sẽ cho thấy liệu cộng đồng có thể cân bằng giữa nghiên cứu mở với nhu cầu ngăn chặn lạm dụng hay không, và liệu một giấy phép thông thoáng có thể tồn tại trong một thế giới nơi “trọng số mở” có thể trở thành một gánh nặng cũng như một tài sản.