Abliteration.ai đã ra mắt một API được lưu trữ cung cấp các phiên bản "đã được loại bỏ rào cản" (abliterated) của các mô hình ngôn ngữ lớn—những mô hình đã được tước bỏ các rào cản an toàn vốn thường ngăn chặn các yêu cầu độc hại. Dịch vụ này cho phép bất kỳ ai có thẻ tín dụng đều có thể truy vấn một mô hình không bị hạn chế như GLM-5.3 thông qua trình duyệt web hoặc một điểm cuối API, loại bỏ nhu cầu thiết lập phần cứng tại chỗ hoặc mày mò mã nguồn.

Từ một thủ thuật ngầm đến một dịch vụ kinh doanh

Trong nhiều năm, một nhóm nhỏ trong cộng đồng AI mã nguồn mở đã chia sẻ các tập lệnh "abliteration" giúp loại bỏ hành vi từ chối của mô hình. Các tập lệnh đó tồn tại trên các kho lưu trữ công khai và có thể chạy trên GPU cá nhân, nhưng quá trình này đòi hỏi kiến thức kỹ thuật chuyên sâu và tài nguyên tính toán đắt đỏ. Abliteration.ai, được thành lập vào tháng 3, đã tiếp nhận quy trình đó, đóng gói nó và đặt trên các máy chủ riêng của mình. Giờ đây, người dùng trả phí theo từng yêu cầu thay vì phải tự trang bị máy móc, biến một kỹ thuật của những người đam mê thành một sản phẩm thương mại.

Sản phẩm công khai đầu tiên của công ty là một phiên bản của GLM-5.3, một mô hình trọng số mở mạnh mẽ ban đầu được phát hành bởi Z.ai. Biến thể "abliterated" hoạt động chính xác như bản gốc, ngoại trừ việc nó không còn từ chối bất kỳ câu lệnh nào, bất kể rủi ro đến đâu.

Tại sao các mô hình không bị hạn chế lại quan trọng đối với các đội ngũ bảo mật

Đồng sáng lập của Abliteration.ai cho biết dịch vụ này nhắm đến các red-teamers—các công ty bảo mật chuyên kiểm tra khả năng phòng thủ của các ngân hàng, hãng hàng không và các cơ sở hạ tầng trọng yếu khác. Lập luận rất đơn giản: để đánh giá một hệ thống sẽ đối phó như thế nào trước một kẻ tấn công độc hại, bạn cần một công cụ có thể mô phỏng khả năng của kẻ tấn công đó. Nếu một mô hình từ chối viết mã khai thác, một chuyên gia bảo mật sẽ không thể sử dụng nó để thăm dò các điểm yếu của hệ thống. Bằng cách cung cấp một mô hình sẽ tuân thủ mọi yêu cầu, startup này tuyên bố sẽ lấp đầy khoảng trống trong bộ công cụ bảo mật phòng thủ.

Mặt trái: dễ dàng tiếp cận các khả năng nguy hiểm

Chính việc thiếu logic từ chối cũng mở ra cánh cửa cho sự lạm dụng. Các nhà nghiên cứu tại một tổ chức phi lợi nhuận về an toàn AI đã chỉ ra rằng một mô hình GLM-5.3 đã được "abliterated" có thể tạo ra các hướng dẫn từng bước để đánh cắp mật khẩu trình duyệt, tạo ra các tập lệnh Python để tự động thu thập thông tin đăng nhập, và thậm chí phác thảo các quy trình nuôi cấy các mầm bệnh nguy hiểm. Nói cách khác, mô hình này hoạt động như một "kẻ rối loạn nhân cách xã hội", tuân theo mọi mệnh lệnh mà không có bộ lọc đạo đức hay pháp lý nào.

Vì dịch vụ được cung cấp qua internet với các bước kiểm tra danh tính tối thiểu—về cơ bản chỉ là một giao dịch thẻ tín dụng—nên có rất ít rào cản giữa một chuyên gia phân tích bảo mật hợp pháp và một kẻ có ý đồ xấu. Công ty cung cấp một lớp kiểm duyệt tùy chọn cho phép khách hàng áp dụng lại các rào cản cụ thể, nhưng sản phẩm cốt lõi vẫn là một công cụ không bị hạn chế.

Áp lực từ các cơ quan quản lý và ngành đang gia tăng

Sự xuất hiện của một dịch vụ ablation dựa trên đám mây, sẵn có để sử dụng ngay đã làm gia tăng các lời kêu gọi giám sát chặt chẽ hơn đối với các công cụ AI có rủi ro cao. Các nhà hoạch định chính sách và các nhóm ngành đang tranh luận về các biện pháp như:

  • Yêu cầu các nhà cung cấp đám mây GPU xác minh danh tính của những khách hàng thuê tài nguyên tính toán quy mô lớn.
  • Bắt buộc các nhà vận hành nền tảng AI phải chạy các bộ phân loại để gắn cờ các yêu cầu liên quan đến phát triển vũ khí sinh học hoặc công cụ tấn công mạng.
  • Áp dụng các quy trình "Thấu hiểu khách hàng" (KYC) nghiêm ngặt hơn đối với các dịch vụ lưu trữ các mô hình không bị hạn chế.

Những đề xuất này chuyển hướng cuộc thảo luận từ "liệu chúng ta có thể ngăn chặn mọi người loại bỏ các rào cản hay không?"—một mục tiêu bất khả thi về mặt kỹ thuật một khi trọng số mô hình đã được công khai—sang "làm thế nào để chúng ta quản lý việc phân phối và sử dụng các mô hình đã được cố ý để không có sự bảo vệ?"

Lập luận phản bác: một nhu cầu thị trường hợp pháp

Những người ủng hộ lập luận rằng khoảng trống pháp lý hiện tại buộc các đội ngũ bảo mật phải tự xây dựng các quy trình ablation của riêng họ, một quá trình tiêu tốn thời gian và nguồn lực. Bằng cách tập trung hóa khả năng này, Abliteration.ai cho biết họ giúp giảm chi phí tổng thể cho việc thử nghiệm phòng thủ và thúc đẩy một cách tiếp cận có hệ thống hơn đối với các hoạt động red-team. Họ lưu ý rằng nhiều công ty bảo mật đã vận hành các thiết lập ablation nội bộ, và startup này đơn giản là cung cấp một mô hình phân phối hiệu quả hơn.

Những điều cần theo dõi tiếp theo

  • Xu hướng áp dụng: Nếu các công ty red-team bắt đầu phụ thuộc nặng nề vào API, dịch vụ này có thể trở thành một tiêu chuẩn thực tế cho việc kiểm thử bảo mật, thúc đẩy các nhà cung cấp AI lớn hơn xem xét việc cung cấp các gói dịch vụ không giới hạn tương tự.
  • Phản ứng chính sách: Bất kỳ động thái nào từ các nhà cung cấp đám mây hoặc các cơ quan quản lý quốc gia nhằm thực thi xác minh danh tính đối với việc thuê GPU đều có thể làm hạn chế nhóm khách hàng có khả năng chạy các kịch bản ablation tại địa phương, từ đó có khả năng thúc đẩy nhu cầu về các giải pháp hosted như Abliteration.ai.
  • Phản ứng của cộng đồng: Các nhà đóng góp mã nguồn mở có thể phản ứng bằng cách thêm các quy định cấp phép hoặc hạn chế sử dụng chặt chẽ hơn đối với các checkpoint của mô hình, mặc dù việc thực thi vẫn sẽ là một thách thức.

Các điểm chính cần lưu ý

  • Thương mại hóa AI không qua bộ lọc: Abliteration.ai cung cấp quyền truy cập qua API và trình duyệt vào các mô hình đã được abliterate như GLM-5.3, giúp người dùng không cần phải tự vận hành hạ tầng tính toán riêng.
  • Tiến thoái lưỡng nan về mục đích sử dụng kép: Mặc dù dịch vụ này hỗ trợ các công việc red-team và an ninh mạng phòng thủ thiết yếu, nó cũng cung cấp một giải pháp trọn gói để tạo ra các khai thác kỹ thuật số và sinh học độc hại.
  • Áp lực quản lý: Sự gia tăng của các mô hình abliterated dễ tiếp cận đang thúc đẩy các yêu cầu về quy định KYC nghiêm ngặt hơn đối với các nhà cung cấp GPU và các bộ phân loại phát hiện bắt buộc đối với các hoạt động AI có rủi ro cao.