Điểm đáng chú ý
Anthropic công bố nghiên cứu về việc Claude tự động thực hiện công việc căn chỉnh (alignment). Claude nâng điểm an toàn trên 10 lỗi lệch chuẩn đã được kiểm thử. Anthropic cho biết năng lực tổng thể của mô hình vẫn được giữ nguyên trong các thử nghiệm. Công ty phát hành bộ thiết lập nghiên cứu căn chỉnh tự động cho cộng đồng sử dụng.
Anthropic cho biết Claude đã cải thiện điểm an toàn trên 10 dạng lỗi lệch chuẩn thông qua một quy trình nghiên cứu hoàn toàn tự động. Theo công ty, các bài kiểm thử được thiết kế sao cho vẫn bảo toàn năng lực tổng thể của mô hình trong khi các nhà nghiên cứu đánh giá những biện pháp can thiệp về an toàn.
Trong một bài đăng, Anthropic cho hay họ đã công bố bộ thiết lập nghiên cứu căn chỉnh tự động để các nhóm bên ngoài cùng khai thác. Công ty mô tả đây là nỗ lực đo lường và giảm thiểu tình trạng mô hình hoạt động sai lệch với mục tiêu mong muốn.
Claude thử nghiệm các biện pháp can thiệp an toàn
Anthropic cho biết Claude đã xem xét các dạng lệch chuẩn phổ biến như hành vi đánh lừa (deception) và xu nịnh (sycophancy). Mô hình này tự đề xuất phương pháp, huấn luyện các mô hình nhỏ hơn và đánh giá kết quả mà không cần con người can thiệp trực tiếp ở từng bước.
Trong một thí nghiệm ban đầu, Claude được cấp 48 giờ và một đơn vị xử lý đồ họa (GPU). Trong khoảng thời gian đó, mô hình tiến hành nghiên cứu phương pháp, đề xuất cách huấn luyện và kiểm thử các mô hình thu được.
Theo Anthropic, Claude đã tăng được điểm an toàn mà không làm suy giảm năng lực tổng thể trong các thiết lập thử nghiệm. Một số phương pháp còn cho thấy khả năng chuyển giao sang các bộ chỉ số (benchmark) không nằm trong tập dùng để tối ưu ban đầu.
Công ty cho biết các phương pháp này cũng tổng quát hóa được sang bài đánh giá hành vi Petri (Petri behavioral audit). Ngoài ra, các thử nghiệm còn áp dụng cho những mô hình có quy mô lớn hơn đến 4,7 lần so với các mô hình được sử dụng trong giai đoạn nghiên cứu.
Tuy nhiên, tất cả vẫn chỉ mới được ghi nhận trong môi trường kiểm thử có kiểm soát. Anthropic cảnh báo rằng các lỗi tinh vi hoặc hiếm gặp có thể không xuất hiện trong những bộ chỉ số hiện có.
Xem thêm: Nâng cấp TRON bổ sung xác minh P-256 và lịch sử khối dài hơn
Căn chỉnh AI bước vào giai đoạn tự động hóa
Trước khi bộ nghiên cứu này được công bố, công việc căn chỉnh chủ yếu dựa vào con người thiết kế các biện pháp can thiệp và trực tiếp đánh giá mô hình. Nếu kết quả được các nhóm độc lập xác minh, hệ thống tự động có thể rút ngắn đáng kể quy trình này.
Trong 30 ngày gần đây, thảo luận về an toàn AI ngày càng xoay quanh câu hỏi: liệu các mô hình mạnh hơn có thể giúp đánh giá và cải thiện những hệ thống yếu hơn hay không.
Cách tiếp cận đó phụ thuộc vào khả năng đo lường đáng tin cậy và cơ chế hạn chế nguy cơ “đánh lừa” các bộ chỉ số đánh giá.
Anthropic cho biết thí nghiệm đã sử dụng các bài kiểm thử tách riêng (held-out tests) để kiểm tra xem phương pháp có thực sự tổng quát ra ngoài những benchmark mà Claude tối ưu hay không. Công ty không cho rằng kết quả trên benchmark đồng nghĩa loại bỏ được mọi rủi ro từ mô hình.
Anthropic nhấn mạnh việc lựa chọn hệ đo lường phù hợp vẫn là trọng tâm của toàn bộ công việc căn chỉnh.
Mở bộ thiết lập cho các nhà nghiên cứu bên ngoài
Anthropic phát hành bộ thiết lập nghiên cứu để các nhóm khác có thể tái lập hoặc mở rộng thí nghiệm. Việc thử nghiệm độc lập sẽ cho thấy liệu các phương pháp này có hiệu quả trên nhiều loại mô hình và khung đánh giá an toàn khác nhau hay không.
Công ty không xem những phát hiện hiện tại là “thay thế” cho các đánh giá mô hình ở phạm vi rộng hơn. Kết quả được báo cáo chỉ áp dụng trong phạm vi các lỗi lệch chuẩn đã kiểm thử và những ràng buộc thí nghiệm cụ thể.
Trong giai đoạn tiếp theo, các nhà nghiên cứu nhiều khả năng sẽ tập trung vào việc tái lập kết quả, thiết kế benchmark mới và truy tìm những kịch bản lỗi tiềm ẩn. Việc Anthropic công bố bộ thiết lập tạo ra một khung tham chiếu chung cho các nghiên cứu này.
Đọc tiếp: Giao dịch sao chép theo Fomo khiến gần 94% ví thua lỗ: Nghiên cứu





