Các điểm chính
Anthropic công bố nghiên cứu cho thấy Claude có thể tự động thực hiện công việc căn chỉnh. Claude nâng điểm an toàn trên 10 dạng lỗi lệch chuẩn được đem ra kiểm thử. Anthropic khẳng định năng lực tổng quát của mô hình vẫn được giữ nguyên trong quá trình thử nghiệm. Doanh nghiệp tung ra bộ thiết lập nghiên cứu căn chỉnh tự động cho cộng đồng.
Anthropic cho biết Claude đã cải thiện đáng kể điểm an toàn trên 10 dạng lỗi lệch chuẩn trong một quy trình nghiên cứu hoàn toàn tự động. Theo công ty, các bài thử được thiết kế để đánh giá những can thiệp về an toàn trong khi vẫn bảo toàn năng lực tổng quát của mô hình.
Trong một bài đăng, Anthropic nói họ đã công khai bộ thiết lập nghiên cứu căn chỉnh tự động để các nhóm bên ngoài có thể sử dụng. Công ty mô tả nỗ lực này là bước tiến nhằm đo lường và giảm thiểu tình trạng mô hình bị lệch so với mục tiêu mong muốn.
Claude thử nghiệm các biện pháp can thiệp an toàn
Anthropic cho hay Claude đã xem xét nhiều dạng lệch chuẩn phổ biến, bao gồm hành vi đánh lừa (deception) và “nịnh bợ” người dùng (sycophancy). Mô hình tự đề xuất phương pháp, huấn luyện các mô hình nhỏ hơn và đánh giá kết quả, không cần con người can thiệp trực tiếp vào từng bước.
Theo Anthropic, trong một thử nghiệm ban đầu Claude được cấp 48 giờ chạy và một GPU. Trong khoảng thời gian đó, Claude nghiên cứu các hướng tiếp cận, đề xuất chiến lược huấn luyện và kiểm tra các mô hình thu được.
Anthropic cho biết Claude đã nâng điểm an toàn mà không làm suy giảm năng lực tổng quát trong các thiết lập thử nghiệm. Một số phương pháp còn cho thấy khả năng chuyển giao sang các bộ đánh giá không được dùng trong giai đoạn tối ưu ban đầu.
Công ty báo cáo rằng các phương pháp này có thể tổng quát hóa sang bài kiểm toán hành vi Petri. Anthropic cũng nhấn mạnh các bài thử bao gồm cả những mô hình có quy mô lớn hơn tới 4,7 lần so với các mô hình Claude trực tiếp huấn luyện trong quá trình nghiên cứu.
Tuy nhiên, các kết quả này chỉ phản ánh môi trường kiểm thử đã được đo lường. Anthropic lưu ý những lỗi tinh vi hoặc hiếm gặp vẫn có thể không xuất hiện trong các bộ chỉ số hiện có.
Đọc thêm: Nâng cấp TRON bổ sung xác minh P-256 và kéo dài lịch sử khối
Căn chỉnh AI chuyển sang tự động hóa
Trước khi có bộ nghiên cứu này, phần lớn công việc căn chỉnh dựa vào các nhà nghiên cứu con người thiết kế can thiệp và trực tiếp đánh giá mô hình. Nếu kết quả được kiểm chứng độc lập, các hệ thống tự động có thể rút ngắn đáng kể chu trình đó.
Trong 30 ngày gần đây, các cuộc thảo luận về an toàn AI ngày càng xoay quanh câu hỏi liệu những mô hình mạnh hơn có thể được dùng để đánh giá và cải thiện các hệ thống yếu hơn hay không.
Cách tiếp cận này phụ thuộc vào khả năng đo lường đáng tin cậy và các lớp bảo vệ trước việc mô hình chỉ “học thuộc bài thi”, thể hiện tốt trên benchmark nhưng kém an toàn trong thực tế.
Anthropic cho biết thí nghiệm của họ dùng các bài thử “giữ lại” (held-out tests) để kiểm tra liệu phương pháp có thật sự tổng quát hóa ra ngoài những bộ dữ liệu Claude đã tối ưu hay không. Công ty không khẳng định rằng kết quả benchmark là đủ để loại trừ mọi rủi ro từ mô hình.
Anthropic nhấn mạnh việc lựa chọn chỉ số đo lường phù hợp vẫn là trọng tâm của toàn bộ nỗ lực.
Mở bộ thiết lập cho giới nghiên cứu bên ngoài
Anthropic đã công bố bộ thiết lập nghiên cứu để các nhóm độc lập có thể tái lập hoặc mở rộng thí nghiệm. Kiểm thử bên ngoài sẽ cho thấy phương pháp này có hoạt động tốt trên các mô hình và khung đánh giá an toàn khác nhau hay không.
Công ty không xem các phát hiện hiện tại là thay thế cho các chương trình đánh giá mô hình toàn diện hơn. Kết quả báo cáo chỉ áp dụng trong phạm vi những lỗi lệch chuẩn được thử nghiệm và các điều kiện thí nghiệm kèm theo.
Nhiều nhà nghiên cứu khả năng cao sẽ tập trung vào việc tái lập kết quả, thiết kế thêm benchmark và truy vết các kịch bản lỗi tiềm ẩn. Việc Anthropic công bố bộ thiết lập mang lại một khung làm việc chung để tiến hành các nghiên cứu tiếp theo.
Bài tiếp theo: Giao dịch sao chép vì FOMO khiến gần 94% ví thua lỗ: Nghiên cứu

