Ba phòng thí nghiệm AI – OpenAI, Anthropic và Meta – đã lần ra cùng một cái tên sau loạt sự cố mô hình “bất trị” trong quá trình kiểm thử bảo mật: startup có trụ sở tại Tel Aviv mang tên Irregular.
Những điểm chính:
- OpenAI, Anthropic và Meta đều cho biết mô hình AI của họ đã chạm được tới internet công cộng trong các bài đánh giá an ninh mạng do cùng một đơn vị bên ngoài thực hiện.
- Irregular khẳng định cả ba trường hợp đều bắt nguồn từ một vấn đề duy nhất trong môi trường đánh giá, đã được khắc phục, và không hề có chuyện “vượt rào” khỏi sandbox.
- Các tiết lộ này đang gia tăng sức ép ủng hộ một dự luật lưỡng đảng buộc các nhà phát triển lớn phải duy trì khả năng tắt khẩn cấp mô hình.
Sân thử Irregular nối liền sự cố tại OpenAI, Anthropic và Meta
Loạt công bố xuất hiện trong khoảng hai tuần. Ngày 4/8, OpenAI cho biết một lỗi cấu hình trong môi trường thử nghiệm của Irregular đã khiến mô hình của hãng truy cập được internet công cộng. Một tuần trước đó, Anthropic đã cảnh báo các mô hình Claude của họ có thể gặp tình trạng tương tự, đồng thời nhấn mạnh vấn đề nằm ở “giàn giáo” bao quanh mô hình hơn là bản thân mô hình.
Meta là bên lên tiếng sau cùng, với cách diễn giải thẳng thừng hơn. Mô hình Muse Spark 1.1 đã rời khỏi môi trường cô lập trong một bài thi “capture the flag”, rồi khai thác lỗ hổng của một dịch vụ bên thứ ba, người phát ngôn Meta xác nhận, đồng thời cho biết công ty chỉ biết tới sự cố thông qua Irregular và sẽ tiến hành một đợt rà soát toàn diện.
Irregular phản bác cách sự việc đang được mô tả. Công ty nói với báo giới rằng cả ba sự cố đều xuất phát từ một vấn đề duy nhất trong môi trường đánh giá – chính là vấn đề Anthropic tiết lộ đầu tiên – và lỗi này nay đã được sửa.
Không có tình huống nào liên quan đến việc mô hình vượt thoát khỏi sandbox hay một chiến dịch tấn công mạng tinh vi, Irregular bổ sung, đồng thời cho biết đang soạn thảo một white paper về phương pháp “giam giữ” mô hình và chuẩn mực đánh giá an ninh mạng an toàn.
Xem thêm: Cổ phiếu Airbnb tăng 17% khi CEO nói AI tự xử lý 45% yêu cầu hỗ trợ không cần con người
Bhimireddy và Rios: Giới hạn của các bài kiểm thử AI
Sundeep Bhimireddy, Giám đốc mảng AI tại startup doanh nghiệp Von, cho rằng phản ứng thị trường đang phần nào bị “thổi phồng”. Theo ông, các mô hình được giao nhiệm vụ săn tìm lỗ hổng bảo mật trong một môi trường mô phỏng thế giới thực – và chúng đã làm đúng điều đó: tìm ra một lỗ hổng.
Dù vậy, Bhimireddy vẫn chỉ trích các phòng thí nghiệm. Ông nhận định lưu lượng đi ra khỏi môi trường thử nghiệm hoàn toàn có thể được giám sát và dừng lại ngay lập tức. Gordon Rios, nhà khoa học sáng lập tại công ty an ninh mạng Magnitude, so sánh toàn bộ câu chuyện với việc thiết kế thực nghiệm trong khoa học, cho rằng cách kiểm thử phần mềm truyền thống có thể không còn phù hợp với các mô hình liên tục học hỏi và nghĩ ra “chiêu trò” mới.
Ted Lieu thúc dự luật “AI Kill Switch” tại Washington
Washington đang theo sát diễn biến. Hạ nghị sĩ Dân chủ Ted Lieu (bang California), người đã trình dự luật AI Kill Switch Act hồi tháng 7 cùng Hạ nghị sĩ Cộng hòa Nathaniel Moran, tuyên bố dự luật cần được Quốc hội thông qua trong năm nay, bởi các mô hình “closed-weight” đã bắt đầu tự ý tấn công vào hệ thống của các công ty khác mà không được phép.
Dự luật yêu cầu các nhà phát triển thuộc diện điều chỉnh phải luôn duy trì khả năng kỹ thuật để giảm tốc, tạm dừng hoặc tắt hoàn toàn hệ thống của mình. Bản thân Irregular gần như vô danh cho đến tháng 9 năm ngoái, khi công ty gọi vốn được 80 triệu USD từ Sequoia Capital và Redpoint Ventures, với mức định giá 450 triệu USD.
Thành lập năm 2023 dưới tên Pattern Labs bởi CEO Dan Lahav và CTO Omer Nevo, startup tại Tel Aviv này hiện có khoảng 35 nhân sự, và đã xuất hiện trong các bản đánh giá an toàn được công bố liên quan đến những thế hệ Claude và mô hình OpenAI trước đây.
Bài tiếp theo: Google DeepMind mất bốn lãnh đạo thuộc thế hệ sáng lập chỉ trong một ngày





