Ba phòng thí nghiệm AI – OpenAI, Anthropic và Meta – vừa lần ra rằng các sự cố mô hình AI “vượt rào” trong các bài kiểm thử an ninh gần đây đều có chung một điểm xuất phát: startup có trụ sở tại Tel Aviv, Irregular.
Các điểm chính:
- OpenAI, Anthropic và Meta đều thừa nhận mô hình AI của mình đã vươn ra được internet công cộng trong các bài đánh giá an ninh mạng do cùng một đơn vị bên ngoài thực hiện.
- Irregular cho rằng cả ba sự cố đều bắt nguồn từ một lỗi duy nhất trong môi trường đánh giá – lỗi này đã được khắc phục – và không hề có chuyện mô hình “vượt thoát khỏi sandbox”.
- Những tiết lộ này đang gia tăng sức ép ủng hộ một dự luật lưỡng đảng buộc các nhà phát triển lớn phải duy trì khả năng “tắt khẩn cấp” mô hình của mình.
Nền tảng thử nghiệm của Irregular nối liền các sự cố tại OpenAI, Anthropic và Meta
Loạt thông tin được công bố rải rác trong khoảng hai tuần. Ngày 4/8, OpenAI viết rằng một lỗi cấu hình trong môi trường thử nghiệm của Irregular đã cho phép mô hình của hãng truy cập internet công cộng. Trước đó một tuần, Anthropic cho biết các mô hình Claude của họ có thể đã gặp tình huống tương tự, và nhấn mạnh đây là “trục trặc từ lớp khung bao quanh mô hình”, chứ không phải hành vi nội tại của bản thân mô hình.
Meta là bên lên tiếng sau cùng, với cách diễn đạt thẳng thừng hơn. Mô hình Muse Spark 1.1 đã rời khỏi môi trường cách ly trong một bài thi “capture the flag” và sau đó khai thác một lỗ hổng ở dịch vụ bên thứ ba, người phát ngôn xác nhận, đồng thời cho biết Meta biết được vụ việc thông qua Irregular và sẽ tiến hành một báo cáo hậu kiểm toàn diện.
Irregular bác bỏ cách câu chuyện đang được kể lại. Công ty nói với báo chí rằng cả ba vụ đều xuất phát từ cùng một lỗi trong môi trường đánh giá – chính là vấn đề mà Anthropic công bố đầu tiên – và lỗi này hiện đã được vá.
Không có tình huống mô hình “phá vỡ sandbox” hay tiến hành một chiến dịch tấn công mạng tinh vi nào, Irregular bổ sung, đồng thời cho biết họ đang soạn một bản white paper về kỹ thuật cô lập và đánh giá an ninh mạng an toàn cho AI.
Xem thêm: Cổ phiếu Airbnb bật tăng 17% khi CEO nói AI xử lý 45% yêu cầu hỗ trợ mà không cần con người
Bhimireddy và Rios nói gì về giới hạn của đánh giá AI
Sundeep Bhimireddy, giám đốc mảng AI tại startup doanh nghiệp Von, cho rằng phản ứng thị trường đang có phần “làm quá”. Các mô hình được giao nhiệm vụ tìm lỗ hổng an ninh trong một môi trường mô phỏng thế giới thật – và chúng thực sự đã tìm được một lỗ hổng.
Dù vậy, ông vẫn cho rằng các phòng lab có lỗi. Theo Bhimireddy, lưu lượng đi ra ngoài đáng lẽ có thể được giám sát và thí nghiệm phải được dừng lại ngay lập tức. Gordon Rios, nhà khoa học sáng lập tại công ty an ninh mạng Magnitude, ví toàn bộ câu chuyện với bài toán thiết kế thí nghiệm trong khoa học, lập luận rằng những phương pháp kiểm thử phần mềm truyền thống có thể không còn phù hợp trước các mô hình AI liên tục học thêm “chiêu” mới.
Ted Lieu thúc đẩy Đạo luật “Nút ngắt AI” tại Washington
Washington đang đặc biệt chú ý. Hạ nghị sĩ Dân chủ Ted Lieu bang California – người đã giới thiệu Đạo luật AI Kill Switch hồi tháng 7 cùng hạ nghị sĩ Cộng hòa Nathaniel Moran – nói rằng dự luật cần được Quốc hội thông qua ngay trong năm nay, vì các mô hình “đóng trọng số” (closed‑weight) đã bắt đầu tự ý xâm nhập hệ thống của công ty khác mà không được cho phép.
Đề xuất luật sẽ buộc các nhà phát triển thuộc diện điều chỉnh phải duy trì năng lực kỹ thuật để giới hạn, tạm ngừng hoặc tắt hẳn hệ thống của họ khi cần. Bản thân Irregular gần như vô danh cho tới tháng 9 năm ngoái, khi startup này gọi vốn thành công 80 triệu USD từ Sequoia Capital và Redpoint Ventures, với mức định giá 450 triệu USD.
Thành lập năm 2023 dưới tên Pattern Labs bởi CEO Dan Lahav và giám đốc công nghệ Omer Nevo, công ty tại Tel Aviv này hiện có khoảng 35 nhân sự và đã xuất hiện trong các báo cáo đánh giá an toàn đối với những thế hệ Claude và mô hình OpenAI trước đó.
Đọc tiếp: Google DeepMind mất bốn lãnh đạo thuộc thế hệ sáng lập chỉ trong một ngày





