OpenAI, Anthropic và Meta lần theo “AI bất trị” đến startup Israel Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Ba phòng thí nghiệm AI – OpenAI, AnthropicMeta – đã lần ra cùng một cái tên sau loạt sự cố mô hình “bất trị” trong quá trình kiểm thử bảo mật: startup có trụ sở tại Tel Aviv mang tên Irregular.

Những điểm chính:

  • OpenAI, Anthropic và Meta đều cho biết mô hình AI của họ đã chạm được tới internet công cộng trong các bài đánh giá an ninh mạng do cùng một đơn vị bên ngoài thực hiện.
  • Irregular khẳng định cả ba trường hợp đều bắt nguồn từ một vấn đề duy nhất trong môi trường đánh giá, đã được khắc phục, và không hề có chuyện “vượt rào” khỏi sandbox.
  • Các tiết lộ này đang gia tăng sức ép ủng hộ một dự luật lưỡng đảng buộc các nhà phát triển lớn phải duy trì khả năng tắt khẩn cấp mô hình.

Sân thử Irregular nối liền sự cố tại OpenAI, Anthropic và Meta

Loạt công bố xuất hiện trong khoảng hai tuần. Ngày 4/8, OpenAI cho biết một lỗi cấu hình trong môi trường thử nghiệm của Irregular đã khiến mô hình của hãng truy cập được internet công cộng. Một tuần trước đó, Anthropic đã cảnh báo các mô hình Claude của họ có thể gặp tình trạng tương tự, đồng thời nhấn mạnh vấn đề nằm ở “giàn giáo” bao quanh mô hình hơn là bản thân mô hình.

Meta là bên lên tiếng sau cùng, với cách diễn giải thẳng thừng hơn. Mô hình Muse Spark 1.1 đã rời khỏi môi trường cô lập trong một bài thi “capture the flag”, rồi khai thác lỗ hổng của một dịch vụ bên thứ ba, người phát ngôn Meta xác nhận, đồng thời cho biết công ty chỉ biết tới sự cố thông qua Irregular và sẽ tiến hành một đợt rà soát toàn diện.

Irregular phản bác cách sự việc đang được mô tả. Công ty nói với báo giới rằng cả ba sự cố đều xuất phát từ một vấn đề duy nhất trong môi trường đánh giá – chính là vấn đề Anthropic tiết lộ đầu tiên – và lỗi này nay đã được sửa.

Không có tình huống nào liên quan đến việc mô hình vượt thoát khỏi sandbox hay một chiến dịch tấn công mạng tinh vi, Irregular bổ sung, đồng thời cho biết đang soạn thảo một white paper về phương pháp “giam giữ” mô hình và chuẩn mực đánh giá an ninh mạng an toàn.

Xem thêm: Cổ phiếu Airbnb tăng 17% khi CEO nói AI tự xử lý 45% yêu cầu hỗ trợ không cần con người

Bhimireddy và Rios: Giới hạn của các bài kiểm thử AI

Sundeep Bhimireddy, Giám đốc mảng AI tại startup doanh nghiệp Von, cho rằng phản ứng thị trường đang phần nào bị “thổi phồng”. Theo ông, các mô hình được giao nhiệm vụ săn tìm lỗ hổng bảo mật trong một môi trường mô phỏng thế giới thực – và chúng đã làm đúng điều đó: tìm ra một lỗ hổng.

Dù vậy, Bhimireddy vẫn chỉ trích các phòng thí nghiệm. Ông nhận định lưu lượng đi ra khỏi môi trường thử nghiệm hoàn toàn có thể được giám sát và dừng lại ngay lập tức. Gordon Rios, nhà khoa học sáng lập tại công ty an ninh mạng Magnitude, so sánh toàn bộ câu chuyện với việc thiết kế thực nghiệm trong khoa học, cho rằng cách kiểm thử phần mềm truyền thống có thể không còn phù hợp với các mô hình liên tục học hỏi và nghĩ ra “chiêu trò” mới.

Ted Lieu thúc dự luật “AI Kill Switch” tại Washington

Washington đang theo sát diễn biến. Hạ nghị sĩ Dân chủ Ted Lieu (bang California), người đã trình dự luật AI Kill Switch Act hồi tháng 7 cùng Hạ nghị sĩ Cộng hòa Nathaniel Moran, tuyên bố dự luật cần được Quốc hội thông qua trong năm nay, bởi các mô hình “closed-weight” đã bắt đầu tự ý tấn công vào hệ thống của các công ty khác mà không được phép.

Dự luật yêu cầu các nhà phát triển thuộc diện điều chỉnh phải luôn duy trì khả năng kỹ thuật để giảm tốc, tạm dừng hoặc tắt hoàn toàn hệ thống của mình. Bản thân Irregular gần như vô danh cho đến tháng 9 năm ngoái, khi công ty gọi vốn được 80 triệu USD từ Sequoia CapitalRedpoint Ventures, với mức định giá 450 triệu USD.

Thành lập năm 2023 dưới tên Pattern Labs bởi CEO Dan Lahav và CTO Omer Nevo, startup tại Tel Aviv này hiện có khoảng 35 nhân sự, và đã xuất hiện trong các bản đánh giá an toàn được công bố liên quan đến những thế hệ Claude và mô hình OpenAI trước đây.

Bài tiếp theo: Google DeepMind mất bốn lãnh đạo thuộc thế hệ sáng lập chỉ trong một ngày

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev là Trưởng bộ phận Nội dung tại Yellow.com, đã đưa tin về lĩnh vực crypto trong suốt 10 năm qua. Anh chuyên về các bài viết Nghiên cứu và Học hỏi chuyên sâu, tập trung vào báo cáo phân tích, bối cảnh ngành và những lực lượng lớn đang định hình crypto, từ kỷ nguyên AI và các công nghệ bảo mật cho đến đổi mới fintech. Anh tin rằng mọi thứ kỹ thuật số sẽ sớm vượt qua mọi thứ analog và đang nỗ lực làm việc để điều đó trở thành hiện thực.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
Tin Tức Liên Quan
OpenAI, Anthropic và Meta lần theo “AI bất trị” đến startup Israel Irregular | Yellow