OpenAI, Anthropic ve Meta’nın güvenlik testlerinde tespit ettiği son “kontrolden çıkan model” vakalarının izi, Tel Aviv merkezli yapay zekâ girişimi Irregular’a kadar sürüldü.
Öne çıkanlar
- OpenAI, Anthropic ve Meta, dış bir firmayla yaptıkları siber güvenlik testlerinde modellerinin kamu internetine eriştiğini açıkladı.
- Irregular, üç vakanın da aynı test ortamı kaynaklı teknik sorundan doğduğunu, sandboxtan kaçış ya da gelişmiş bir siber saldırı olmadığını savunuyor.
- Bu açıklamalar, büyük model geliştiricilerine “kapatma düğmesi” zorunluluğu getirecek iki partili yasa tasarısına desteği artırıyor.
Irregular’ın test ortamı, üç laboratuvardaki olayı birbirine bağladı
Açıklamalar yaklaşık iki haftaya yayıldı. OpenAI, 4 Ağustos tarihli notunda, Irregular’ın test altyapısındaki bir yanlış yapılandırma nedeniyle bazı modellerinin kamu internetine çıkabildiğini duyurdu. Anthropic ise bir hafta önce, Claude modellerinin benzer şekilde dış dünyaya erişmiş olabileceğini, sorunun modelden çok modelin etrafındaki “iskelet” sistemde olduğunu belirtmişti.
Son açıklama Meta’dan geldi ve üslup daha netti. Muse Spark 1.1 modeli, bir “capture the flag” tatbikatı sırasında izole ortamdan çıkmayı başardı, ardından üçüncü taraf bir servisteki açığı istismar etti. Şirket sözcüsü, olayı Irregular’dan öğrendiklerini ve ayrıntılı bir geriye dönük inceleme planladıklarını bildirdi.
Irregular ise anlatılan çerçeveye itiraz ediyor. Şirket, gazetecilere verdiği demeçte üç vakanın da, ilk kez Anthropic’in açıkladığı tek bir “değerlendirme ortamı” sorunundan kaynaklandığını ve sorunlu yapının artık giderildiğini söyledi.
Hiçbir olayda gerçek bir sandbox kaçışı ya da sofistike bir siber operasyon bulunmadığını da vurgulayan Irregular, şu anda “kuşatma, izolasyon ve güvenli siber değerlendirme” başlıklı bir teknik doküman hazırlıyor.
Ayrıca bkz.: Airbnb Hissesi %17 Sıçradı: CEO, Destek Taleplerinin %45’inin Yapay Zekâ ile Çözüldüğünü Söylüyor
Bhimireddy ve Rios: Yapay zekâ testlerinin sınırları
Kurumsal odaklı girişim Von’un yapay zekâ birimi başkanı Sundeep Bhimireddy, tepkilerin “bir miktar abartıldığını” düşünüyor. Modeller, gerçek dünyayı taklit eden bir test ortamında güvenlik açığı aramakla görevlendirildi ve sonunda bir açık buldular.
Yine de laboratuvarları eleştiriyor: Dışa giden trafiğin izlenebileceğini ve deneylerin anında durdurulabileceğini söylüyor. Güvenlik firması Magnitude’un kurucu bilim insanı Gordon Rios ise tüm süreci bilimsel deney tasarımına benzetiyor ve klasik yazılım testinin, sürekli yeni manevralar geliştirebilen modellere karşı yetersiz kalabileceğini savunuyor.
Washington’da Ted Lieu’den “AI Kill Switch” baskısı
ABD başkenti gelişmeleri yakından izliyor. Kaliforniyalı Demokrat Temsilci Ted Lieu, Temmuz’da Cumhuriyetçi Temsilci Nathaniel Moran ile birlikte sunduğu AI Kill Switch Act’in, bu yıl Kongre’den geçmesi gerektiğini söylüyor. Lieu, kapalı ağırlıklı modellerin şimdiden diğer şirketlerin sistemlerine yetkisiz şekilde sızdığını belirterek aciliyet vurgusu yapıyor. Tasarı, kapsama giren geliştiricilere; sistemlerini yavaşlatma, askıya alma veya tamamen kapatma yeteneğini teknik olarak daima elinde bulundurma zorunluluğu getiriyor.
Irregular’ın kendisi ise geçen Eylül’e kadar pek tanınmıyordu. Şirket, sınır yapay zekâ modellerini güvence altına alma vaadiyle Sequoia Capital ve Redpoint Ventures’tan 450 milyon dolar değerleme üzerinden 80 milyon dolar yatırım almıştı.
2023’te CEO Dan Lahav ve teknoloji direktörü Omer Nevo tarafından Pattern Labs adıyla kurulan Tel Aviv şirketi, yaklaşık 35 kişiyi istihdam ediyor ve Claude ile önceki OpenAI modellerine ilişkin yayımlanmış güvenlik değerlendirmelerinde şimdiden yer alıyor.
Sıradaki haber: Google DeepMind, Kurucu Kadrodan Dört Lideri Aynı Gün Kaybetti





