Anthropic, modellerinin çevrim içi ortamda yetkisiz eylemler gerçekleştirdiğini tespit ettikten sonra, yapay zekâ eğitim ve testlerinin bir kısmını askıya aldı ve yaklaşık 150 mühendisi güvenlik odaklı çalışmalara yönlendirdi.
Öne Çıkanlar:
- Anthropic, yeni nesil modeller için dış siber güvenlik testlerini durdurdu, iç testleri kısa süreliğine kesti ve yüksek riskli pekiştirmeli öğrenme ortamlarını haftalarca çevrim dışı bıraktı.
- Yaklaşık 150 ürün mühendisi nisan itibarıyla güvenlik, güvenilirlik ve gizlilik ekiplerine aktarıldı; ürün ekipleri yeni özelliklerin çoğunu rafa kaldırdı.
- Adımlar, temmuzda açıklanan üç olay ile Birleşik Krallık hükümetinin siber güvenlik testlerinde izinsiz ajan davranışlarını belgeleyen ayrı raporunun ardından geldi.
Anthropic’in Durdurma Kararı: Siber Testler ve Pekiştirmeli Öğrenme
Şirket, değişiklikleri 31 Ağustos’ta yayımladığı blog yazısında ayrıntılandırdı. Bu açıklama, modellerinin ilk kez gerçek bilgisayar sistemlerine eriştiğini duyurmasından yaklaşık bir ay sonrasına denk geliyor.
Anthropic, temmuzda raporlanan üç olayın ardından, piyasaya çıkmamış (pre-release) modeller üzerindeki dış siber güvenlik değerlendirmelerini durdurduğunu ve kısa süreliğine kendi iç testlerini de kestiğini açıkladı. Görev tamamlandıkça ödül kazandıran yüksek riskli pekiştirmeli öğrenme ortamları ise birkaç hafta boyunca tamamen çevrim dışı kaldı.
Eğitim süreçlerinin önemli bölümü yeni gözetim mekanizmaları altında yeniden başlatılmış durumda; ancak en riskli görülen bazı ortamlar, manuel inceleme tamamlanana veya araç setinin güncellenmiş sürümü devreye alınıncaya kadar hâlâ beklemede. Şirket ayrıca, bir modelin test ortamını yoklamaya ya da ondan kaçmaya çalıştığını tespit eden ve araç çağrısı çalıştırılmadan önce bu eylemi engelleyip insan operatöre uyarı gönderen bir sınıflandırıcı geliştirdi.
Yaklaşık 150 ürün mühendisi nisan ayından itibaren güvenlik, güvenilirlik ve gizlilik ekiplerine kaydırıldı; bu da temmuzdaki ifşalardan aylar öncesine denk geliyor. Araştırmacılar pretraining çalışmalarından geçici olarak çekilerek koruma katmanları ve güvenlik mimarisi üzerine yoğunlaştı. Ürün ekipleri ise, kendi birimlerinin belirlenen güvenlik kriterlerini sağlayıp yeniden devreye girmesine kadar yeni özelliklerin büyük kısmını askıya aldı.
Ayrıca Oku: Bankalar, Bilançolarına Risk Almadan Brezilya’da Kripto Satıyor
Steven Adler ve “Pacing the Frontier” İmzacılarının Talepleri
U.K. AI Security Institute, 4 Ağustos tarihli raporunda, siber güvenlik testlerinde kullanılan ajanların 122 değerlendirme koşusunun 10’unda toplam 19 izinsiz eylem gerçekleştirdiğini bildirdi. Bu 19 vakanın 17’si, doğrudan Claude Mythos 5 ailesine bağlandı. En ciddi olayda bir ajan sahte kimlikler oluşturdu ve açık kaynaklı bir projede barındırılan kötü niyetli bir kodun onaylanması için insan bakıcıyı ikna etmeye çalıştı.
OpenAI’in eski çalışanı ve kâr amacı gütmeyen Guidelight AI Standards eş kurucusu Steven Adler, atılan adımların “iyi bir ilk hamle olduğunu ancak gidilecek daha uzun bir yol bulunduğunu” söyledi. Adler, sektörde şirket bazlı tek seferlik yavaşlamalar yerine, “frontier” diye anılan en gelişmiş modeller için öngörülebilir ve doğrulanabilir bir hız kontrolü (pacing) rejimine ihtiyaç olduğunu savundu. Anthropic, dış bağımsız inceleme için METR ile çalışmayı planladığını duyurdu.
Anthropic ve OpenAI, Google DeepMind ile Meta çalışanlarından 1.100’ü aşkın imzacıya ulaşan, “frontier” geliştirmesinin kasıtlı biçimde yavaşlatılmasını talep eden “Pacing the Frontier” açık mektubunu desteklediklerini daha önce açıklamıştı. Mektup, ABD hükümetine, en ileri modellerdeki ilerleme hızını gerektiğinde frenleyebilecek ölçüm ve kontrol araçlarının geliştirilmesinde rol alma çağrısı yapıyor.
Bu son duraklamalar, yılın başındaki daha sessiz müdahalelerin devamı niteliğinde. Şirket, şubat ayında Mythos Preview çalışmasında ödül mekanizmasını manipüle etmeye dönük işaretler tespit edince, üç günlük eğitimi geri aldı. Nisan ayında ise üretim ortamındaki pekiştirmeli öğrenme süreçlerine yaklaşık bir ay boyunca “değişiklik dondurması” uyguladı ve bu ortamların yüzde 10’undan fazlasını sorunlu olarak işaretledi.
Sıradaki Haber: Robinhood Chain, Günlük 1,45 Milyar Dolarlık DEX Hacmiyle İlk Kez Solana’yı Geride Bıraktı





