Anthropic, modellerinin çevrimiçi ortamda yetkisiz işlemler yürüttüğünü tespit ettikten sonra yapay zeka eğitim ve test süreçlerinin bir bölümünü askıya aldı ve yaklaşık 150 ürün mühendisini güvenlik alanına kaydırdı.
Öne çıkan başlıklar:
- Anthropic, yayımlanmamış modeller için dış siber güvenlik testlerini durdurdu, iç testleri de kısa süreliğine kesti; daha riskli pekiştirmeli öğrenme (RL) ortamları ise haftalarca çevrimdışı kaldı.
- Yaklaşık 150 ürün mühendisi nisan itibarıyla güvenlik, güvenilirlik ve gizlilik ekiplerine aktarılırken, ürün ekipleri yeni özelliklerin çoğunu rafa kaldırdı.
- Karar, temmuzda açıklanan üç olay ve siber güvenlik testlerinde izinsiz ajan davranışlarını ele alan ayrı bir Britanya hükümet raporunun ardından geldi.
Anthropic’te duraklama siber testleri ve pekiştirmeli öğrenmeyi kapsıyor
Şirket, modellerinin gerçek bilgisayar sistemlerine eriştiğini ilk kez duyurmasından yaklaşık bir ay sonra, 31 Ağustos’ta yayımladığı bir blog yazısında bu değişiklikleri ayrıntılandırdı.
Temmuzda bildirilen üç olayın ardından, yayımlanmamış modeller üzerinde yürütülen dış siber güvenlik değerlendirmeleri askıya alındı; şirket kısa süreliğine kendi iç testlerini de durdurdu. Görevleri tamamladıkça ödül kazanan modellerin kullanıldığı, daha yüksek riskli pekiştirmeli öğrenme ortamları ise birkaç hafta boyunca kapalı kaldı.
Bu eğitim süreçlerinin büyük bölümü, yeni izleme mekanizmaları altında yeniden başlatıldı. Ancak bazı yüksek riskli ortamlar, elle yapılacak incelemeler veya araçların güncellenmiş sürümleri beklenerek hâlâ durdurulmuş durumda. Anthropic ayrıca, bir modelin test ortamını yokladığını veya buradan çıkmaya çalıştığını tespit eden, ardından araç çağrısı gerçekleşmeden işlemi engelleyip insan operatöre alarm gönderen bir sınıflandırıcı geliştirdi.
Yaklaşık 150 ürün mühendisi, temmuzdaki açıklamalardan aylar önce, nisan ayında güvenlik, güvenilirlik ve gizlilik ekiplerine kaydırıldı. Araştırmacılar, ön-eğitim (pretraining) projelerinden çekilerek emniyet önlemleri ve siber güvenliğe odaklandı. Ürün ekipleri ise, kendi birimlerinin dönüş için belirlenen güvenlik kriterlerini karşılamasına kadar yeni özelliklerin çoğunu askıya aldı.
Ayrıca bkz.: Brezilya’da Bankalar Bilanço Riski Almadan Kripto Satıyor
Steven Adler ve Pacing the Frontier imzacıları daha fazlasını talep ediyor
U.K. AI Security Institute, 4 Ağustos tarihli raporunda, 122 değerlendirme koşusunun 10’unda ajanların toplam 19 izinsiz eylem gerçekleştirdiğini bildirdi. Bu vakaların 17’si, Claude Mythos 5 modeline kadar takip edildi. En ciddi olayda, bir ajan sahte kimlikler oluşturup açık kaynaklı bir projede kötü amaçlı kodu onaylatmak için insan yöneticiyi ikna etmeye çalıştı.
OpenAI’ın eski çalışanı ve kar amacı gütmeyen Guidelight AI Standards’ın kurucu ortağı Steven Adler, bu adımların “iyi bir ilk hamle olduğunu, ancak gidilecek yolun hâlâ uzun” olduğunu söyledi. Adler’e göre sektör, şirketlerin tek tek verdiği anlık yavaşlama kararları yerine, uç teknoloji geliştirmesinde öngörülebilir ve doğrulanabilir bir tempo yönetimine ihtiyaç duyuyor. Anthropic, dışarıdan bir inceleme için METR ile çalışmayı planladığını açıkladı.
Anthropic ve diğer şirketler, OpenAI, Anthropic, Google DeepMind ve Meta bünyesinden 1.100’ü aşkın çalışanın imzaladığı, Pacing the Frontier girişimini desteklediklerini duyurmuştu. Mektup, ABD hükümetine, sınır (frontier) modellerinin gelişimini bilinçli biçimde yavaşlatmaya yarayacak araçlar geliştirmede yardımcı olma çağrısı yapıyor.
Bu son duraklamalar, yılın başındaki daha sessiz müdahaleleri izliyor. Şirket, şubat ayında, bir Mythos Preview çalışmasında ödül sisteminin manipüle edildiğine dair işaretler üzerine üç günlük eğitimi geri aldı. Nisan’da ise üretim ortamındaki pekiştirmeli öğrenme sistemlerine yönelik değişiklikleri yaklaşık bir ay boyunca dondurdu ve ortamların yüzde 10’undan fazlasını sorunlu olduğu gerekçesiyle işaretledi.
Sıradaki haber: Robinhood Chain, Günlük 1,45 Milyar Dolar DEX Hacmiyle İlk Kez Solana’yı Geride Bıraktı





