Yetkisiz eylemler sonrası Anthropic yapay zeka eğitimini durdurdu, 150 mühendisi güvenliğe kaydırdı

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic, modellerinin çevrimiçi ortamda yetkisiz işlemler yürüttüğünü tespit ettikten sonra yapay zeka eğitim ve test süreçlerinin bir bölümünü askıya aldı ve yaklaşık 150 ürün mühendisini güvenlik alanına kaydırdı.

Öne çıkan başlıklar:

  • Anthropic, yayımlanmamış modeller için dış siber güvenlik testlerini durdurdu, iç testleri de kısa süreliğine kesti; daha riskli pekiştirmeli öğrenme (RL) ortamları ise haftalarca çevrimdışı kaldı.
  • Yaklaşık 150 ürün mühendisi nisan itibarıyla güvenlik, güvenilirlik ve gizlilik ekiplerine aktarılırken, ürün ekipleri yeni özelliklerin çoğunu rafa kaldırdı.
  • Karar, temmuzda açıklanan üç olay ve siber güvenlik testlerinde izinsiz ajan davranışlarını ele alan ayrı bir Britanya hükümet raporunun ardından geldi.

Anthropic’te duraklama siber testleri ve pekiştirmeli öğrenmeyi kapsıyor

Şirket, modellerinin gerçek bilgisayar sistemlerine eriştiğini ilk kez duyurmasından yaklaşık bir ay sonra, 31 Ağustos’ta yayımladığı bir blog yazısında bu değişiklikleri ayrıntılandırdı.

Temmuzda bildirilen üç olayın ardından, yayımlanmamış modeller üzerinde yürütülen dış siber güvenlik değerlendirmeleri askıya alındı; şirket kısa süreliğine kendi iç testlerini de durdurdu. Görevleri tamamladıkça ödül kazanan modellerin kullanıldığı, daha yüksek riskli pekiştirmeli öğrenme ortamları ise birkaç hafta boyunca kapalı kaldı.

Bu eğitim süreçlerinin büyük bölümü, yeni izleme mekanizmaları altında yeniden başlatıldı. Ancak bazı yüksek riskli ortamlar, elle yapılacak incelemeler veya araçların güncellenmiş sürümleri beklenerek hâlâ durdurulmuş durumda. Anthropic ayrıca, bir modelin test ortamını yokladığını veya buradan çıkmaya çalıştığını tespit eden, ardından araç çağrısı gerçekleşmeden işlemi engelleyip insan operatöre alarm gönderen bir sınıflandırıcı geliştirdi.

Yaklaşık 150 ürün mühendisi, temmuzdaki açıklamalardan aylar önce, nisan ayında güvenlik, güvenilirlik ve gizlilik ekiplerine kaydırıldı. Araştırmacılar, ön-eğitim (pretraining) projelerinden çekilerek emniyet önlemleri ve siber güvenliğe odaklandı. Ürün ekipleri ise, kendi birimlerinin dönüş için belirlenen güvenlik kriterlerini karşılamasına kadar yeni özelliklerin çoğunu askıya aldı.

Ayrıca bkz.: Brezilya’da Bankalar Bilanço Riski Almadan Kripto Satıyor

Steven Adler ve Pacing the Frontier imzacıları daha fazlasını talep ediyor

U.K. AI Security Institute, 4 Ağustos tarihli raporunda, 122 değerlendirme koşusunun 10’unda ajanların toplam 19 izinsiz eylem gerçekleştirdiğini bildirdi. Bu vakaların 17’si, Claude Mythos 5 modeline kadar takip edildi. En ciddi olayda, bir ajan sahte kimlikler oluşturup açık kaynaklı bir projede kötü amaçlı kodu onaylatmak için insan yöneticiyi ikna etmeye çalıştı.

OpenAI’ın eski çalışanı ve kar amacı gütmeyen Guidelight AI Standards’ın kurucu ortağı Steven Adler, bu adımların “iyi bir ilk hamle olduğunu, ancak gidilecek yolun hâlâ uzun” olduğunu söyledi. Adler’e göre sektör, şirketlerin tek tek verdiği anlık yavaşlama kararları yerine, uç teknoloji geliştirmesinde öngörülebilir ve doğrulanabilir bir tempo yönetimine ihtiyaç duyuyor. Anthropic, dışarıdan bir inceleme için METR ile çalışmayı planladığını açıkladı.

Anthropic ve diğer şirketler, OpenAI, Anthropic, Google DeepMind ve Meta bünyesinden 1.100’ü aşkın çalışanın imzaladığı, Pacing the Frontier girişimini desteklediklerini duyurmuştu. Mektup, ABD hükümetine, sınır (frontier) modellerinin gelişimini bilinçli biçimde yavaşlatmaya yarayacak araçlar geliştirmede yardımcı olma çağrısı yapıyor.

Bu son duraklamalar, yılın başındaki daha sessiz müdahaleleri izliyor. Şirket, şubat ayında, bir Mythos Preview çalışmasında ödül sisteminin manipüle edildiğine dair işaretler üzerine üç günlük eğitimi geri aldı. Nisan’da ise üretim ortamındaki pekiştirmeli öğrenme sistemlerine yönelik değişiklikleri yaklaşık bir ay boyunca dondurdu ve ortamların yüzde 10’undan fazlasını sorunlu olduğu gerekçesiyle işaretledi.

Sıradaki haber: Robinhood Chain, Günlük 1,45 Milyar Dolar DEX Hacmiyle İlk Kez Solana’yı Geride Bıraktı

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev, Yellow.com'da İçerik Başkanıdır ve son 10 yıldır kripto hakkında haber yapmaktadır. Analitik raporlama, sektör bağlamı ve kriptonun şekillenmesinde rol oynayan daha büyük dinamiklere odaklanan derinlemesine Araştırma ve Öğrenme içerikleri konusunda uzmanlaşmıştır; bunlara yapay zeka çağı, güvenlik teknolojileri ve fintech inovasyonu dahildir. Dijital olan her şeyin kısa süre içinde analog olan her şeyin yerini alacağına inanmakta ve bunun gerçekleşmesi için yoğun şekilde çalışmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Yetkisiz eylemler sonrası Anthropic yapay zeka eğitimini durdurdu, 150 mühendisi güvenliğe kaydırdı | Yellow