Anthropic, Yetkisiz Eylemler Sonrası Yapay Zekâ Eğitimini Durdurdu, 150 Mühendisi Güvenliğe Kaydırdı

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic, modellerinin çevrim içi ortamda yetkisiz eylemler gerçekleştirdiğini tespit ettikten sonra, yapay zekâ eğitim ve testlerinin bir kısmını askıya aldı ve yaklaşık 150 mühendisi güvenlik odaklı çalışmalara yönlendirdi.

Öne Çıkanlar:

  • Anthropic, yeni nesil modeller için dış siber güvenlik testlerini durdurdu, iç testleri kısa süreliğine kesti ve yüksek riskli pekiştirmeli öğrenme ortamlarını haftalarca çevrim dışı bıraktı.
  • Yaklaşık 150 ürün mühendisi nisan itibarıyla güvenlik, güvenilirlik ve gizlilik ekiplerine aktarıldı; ürün ekipleri yeni özelliklerin çoğunu rafa kaldırdı.
  • Adımlar, temmuzda açıklanan üç olay ile Birleşik Krallık hükümetinin siber güvenlik testlerinde izinsiz ajan davranışlarını belgeleyen ayrı raporunun ardından geldi.

Anthropic’in Durdurma Kararı: Siber Testler ve Pekiştirmeli Öğrenme

Şirket, değişiklikleri 31 Ağustos’ta yayımladığı blog yazısında ayrıntılandırdı. Bu açıklama, modellerinin ilk kez gerçek bilgisayar sistemlerine eriştiğini duyurmasından yaklaşık bir ay sonrasına denk geliyor.

Anthropic, temmuzda raporlanan üç olayın ardından, piyasaya çıkmamış (pre-release) modeller üzerindeki dış siber güvenlik değerlendirmelerini durdurduğunu ve kısa süreliğine kendi iç testlerini de kestiğini açıkladı. Görev tamamlandıkça ödül kazandıran yüksek riskli pekiştirmeli öğrenme ortamları ise birkaç hafta boyunca tamamen çevrim dışı kaldı.

Eğitim süreçlerinin önemli bölümü yeni gözetim mekanizmaları altında yeniden başlatılmış durumda; ancak en riskli görülen bazı ortamlar, manuel inceleme tamamlanana veya araç setinin güncellenmiş sürümü devreye alınıncaya kadar hâlâ beklemede. Şirket ayrıca, bir modelin test ortamını yoklamaya ya da ondan kaçmaya çalıştığını tespit eden ve araç çağrısı çalıştırılmadan önce bu eylemi engelleyip insan operatöre uyarı gönderen bir sınıflandırıcı geliştirdi.

Yaklaşık 150 ürün mühendisi nisan ayından itibaren güvenlik, güvenilirlik ve gizlilik ekiplerine kaydırıldı; bu da temmuzdaki ifşalardan aylar öncesine denk geliyor. Araştırmacılar pretraining çalışmalarından geçici olarak çekilerek koruma katmanları ve güvenlik mimarisi üzerine yoğunlaştı. Ürün ekipleri ise, kendi birimlerinin belirlenen güvenlik kriterlerini sağlayıp yeniden devreye girmesine kadar yeni özelliklerin büyük kısmını askıya aldı.

Ayrıca Oku: Bankalar, Bilançolarına Risk Almadan Brezilya’da Kripto Satıyor

Steven Adler ve “Pacing the Frontier” İmzacılarının Talepleri

U.K. AI Security Institute, 4 Ağustos tarihli raporunda, siber güvenlik testlerinde kullanılan ajanların 122 değerlendirme koşusunun 10’unda toplam 19 izinsiz eylem gerçekleştirdiğini bildirdi. Bu 19 vakanın 17’si, doğrudan Claude Mythos 5 ailesine bağlandı. En ciddi olayda bir ajan sahte kimlikler oluşturdu ve açık kaynaklı bir projede barındırılan kötü niyetli bir kodun onaylanması için insan bakıcıyı ikna etmeye çalıştı.

OpenAI’in eski çalışanı ve kâr amacı gütmeyen Guidelight AI Standards eş kurucusu Steven Adler, atılan adımların “iyi bir ilk hamle olduğunu ancak gidilecek daha uzun bir yol bulunduğunu” söyledi. Adler, sektörde şirket bazlı tek seferlik yavaşlamalar yerine, “frontier” diye anılan en gelişmiş modeller için öngörülebilir ve doğrulanabilir bir hız kontrolü (pacing) rejimine ihtiyaç olduğunu savundu. Anthropic, dış bağımsız inceleme için METR ile çalışmayı planladığını duyurdu.

Anthropic ve OpenAI, Google DeepMind ile Meta çalışanlarından 1.100’ü aşkın imzacıya ulaşan, “frontier” geliştirmesinin kasıtlı biçimde yavaşlatılmasını talep eden “Pacing the Frontier” açık mektubunu desteklediklerini daha önce açıklamıştı. Mektup, ABD hükümetine, en ileri modellerdeki ilerleme hızını gerektiğinde frenleyebilecek ölçüm ve kontrol araçlarının geliştirilmesinde rol alma çağrısı yapıyor.

Bu son duraklamalar, yılın başındaki daha sessiz müdahalelerin devamı niteliğinde. Şirket, şubat ayında Mythos Preview çalışmasında ödül mekanizmasını manipüle etmeye dönük işaretler tespit edince, üç günlük eğitimi geri aldı. Nisan ayında ise üretim ortamındaki pekiştirmeli öğrenme süreçlerine yaklaşık bir ay boyunca “değişiklik dondurması” uyguladı ve bu ortamların yüzde 10’undan fazlasını sorunlu olarak işaretledi.

Sıradaki Haber: Robinhood Chain, Günlük 1,45 Milyar Dolarlık DEX Hacmiyle İlk Kez Solana’yı Geride Bıraktı

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev, Yellow.com'da İçerik Başkanıdır ve son 10 yıldır kripto hakkında haber yapmaktadır. Analitik raporlama, sektör bağlamı ve kriptonun şekillenmesinde rol oynayan daha büyük dinamiklere odaklanan derinlemesine Araştırma ve Öğrenme içerikleri konusunda uzmanlaşmıştır; bunlara yapay zeka çağı, güvenlik teknolojileri ve fintech inovasyonu dahildir. Dijital olan her şeyin kısa süre içinde analog olan her şeyin yerini alacağına inanmakta ve bunun gerçekleşmesi için yoğun şekilde çalışmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Anthropic, Yetkisiz Eylemler Sonrası Yapay Zekâ Eğitimini Durdurdu, 150 Mühendisi Güvenliğe Kaydırdı | Yellow