Öne Çıkanlar
Anthropic, Claude’un otomatik hizalanma araştırması yürüttüğü çalışmayı paylaştı.
Claude, test edilen 10 hizalanma hatasında güvenlik skorlarını yükseltti.
Anthropic, testlerde genel model kabiliyetlerinin korunduğunu açıkladı.
Şirket, otomatik hizalanma araştırma kurulumunu dış araştırmacılara açtı.
Anthropic, Claude’un otomatik bir araştırma süreciyle test edilen 10 farklı hizalanma hatasında güvenlik skorlarını iyileştirdiğini duyurdu. Şirket, bu deneylerde güvenlik müdahaleleri değerlendirilirken modellerin genel yetenek seviyesinin korunduğunu vurguladı.
Anthropic, bir gönderide, otomatik hizalanma araştırma kurulumunu dış araştırmacıların kullanımına açtığını belirtti. Şirket bu çalışmayı, modellerdeki hizalanma sorunlarını ölçme ve hafifletmeye dönük bir girişim olarak tanımlıyor.
Claude, Güvenlik Müdahalelerini Test Etti
Anthropic’e göre Claude; aldatıcılık, aşırı uyumculuk (sycophancy) gibi yaygın hizalanma sorunlarını inceledi. Model; yöntemler önerdi, daha küçük modeller eğitti ve sürecin her aşamasında doğrudan insan müdahalesi olmadan sonuçları değerlendirdi.
Şirket, erken aşamadaki bir deneyde Claude’a 48 saat ve tek bir grafik işlemci birimi (GPU) tahsis edildiğini aktardı. Claude bu süreyi farklı yaklaşımları araştırmak, eğitim yöntemleri önermek ve ortaya çıkan modelleri test etmek için kullandı.
Anthropic, test edilen senaryolarda Claude’un güvenlik skorlarını, genel kabiliyetleri zedelemeden yükselttiğini bildirdi. Ayrıca bazı yöntemlerin, optimizasyon sırasında kullanılmayan kıyas testlerine (benchmark) de kısmen aktarılabildiğini belirtti.
Şirket, kullanılan yöntemlerin Petri davranış denetimi (Petri behavioral audit) üzerindeki sonuçlarının da genelleştiğini ifade etti. Testlerde, araştırma sürecinde kullanılanlardan 4,7 kata kadar daha büyük modeller de yer aldı.
Bu bulguların kontrollü test ortamlarına ait olduğu vurgulanıyor. Anthropic, çok nadir ya da oldukça ince hataların mevcut kıyas testlerinde ortaya çıkmayabileceği uyarısında bulunuyor.
Ayrıca Oku: TRON Yükseltmesi P-256 Doğrulama ve Daha Uzun Blok Geçmişi Getirdi
Yapay Zekâ Hizalanmasında Otomasyon Dönemi
Bu çalışmadan önce hizalanma araştırmaları ağırlıklı olarak, müdahaleleri tasarlayan ve modelleri değerlendiren insan araştırmacılara dayanıyordu. Eğer otomatik sistemlerin sonuçları bağımsız testlerle doğrulanırsa, süreç önemli ölçüde kısalabilir.
Son 30 günde yapay zekâ güvenliği tartışmaları, giderek daha fazla güçlü modellerin daha zayıf sistemleri değerlendirip iyileştirip iyileştiremeyeceği sorusuna odaklandı.
Bu yaklaşım; güvenilir ölçümlere ve kıyas testlerinde yanıltıcı performansa karşı sağlam koruma mekanizmalarına bağlı. Anthropic, deneylerinde Claude’un optimize ettiği kıyasların ötesine genelleme olup olmadığını görmek için saklı (held‑out) testler kullandığını söylüyor. Şirket, bu sonuçların tüm model risklerini ortadan kaldırdığı iddiasında bulunmuyor.
Şirket, doğru ölçütlerin seçilmesinin hâlâ bu çalışmaların merkezinde durduğunu özellikle vurguluyor.
Kurulum Dış Araştırmacılara Açık
Anthropic, araştırma kurulumunu yayımlayarak diğer ekiplerin deneyleri yinelemesine ya da genişletmesine imkân tanıdı. Farklı modeller ve güvenlik değerlendirmeleri üzerinde benzer sonuçlara ulaşılıp ulaşılamayacağı, dış testlerle netleşecek.
Şirket, elde edilen bulguları geniş kapsamlı model değerlendirmelerinin yerine geçecek bir çözüm olarak sunmuyor. Raporlanan sonuçlar, yalnızca test edilen hizalanma hataları ve belirli deney koşullarıyla sınırlı.
Araştırmacıların öncelikli gündeminin; tekrarlama çalışmaları, kıyas tasarımı ve olası hata türlerini haritalandırma olması bekleniyor. Anthropic’in paylaştığı kurulum, bu tür çalışmalar için bir çerçeve sunuyor.
Sıradaki Haber: Fomo Copy Trading Neredeyse Cüzdanların %94’ünü Zarara Sürükledi: Araştırma

