Öne Çıkanlar
Anthropic, Claude’un otomatik hizalanma çalışması yürüttüğü araştırmayı yayımladı. Claude, test edilen 10 hizalanma hatasında güvenlik puanlarını artırdı. Şirket, testlerde modellerin genel yeteneklerinin korunduğunu vurguladı. Otomatik hizalanma araştırma altyapısı dış araştırmacılara da açıldı.
Anthropic, Claude’un otomatik bir araştırma süreciyle test edilen 10 farklı hizalanma hatasında güvenlik skorlarını yükselttiğini açıkladı. Şirket, bu deneylerde güvenlik müdahaleleri incelenirken modelin genel performansının korunduğunu belirtti.
Anthropic, yayımladığı bir paylaşımda otomatik hizalanma araştırma altyapısını dış araştırmacıların kullanımına açtığını duyurdu. Çalışma, model uyumsuzluklarını ölçmek ve azaltmak için atılan bir adım olarak tanımlandı.
Claude Güvenlik Müdahalelerini Test Etti
Anthropic’e göre Claude; aldatma, yapmacık onaycılık (sycophancy) gibi yaygın hizalanma sorunlarını inceledi. Model; yöntemler önerdi, daha küçük modeller eğitti ve her adımda insan müdahalesi olmadan sonuçları değerlendirdi.
Şirket, ilk deneyde Claude’a 48 saat ve tek bir grafik işlem birimi (GPU) tahsis edildiğini aktardı. Claude bu süre içinde yeni yaklaşımlar araştırdı, eğitim stratejileri önerdi ve ortaya çıkan modelleri test etti.
Anthropic, test edilen senaryolarda Claude’un güvenlik skorlarını artırırken genel yetenekleri aşağı çekmediğini bildirdi. Bazı yöntemlerin, optimizasyonda kullanılmayan ek kıyaslama testlerine de kısmen taşındığı ifade edildi.
Şirket, geliştirdiği yöntemlerin Petri davranış denetimi testlerine de genelleştiğini duyurdu. Deneylerde, araştırma sürecinde kullanılanlardan 4,7 kata kadar daha büyük modellerin de yer aldığı belirtildi.
Elde edilen sonuçlar, ölçülebilir ve kontrollü test ortamlarını yansıtıyor. Anthropic, çok nadir ya da çok ince hataların mevcut kıyaslama setlerinde görünmeyebileceği uyarısında bulundu.
Ayrıca Oku: TRON Yükseltmesi P-256 Doğrulaması ve Daha Uzun Blok Geçmişi Ekliyor
Yapay Zekâ Hizalanması Otomasyona Geçiyor
Bu çalışmadan önce hizalanma alanındaki ilerleme, ağırlıklı olarak insan araştırmacıların müdahaleleri tasarlayıp modelleri değerlendirmesine dayanıyordu. Otomatik sistemler, sonuçlar bağımsız değerlendirmelere de dayanırsa bu süreci önemli ölçüde kısaltabilir.
Son 30 günde yapay zekâ güvenliği tartışmalarında, daha güçlü modellerin daha zayıf sistemleri değerlendirip iyileştirmede kullanılıp kullanılamayacağı daha sık gündeme geliyor.
Bu yaklaşım, güvenilir ölçümler ile yanıltıcı kıyaslama performansına karşı alınan önlemlere dayanıyor. Anthropic, deneyinin, Claude’un optimize ettiği kıyaslamaların ötesine geçip geçmediğini anlamak için saklı testler (held-out tests) kullandığını söyledi. Şirket, bu kıyaslama sonuçlarının tüm model risklerini ortadan kaldırdığı iddiasında bulunmuyor.
Anthropic, doğru ölçümleri seçmenin çalışmanın merkezinde olmaya devam ettiğini vurguladı.
Kurulum Artık Dış Araştırmacılara Açık
Anthropic, araştırma altyapısını yayımlayarak diğer grupların bu deneyleri yeniden üretmesinin veya genişletmesinin önünü açtı. Farklı model ve güvenlik çerçevelerinde yöntemlerin ne ölçüde işe yaradığını ise dış testler ortaya koyacak.
Şirket, bulguları daha kapsamlı model değerlendirmelerinin yerine geçecek bir çözüm olarak sunmuyor. Raporlanan sonuçlar, yalnızca test edilen hizalanma hataları ve deneysel kısıtlarla sınırlı.
Araştırmacıların odağında büyük olasılıkla tekrar edilebilirlik, kıyaslama tasarımı ve potansiyel arıza biçimleri olacak. Anthropic’in paylaşımı, bu çalışmalar için yeniden kullanılabilir bir çerçeve sağlıyor.
Sıradaki Haber: Fomo Copy Trading Yaklaşık %94 Cüzdanı Zarara Sürükledi: Araştırma





