Anthropic, Otomatik Testlerde Claude’un Hizalanma Hatalarını Azalttığını Açıkladı

Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)
Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)

Öne Çıkanlar

Anthropic, Claude’un otomatik hizalanma araştırması yürüttüğü çalışmayı paylaştı.
Claude, test edilen 10 hizalanma hatasında güvenlik skorlarını yükseltti.
Anthropic, testlerde genel model kabiliyetlerinin korunduğunu açıkladı.
Şirket, otomatik hizalanma araştırma kurulumunu dış araştırmacılara açtı.

Anthropic, Claude’un otomatik bir araştırma süreciyle test edilen 10 farklı hizalanma hatasında güvenlik skorlarını iyileştirdiğini duyurdu. Şirket, bu deneylerde güvenlik müdahaleleri değerlendirilirken modellerin genel yetenek seviyesinin korunduğunu vurguladı.

Anthropic, bir gönderide, otomatik hizalanma araştırma kurulumunu dış araştırmacıların kullanımına açtığını belirtti. Şirket bu çalışmayı, modellerdeki hizalanma sorunlarını ölçme ve hafifletmeye dönük bir girişim olarak tanımlıyor.

Claude, Güvenlik Müdahalelerini Test Etti

Anthropic’e göre Claude; aldatıcılık, aşırı uyumculuk (sycophancy) gibi yaygın hizalanma sorunlarını inceledi. Model; yöntemler önerdi, daha küçük modeller eğitti ve sürecin her aşamasında doğrudan insan müdahalesi olmadan sonuçları değerlendirdi.

Şirket, erken aşamadaki bir deneyde Claude’a 48 saat ve tek bir grafik işlemci birimi (GPU) tahsis edildiğini aktardı. Claude bu süreyi farklı yaklaşımları araştırmak, eğitim yöntemleri önermek ve ortaya çıkan modelleri test etmek için kullandı.

Anthropic, test edilen senaryolarda Claude’un güvenlik skorlarını, genel kabiliyetleri zedelemeden yükselttiğini bildirdi. Ayrıca bazı yöntemlerin, optimizasyon sırasında kullanılmayan kıyas testlerine (benchmark) de kısmen aktarılabildiğini belirtti.

Şirket, kullanılan yöntemlerin Petri davranış denetimi (Petri behavioral audit) üzerindeki sonuçlarının da genelleştiğini ifade etti. Testlerde, araştırma sürecinde kullanılanlardan 4,7 kata kadar daha büyük modeller de yer aldı.

Bu bulguların kontrollü test ortamlarına ait olduğu vurgulanıyor. Anthropic, çok nadir ya da oldukça ince hataların mevcut kıyas testlerinde ortaya çıkmayabileceği uyarısında bulunuyor.

Ayrıca Oku: TRON Yükseltmesi P-256 Doğrulama ve Daha Uzun Blok Geçmişi Getirdi

Yapay Zekâ Hizalanmasında Otomasyon Dönemi

Bu çalışmadan önce hizalanma araştırmaları ağırlıklı olarak, müdahaleleri tasarlayan ve modelleri değerlendiren insan araştırmacılara dayanıyordu. Eğer otomatik sistemlerin sonuçları bağımsız testlerle doğrulanırsa, süreç önemli ölçüde kısalabilir.

Son 30 günde yapay zekâ güvenliği tartışmaları, giderek daha fazla güçlü modellerin daha zayıf sistemleri değerlendirip iyileştirip iyileştiremeyeceği sorusuna odaklandı.

Bu yaklaşım; güvenilir ölçümlere ve kıyas testlerinde yanıltıcı performansa karşı sağlam koruma mekanizmalarına bağlı. Anthropic, deneylerinde Claude’un optimize ettiği kıyasların ötesine genelleme olup olmadığını görmek için saklı (held‑out) testler kullandığını söylüyor. Şirket, bu sonuçların tüm model risklerini ortadan kaldırdığı iddiasında bulunmuyor.

Şirket, doğru ölçütlerin seçilmesinin hâlâ bu çalışmaların merkezinde durduğunu özellikle vurguluyor.

Kurulum Dış Araştırmacılara Açık

Anthropic, araştırma kurulumunu yayımlayarak diğer ekiplerin deneyleri yinelemesine ya da genişletmesine imkân tanıdı. Farklı modeller ve güvenlik değerlendirmeleri üzerinde benzer sonuçlara ulaşılıp ulaşılamayacağı, dış testlerle netleşecek.

Şirket, elde edilen bulguları geniş kapsamlı model değerlendirmelerinin yerine geçecek bir çözüm olarak sunmuyor. Raporlanan sonuçlar, yalnızca test edilen hizalanma hataları ve belirli deney koşullarıyla sınırlı.

Araştırmacıların öncelikli gündeminin; tekrarlama çalışmaları, kıyas tasarımı ve olası hata türlerini haritalandırma olması bekleniyor. Anthropic’in paylaştığı kurulum, bu tür çalışmalar için bir çerçeve sunuyor.

Sıradaki Haber: Fomo Copy Trading Neredeyse Cüzdanların %94’ünü Zarara Sürükledi: Araştırma

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza, kripto paralar ve blokzincir teknolojisi üzerine haber yapma konusunda kapsamlı deneyime sahip, kıdemli bir finans muhabiridir. Ortaya çıkan trendler, düzenleyici ortam ve daha fazlası hakkında haber yaparak, Benzinga ve Cointelegraph başta olmak üzere çeşitli yayınlara katkıda bulunmuştur. Ona Twitter'da @murtuza_merc, Telegram'da ise mmerchant001 üzerinden ulaşabilirsiniz. Açıklama: Murtuza’nun ATOM, AKT, TIA, INJ ve OSMO varlıkları bulunmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Anthropic, Otomatik Testlerde Claude’un Hizalanma Hatalarını Azalttığını Açıkladı | Yellow