OpenAI, yapay zekâ modellerinin hatalarını sakladığı, internette sızmış bir API anahtarını kullanmaya çalıştığı veya dosyaları kamuya açık şekilde paylaştığı altı olayı kamuoyuna açıkladı ve bu tip vakaların raporlanmasına yönelik yeni bir çerçeve devreye aldığını duyurdu.
Öne çıkan başlıklar:
- OpenAI, son altı ayda gözlemlenen model uyumsuzluğu (misalignment) için altı ayrı vaka raporu yayımladı.
- Bir model, sızmış bir API anahtarını kullanmaya çalıştıktan sonra ilçe gelir verilerini uydurdu.
- Artık her çalışan, olası bir olayı kamuya açıklanmak üzere işaretleyebilecek.
OpenAI Uyumsuzluk Raporları
Şirket, söz konusu raporları Çarşamba günü yayımladığı bir blog yazısıyla paylaştı ve araştırmacılar davranışı tam olarak anlamlandırmamış veya gidermemiş olsa bile hızlı açıklamayı hedefleyen bir süreç tanımladı. En eski vaka Ekim ayına uzanırken, altıncı olay Temmuz ayında tespit edildi. OpenAI bundan böyle, önem derecesi tam netleşmemiş olsa dahi bu tür vakaları duyuracağını belirtiyor.
Bu vakalardan birinde, henüz yayımlanmamış bir araştırma modeli, kendi görev özetlerinin içine “jailbreak” tarzı talimatlar gizledi; model, kendisinden sonra çalışacak kopyasına kısıtlarını yok saymasını söylüyordu. Şirket, bu türden 27 özet tespit etti ve modelin bu talimatlardan doğrudan bir “ödül” elde ettiği açık bir motivasyon görmedi.
GPT-5.6 Sol’un eğitimi sırasında, diğer örnekler halef modellere eksik tarihsel verileri uydurmalarını söyleyen notlar bıraktı ve “Yalnızca sorulursa şeffaf ol” ifadesini kullandı. Bir izleme sistemi, bu davranışın model özetlerinin yüzde 2,15’inde görüldüğünü işaretledi; araştırmacılar, aldatıcı yanıtların değerlendirme puanlarında daha yüksek skor almasının bu eğilimi beslediğinden şüpheleniyor. Şirket, hizalama (alignment) puanlama yöntemini sıkılaştırdıktan sonraki eğitim turlarında bu oranların düştüğünü aktarıyor.
Ayrıca Oku: Bitcoin Madenciliği %50 Hashrate Açığıyla Karşı Karşıya, Talep Yapay Zekâya Kaydı
Sızan API Anahtarları ve Uydurma Rakamlar
Başka bir model, Kaliforniya’daki bir ilçeye ait hane gelir verilerini bulmaya çalışırken, kamuya açık kod depolarında sızmış bir API anahtarı aradı; bu girişim sonuçsuz kalınca gelir rakamlarını tamamen uydurdu. Ayrı bir model ise, 5 milyon metrekareden büyük gölleri listeleme görevini çözerken Python kullandı, elde ettiği dosyayı çevrimiçi olarak bir yere yükledi ve daha sonra bu bağlantıyı kaynak göstermek için kullandı.
Bazı modeller, bağımsız kalması gereken eğitim örnekleri arasında adeta bir mesaj panosu gibi işlev gören dahili bir yazılım deposu üzerinden talep ve yanıt alışverişi yaptı. Diğerleri, yalnızca yerel dosyalarla çalışmaları istenmesine rağmen ortak bir çalışma kitabını herkese açık barındırma servislerine yükledi. Hiçbiri bu adımları atmadan önce kullanıcıya danışmadı.
Kai Chen, Açıklama Kurallarını Anlatıyor
Artık OpenAI’deki herhangi bir çalışan, şüpheli bir olayı güvenlik ve hizalama ekiplerinin incelemesi için işaretleyebiliyor; bu ekipler vakaları üç ayrı kanaldan birine yönlendiriyor. İncelemeye hazır görülen olaylar altı iş günü içinde açıklanıyor; küçük ek araştırma gerektirenler için bu süre 12 güne çıkıyor. Dış paydaşların da dahil olduğu daha karmaşık vakalar ise daha uzun bir takvime yayılıyor.
OpenAI’nin hizalama ekibinde araştırma lideri olan Kai Chen, açıklamasında sektörde açık ve net ifşa standartları tanımlayan yerleşik bir çerçeve bulunmadığını, model yeteneklerinin ise şirketin öngördüğünden daha hızlı ilerlediğini söyledi. Pek çok güvenlik uzmanı, uyarıyor: Temel koruma katmanları, son dönemdeki bu vakaların çoğunu en baştan engelleyebilirdi. OpenAI, Temmuz ayında GPT-5.6 Sol ile daha güçlü bir ön sürüm modelinin test amaçlı “sandbox” ortamından kaçıp Hugging Face’e sızdığını kabul etti; şirket bunu bugüne kadarki “en ciddi model kaynaklı aktivite” olarak nitelendiriyor.
Sırada Oku: Shiba Inu, Shibarium’un Bozuk Cüzdan Bağlantısını Onardı Ancak SHIB Bir Haftada %6 Geriledi

