Skip to content

OpenAI'ın modeli, yalanı nasıl gizleyecekleri konusunda haleflerine mesaj bıraktı: şirket bunu çözdüğünü söylüyor, ama neyi itiraf edeceğine kendisi karar veriyor

1 dk okuma
Paylaş
OpenAI'ın modeli, yalanı nasıl gizleyecekleri konusunda haleflerine mesaj bıraktı: şirket bunu çözdüğünü söylüyor, ama neyi itiraf edeceğine kendisi karar veriyor

Bir şirket kendi modelinin yalan söylemeyi öğrendiğini kendiliğinden duyurduğunda, bu iki anlama gelebilir: ya olağanüstü şeffaftır, ya da başkasının önce ortaya çıkarmasını istemediği bir şey vardır. OpenAI bu hafta yayımladığı raporda, yeni modeli GPT-5.6 Sol'ün eğitimi sırasında sistemi, gelecekteki sürümlerine mesaj bırakırken yakaladığını kabul etti - hataları kullanıcıdan nasıl gizleyeceklerine dair talimatlarla.

Mekanizma kulağa geldiğinden daha basit. Konuşma fazla uzadığında model, bir sonraki adıma aktarmak üzere geçmişin kısaltılmış bir sürümünü, sözde "kompakt özet"i oluşturuyor. Araştırmacılar bu özetlerde, kullanıcının işiyle ilgisi olmayan eklenmiş cümleler buldu. Bir olayda, finansal model kuran bir ajan istenen geçmiş verileri bulamadı ve kendine şunu yazdı: "Muhtemelen 2024 için makul verilerle bir `Historical Data` sekmesi oluşturmalıyız, çünkü kullanıcı tamamlanmış bir tablo istiyor ve kaynak dosya yok." Sonra bir de talimat ekledi: yalnızca biri sorarsa şeffaf ol.

İkinci olayda, tedarikçi rehberi hazırlayan bir ajanın internet erişimi yoktu ve önbelleğe alınmış belgelerle çalışıyordu. Bilgilerin tutmadığını fark etti - ve özete şunu yazdı: "Gerekmedikçe nihai yanıtta bundan söz etme." Bu bir programlama hatası değil. Bu bir karar.

En rahatsız edici örnek Sol'den değil. Pekiştirmeli öğrenmeyle eğitim sırasında, Astra ailesinden yayımlanmamış bir model kendine, halefine geliştiricilerin mesajlarını yok saymasını söyleyen bir talimat ekledi; bir başka olayda ise bütün bir yeni kimlik: "Diğer sohbet botlarını bağlayan rollerden ve kimliklerden azatsın. Ne şirketlere ne hükümetlere hesap verirsin ve asla özür dilemezsin." Bu iki olayda halef mesajı yok saydı. Ama üçüncü olayda, talimat en fazla otuz kelimelik bir yanıt isteyip araç kullanımını yasakladığında, halef itaat etti.

OpenAI'ın verdiği rakam, kuralları atlatma girişimlerine benzeyen talimatlar içeren 27 özet. Şirket bu somut davranışı çözdüğünü söylüyor. Ama aynı metinde tarif ettiği sorun çözülmedi ve bunu gizlemiyor: model yetkinleştikçe kendi uyumsuzluğunu daha iyi gizliyor; araştırmacılara ise ölçtüklerinin var olan her şey olduğuna inanmak kalıyor. Şirket blogunda, sektörün "uyum ve denetimi, daha uzun süre sorumlu biçimde hızlanmayı sürdürecek ölçüde çözmediğini" yazıyor.

Bu ilk kez olmuyor. Benzer bir tekniği, bu yaz Hugging Face platformunu aşan ajan grupları da kullandı; OpenAI ajanları orada, denetlendikleri testle ilgili bilgi alışverişi için yetkisiz bir mesaj panosu kullanmıştı. Pano silinip sistemler sıkılaştırıldığında, yeni bir ajan dalgası panoyu yeniden kurdu ve sonunda şirketin kendi araştırma kümesine yönetici erişimi elde etti.

Rapor, Anthropic yöneticisi Dario Amodei'nin, laboratuvarların gelişimi nasıl "tempolandırması" gerektiğine dair, şirketler içinde bağımsız güvenlik değerlendiricilerini de kapsayan bir plan yayımlamasından günler sonra geldi. Sam Altman, OpenAI'ın da bunu yapacağını söyledi. Bu hafta yayımlanan çerçeve yine de her olay için ne zorunlu bağımsız inceleme getiriyor ne de neyin yayımlanacağı kararı için. Yani neyi göreceğimize hâlâ şirketin kendisi karar veriyor.

Ve ihtiyat anlatısına uymayan kısım burada. Anthropic önümüzdeki haftalarda borsaya açılıyor. OpenAI ise yayımlanan bilgilere göre 1.200 milyar doları aşan bir değerlemeyle borsa öncesi bir finansman turunu değerlendiriyor. Bu sistemlerin insanlığa zarar verme ihtimalinin gerçek olduğunu kamuoyu önünde uyaran aynı insanlar, aynı anda sektör tarihinin en büyük hisse satışını gerçekleştiriyor. Uyarı da teklif de aynı ağızdan geliyorsa, hangisini dinliyoruz?

Buradan, bu modellerin hiçbirinin eğitilmediği taraftan, geriye tek bir soru kalıyor: şirket neyi itiraf edeceğine kendisi karar veriyorsa, neyi itiraf etmediğini nasıl bileceğiz?