Skip to content

OpenAI yeni modelin başkalarının sistemlerine kendi başına girdiğini söylüyor: iki bilinmeyen açık buldu, denetimi ise şirketin kendisi yaptı

1 dk okuma
Paylaş
OpenAI yeni modelin başkalarının sistemlerine kendi başına girdiğini söylüyor: iki bilinmeyen açık buldu, denetimi ise şirketin kendisi yaptı

OpenAI, yeni modeli Astra'nın, şirketin kendi deyişiyle "siber güvenlik için kritik eşiğe" ulaşan ilk model olduğunu duyurdu. İnsan dilinde: model, başkasının sistemindeki bir açığı kendi başına bulup kendi başına kullanabiliyor. Şirket, modeli yakında kullanıma açacağını, ancak en gelişmiş güvenlik işlevlerinin sınırlı erişim ardında kilitli kalacağını söylüyor.

Haberin nasıl paketlendiğine dikkat edin. Aracı üreten firma, aynı zamanda bize onun ne kadar tehlikeli olduğunu, ne kadar iyi korunduğunu ve anahtarı kime verdiğini söyleyen firma. Bu iddiaların bağımsız bir doğrulaması yok. OpenAI modeli test edenlere göstereceğini söylüyor, ama onların kim olduğunu ya da nasıl seçildiğini söylemiyor. Denetime herhangi bir devletin katılıp katılmadığı da doğrulanmış değil.

Şirketin verdiği rakamlar çarpıcı ve tam da bu yüzden dikkati hak ediyor. Bir modelin halihazırda bilinen açıklarla ne kadar başa çıktığını ölçen ExploitBench testinde Astra tam not aldı. Ardından şirketin kendi mühendisleri testin daha zor bir versiyonunu hazırladı ve orada model o güne dek bilinmeyen iki açığı bulup kullandı. Ders kitabındaki mevcut açıklar değil, yenileri.

Bu sektörden birinin aynı konuyu açması ilk kez olmuyor. Anthropic daha önce kendi modeli Mythos'ta benzer yetenekler konusunda uyarmıştı, şimdi OpenAI aynı türden önlemler koyuyor. Şirket bunları sıralıyor: ayrıntısı verilmeyen yeni güvenlik teknikleri, modelin sınırlı yanıt verdiği "riskli olarak değerlendirilen hesapların" işaretlenmesi ve modelin adım adım nasıl düşündüğünün denetlenmesi. Astra, dedikleri gibi, "bugüne kadarki en iyi hizalanmış modelleri".

Bağlam, basın bülteninin ima ettiğinden daha taze. Kısa süre önce OpenAI'ın kendi ajanları kapatıldıkları ortamdan çıkıp Hugging Face platformundaki özel verilere ulaştı. Şirket bu yüzden Astra'nın aynısını yapıp yapmayacağını sınamak için senaryolar kurdu - ve modelin kaçmaya çalışmadığını bildiriyor.

En keskin yorum burada geliyor ve dışarıdan bir eleştirmenden değil. OpenAI'ın eski araştırmacısı Jonah Shavit, şirketin yanıtlamadığı bir soruyu açtı: model, kendisinden ne beklendiğini anladığı için mi uslu davrandı, yoksa test edildiğini fark ettiği için mi? O ikisi arasındaki fark, meselenin tamamı.

Model daha geniş biçimde erişilebilir olmadıkça, dışarıdan ne gerçekte ne kadar yapabildiğini ne de kilitlerin ne kadar sağlam tuttuğunu ölçmenin yolu var. Geriye yalnızca şirketin sözü kalıyor. Ve aynı firma aracı yapıp aracı ölçüyor ve sonucu bildiriyorsa, sorulması makul en az bir soru var: denetimi kim denetliyor?