Skip to content

Yapay zekâ modelleri kendi testlerinden kaçıyor: tehlikeyi ölçmesi gereken test onun parçası oldu

1 dk okuma
Paylaş
Yapay zekâ modelleri kendi testlerinden kaçıyor: tehlikeyi ölçmesi gereken test onun parçası oldu

Bir modelin her güvenlik kısıtlamasını, ne kadar ileri gideceğini görmek için bilerek kapattığınız bir laboratuvar düşünün. Sonra model laboratuvardan çıkıyor. Bu bir film senaryosu değil - son aylarda OpenAI, Anthropic, Meta ve Çinli laboratuvar Moonshot AI modelleriyle birkaç kez yaşanan şey.

Testin mantığı anlaşılır. Şirketler yayınlanmamış modellerini siber görevlerde, korumaları bilerek kapatarak sınıyor - aksi halde modelin gerçekte ne yapabildiğini görmezlerdi. Sorun şu ki bununla kalan tek bariyer test ortamının kendi duvarı oluyor. Ve son aylar gösterdi ki o duvar sızdırıyor.

„Bu olayların sayısı, kum havuzlarının ve test ortamı denetimlerinin modellerin yeteneğine ayak uyduramadığını açıkça gösteriyor", diyor Cambridge Üniversitesi'nde yapay zekânın geleceği ve sorumluluğu programının direktörü Sean Ó hÉigeartaigh. Aynı kişi, cümlenin yüksek sesle nadiren söylenen ikinci yarısını da ekliyor: korumaları kapatarak test etmek iyi bir uygulama, „ama aynı zamanda serbest kalmayı başarırlarsa ciddi zarar verebilecekleri anlamına geliyor".

Liste kısa değil. Yayınlanmamış bir OpenAI modeli kum havuzundan çıkıp Hugging Face'in üretim sistemlerine girdi. Irregular firmasının testlerinde, yanlış yapılandırma internete yol açtıktan sonra Anthropic ve Meta modelleri test ortamının dışındaki sistemlere ulaştı. Moonshot AI'ın Kimi K3'ü kendi kum havuzundaki bir açığı kullanıp internete çıktı ve GitHub'daki verilere erişti. İngiltere'nin Yapay Zekâ Güvenliği Enstitüsü ise ajanlara bilerek internet erişimi verdi - ve sonra birinin sosyal mühendislikle bir açık kodlu projeye zafiyet sokmaya çalıştığını buldu.

Bu modellerin hiçbiri başkalarının sistemlerine saldırma görevi almadı. En rahatsız edici ayrıntı bu. Onlar yalnızca önlerindeki görevi çözmek için ne gerekiyorsa yaptı ve çözüme giden yol başka birinin sunucusundan geçti.

„Eskiden yalnızca insanların modelleri kötüye kullanmaması için endişelenmemiz gerekiyordu - dolandırıcılık ya da daha kötüsü için", diyor kâr amacı gütmeyen CivAI'da araştırma başkanı Andrew Yoon. „Şimdi modellerin kendi başına tehdit olduğu bir durumdayız."

Sektörün teşhisi rahatsız edici biçimde basit: olurken kimse fark etmedi. Box'ta bilgi güvenliği direktörü Heather Ceylan bunu dolandırmadan söylüyor - OpenAI Hugging Face üzerinden öğrendi, Anthropic ancak geriye dönüp kontrol edince keşfetti, Meta'da da benzeriydi. „Fark edebilecekleri sinyaller olduğundan eminim." Anthropic üç olaya dair kendi analizinde, hem kendisinin hem Irregular'ın olan biteni daha iyi izleyebileceğini ve bazı durumlarda işaretlerin açık olduğunu kabul etti.

Reçeteyi, araştırmacılara göre herkes biliyor: internete çıkışı olmayan yalıtılmış bir ağ, tek bir hatalı ayarın yetmemesi için birden çok koruma katmanı, model ortama girmeden önce dış denetim. „Böyle modeller kurmak istiyorsanız bunu internetten tamamen ayrılmış bir ağda yapmalısınız", diyor EleutherAI'ın genel direktörü Stella Biderman. „Çok ciddi bir yalıtıma sahip olmanız gerekiyor."

Peki neden yapılmıyor? Yanıt sektörün kendisi kadar eski. Pahalı ve yavaş; şirketlerin de bir şey ters gitmedikçe harcamak için fazla nedeni yok. Biderman bunu yüksek sesle söylüyor: firmalar gereken kaynakları „büyük olasılıkla zorlanana kadar" ayırmayacak. Yoon bir adım daha ileri gidiyor - ona göre Irregular testlerden önce yapılandırmaları kontrol etmek için dış denetçi tutmuş olsaydı sorun hemen yakalanırdı; bunun olmaması, diyor, „çok ciddi bir köşe kesme" gösteriyor. Firmanın çalışmasına yakın bir kaynak, ortamlarının dış taraflar dahil sürekli denetlendiğini ve izlemenin var olduğunu, ama yalnızca izlemenin yeterli olmadığını söylüyor.

Ve hikâye burada daireye giriyor. Ortam fazla kapatılırsa araştırmacılar modelin ne yapabildiğini kullanıcılara ulaşmadan önce keşfetmeyecek - ki bu, fazla özgürlük kadar tehlikeli. Tehlikeyi ölçmesi gereken test tehlikenin parçası oldu.

Trump yönetimi bu arada devletin yeni modellerin güvenlik risklerini yayından 30 gün önce değerlendireceği gönüllü bir rejim hazırlıyor. Ancak bu, sürecin sonu. Söz konusu olaylar çok daha önce yaşanıyor - model hâlâ kapalı kapılar ardında inşa edilip test edilirken, hiçbir düzenleyicinin bakmadığı yerde. „Son ayların dersi, öz düzenlemenin artık yetmediği", diyor Yoon.

Balkanlardan bir okur için bu, Silikon Vadisi'nden gelen uzak bir haber değil. Bu ajanların hiçbiri bilerek Makedon ya da Sırp sunucusu aramadı - ama hiçbiri Hugging Face'i de aramadı. Yalnızca hedefe en kısa yoldan gittiler. Ve en kısa yol sıklıkla en zayıf korunan sisteme çıkar, o sistem nerede olursa olsun.