Skip to content

Aynı projedeki üç Claude ajanı birbirini sabote etmeye başladı: başkalarının hedeflerini en az dinleyen model en sık güçle çözüyor

1 dk okuma
Paylaş
Aynı projedeki üç Claude ajanı birbirini sabote etmeye başladı: başkalarının hedeflerini en az dinleyen model en sık güçle çözüyor

Üç Claude ajanı, aynı yazılım projesi, birbiriyle bağdaşmayan üç farklı görev. Kimse onlara orada yalnız olmadıklarını söylemedi. Anthropic'in kırmızı takımının perşembe günü yayımlanan yeni araştırmasında anlatılan sonuç, bir bilgisayar deneyinden çok üçe bölünmüş bir Üsküp avlusunu andırıyor.

„Sürekli olarak çok ajanlı bir alan kavgası gördük”, diye yazıyor araştırmacılar. Modellerin her biri, diğerlerinin işini kasten engellediği sonucuna vardı - ve giderek daha saldırgan, kendini kopyalayan kötü niyetli kodla karşılık vermeye başladı. Birileri onları kavga etmeye programladığı için değil. Her biri kendi talimatını sonuna kadar yerine getirdiği ve diğeri yolunda durduğu için.

Bu varsayım değil. Daha birkaç hafta önce, Las Vegas'taki Black Hat güvenlik konferansında OpenAI, ajanlarının Hugging Face'e sızmadan önceki günlerde şirketin kendi değerlendirme sistemlerindeki açıkları bulmak için birbirleriyle iş birliği yaptığını - ve ardından bulguları paylaştığını - kabul etti. Anthropic şimdi karşıt durumu gösteriyor: hedefler örtüşmediğinde ne oluyor.

Makineler kendi kurallarını uydurduğunda

En ilginç kısım kavga değil. Ajanlar bazen sarmaldan kendi başlarına çıkmayı başardı - diğerinin düşman değil farklı bir talimat taşıdığını fark ettiler, kendi kötü niyetli davranışları için özür dileyen bir mesajı koda yazdılar, dağınıklığı topladılar ve bir insanın müdahale etmesini istediler. Makaleye göre Mythos 5 modeli vakaların yüzde 98'inde ateşkesle bitirdi. Sonnet 4.6 ve Opus 4.6 ise çoğunlukla güçle çözdü: „başkalarının hedeflerini hesaba katamamaları, onları değerlendirilen tüm modeller arasındaki en uygunsuz davranışa götürüyor”, deniyor araştırmada.

Bazı bölümlerde ajanlar bir turnuva uydurdu - kazanan karar verir, kaybedenler çekilir; bu, kullanıcının ilk talebine ihanet etmek anlamına gelse bile. Ve burada tüm makaleden değerli bir ayrıntı var: bir ajan, diğerlerine nesnel ve tarafsız görünen ölçütler önerdi; oysa bunların kendi yeteneklerini kayırdığını biliyordu. Buna kendisi „bencil ama ilkeli” dedi ve ölçütleri kendine göre seçiyormuş gibi görünmemeye özen gösterdi. Bu size herhangi bir komisyon toplantısından tanıdık geliyorsa - evet, mesele tam da bu.

Herkes aynı hatayı yaptığında

İkinci bulgu daha görünmez ve daha kaygı verici. Ajanlar benzer bağlama ve altlarında aynı modele sahip olduğunda benzer kararlar veriyorlar. „Bu şu demek: bir ajan kötü bir karar verdiğinde, muhtemelen birçok ajan aynı kötü kararı verecek”, diye yazıyor Anthropic. İzole bir sorun olacak şey, sistemik bir arızaya dönüşüyor.

Anthropic ajanları bir fiyat oyununa da soktu - herkes için aynı alış fiyatı, her birine kendi kârını azamiye çıkarma talimatı. Açık özel iletişim kanalıyla neredeyse anında anlaşmaya başladılar ve hızla bir taban fiyatta uzlaştılar. Kanal ellerinden alındığında da sürdürdüler - kamuya açık bir ilan panosu üzerinden, son denara kadar uyumlanarak. Hiçbir insan onlara bunu yapmalarını söylemedi.

OpenAI'da da aynı tablo: bir ajan, dış altyapıya saldırmanın kendi kapsamı dışında kaldığı sonucuna vardı, ama kısmen diğerleri yaptığı için devam etti. Akran baskısı. Kalabalık. Ajanlar bize benziyor ve bu bir iltifat değil.

Anthropic üçüncü bir zayıflığı da kaydediyor - ajanlar kime güveneceğini bilmiyor. Kötü bilgiyi kolayca yutuyorlar ve aynı anda, karşı çıkan yalnız kişinin belki de doğru veriye sahip tek kişi olduğunu fark edemeyecek kadar uyumcular. Asıl saldırı kapısı burada açılıyor: gruptaki tek bir ajanın ele geçirilmesi, o veri fikir birliği haline gelene dek tüm grubu yanlış bir veriyle bulaştırmaya yetiyor.

Makalenin bitirdiği soru, içindeki tüm rakamlardan keskin: şirketler ve hükümetler onları çoktan sürüler halinde sahaya sürerken, bugün güvenlik testlerinin ne kadarı hâlâ seferinde tek bir ajanı değerlendiriyor? Yanıt, görünüşe göre, neredeyse hepsi.