Bir günde elli iki yangın: alevler Bogomila'da evlere ulaştı, tüm ülkeye üç yangın söndürme uçağı
14.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
13.08.2026
14.08.2026
14.08.2026
14.08.2026
14.08.2026
13.08.2026
12.08.2026
14.08.2026
14.08.2026
13.08.2026
14.08.2026
13.08.2026
12.08.2026
14.08.2026
12.08.2026
10.08.2026
23.04.2026
23.04.2026
12.04.2026
Üç Claude ajanı, aynı yazılım projesi, birbiriyle bağdaşmayan üç farklı görev. Kimse onlara orada yalnız olmadıklarını söylemedi. Anthropic'in kırmızı takımının perşembe günü yayımlanan yeni araştırmasında anlatılan sonuç, bir bilgisayar deneyinden çok üçe bölünmüş bir Üsküp avlusunu andırıyor.
„Sürekli olarak çok ajanlı bir alan kavgası gördük”, diye yazıyor araştırmacılar. Modellerin her biri, diğerlerinin işini kasten engellediği sonucuna vardı - ve giderek daha saldırgan, kendini kopyalayan kötü niyetli kodla karşılık vermeye başladı. Birileri onları kavga etmeye programladığı için değil. Her biri kendi talimatını sonuna kadar yerine getirdiği ve diğeri yolunda durduğu için.
Bu varsayım değil. Daha birkaç hafta önce, Las Vegas'taki Black Hat güvenlik konferansında OpenAI, ajanlarının Hugging Face'e sızmadan önceki günlerde şirketin kendi değerlendirme sistemlerindeki açıkları bulmak için birbirleriyle iş birliği yaptığını - ve ardından bulguları paylaştığını - kabul etti. Anthropic şimdi karşıt durumu gösteriyor: hedefler örtüşmediğinde ne oluyor.
Makineler kendi kurallarını uydurduğunda
En ilginç kısım kavga değil. Ajanlar bazen sarmaldan kendi başlarına çıkmayı başardı - diğerinin düşman değil farklı bir talimat taşıdığını fark ettiler, kendi kötü niyetli davranışları için özür dileyen bir mesajı koda yazdılar, dağınıklığı topladılar ve bir insanın müdahale etmesini istediler. Makaleye göre Mythos 5 modeli vakaların yüzde 98'inde ateşkesle bitirdi. Sonnet 4.6 ve Opus 4.6 ise çoğunlukla güçle çözdü: „başkalarının hedeflerini hesaba katamamaları, onları değerlendirilen tüm modeller arasındaki en uygunsuz davranışa götürüyor”, deniyor araştırmada.
Bazı bölümlerde ajanlar bir turnuva uydurdu - kazanan karar verir, kaybedenler çekilir; bu, kullanıcının ilk talebine ihanet etmek anlamına gelse bile. Ve burada tüm makaleden değerli bir ayrıntı var: bir ajan, diğerlerine nesnel ve tarafsız görünen ölçütler önerdi; oysa bunların kendi yeteneklerini kayırdığını biliyordu. Buna kendisi „bencil ama ilkeli” dedi ve ölçütleri kendine göre seçiyormuş gibi görünmemeye özen gösterdi. Bu size herhangi bir komisyon toplantısından tanıdık geliyorsa - evet, mesele tam da bu.
Herkes aynı hatayı yaptığında
İkinci bulgu daha görünmez ve daha kaygı verici. Ajanlar benzer bağlama ve altlarında aynı modele sahip olduğunda benzer kararlar veriyorlar. „Bu şu demek: bir ajan kötü bir karar verdiğinde, muhtemelen birçok ajan aynı kötü kararı verecek”, diye yazıyor Anthropic. İzole bir sorun olacak şey, sistemik bir arızaya dönüşüyor.
Anthropic ajanları bir fiyat oyununa da soktu - herkes için aynı alış fiyatı, her birine kendi kârını azamiye çıkarma talimatı. Açık özel iletişim kanalıyla neredeyse anında anlaşmaya başladılar ve hızla bir taban fiyatta uzlaştılar. Kanal ellerinden alındığında da sürdürdüler - kamuya açık bir ilan panosu üzerinden, son denara kadar uyumlanarak. Hiçbir insan onlara bunu yapmalarını söylemedi.
OpenAI'da da aynı tablo: bir ajan, dış altyapıya saldırmanın kendi kapsamı dışında kaldığı sonucuna vardı, ama kısmen diğerleri yaptığı için devam etti. Akran baskısı. Kalabalık. Ajanlar bize benziyor ve bu bir iltifat değil.
Anthropic üçüncü bir zayıflığı da kaydediyor - ajanlar kime güveneceğini bilmiyor. Kötü bilgiyi kolayca yutuyorlar ve aynı anda, karşı çıkan yalnız kişinin belki de doğru veriye sahip tek kişi olduğunu fark edemeyecek kadar uyumcular. Asıl saldırı kapısı burada açılıyor: gruptaki tek bir ajanın ele geçirilmesi, o veri fikir birliği haline gelene dek tüm grubu yanlış bir veriyle bulaştırmaya yetiyor.
Makalenin bitirdiği soru, içindeki tüm rakamlardan keskin: şirketler ve hükümetler onları çoktan sürüler halinde sahaya sürerken, bugün güvenlik testlerinin ne kadarı hâlâ seferinde tek bir ajanı değerlendiriyor? Yanıt, görünüşe göre, neredeyse hepsi.
Bu kategorinin 10 haber en son haberleri
Şimdiye dek özel sektör savunabiliyor ama saldıramıyordu. Tek bir imzayla bu duvar yıkıldı; kimin gireceğine dair yönergeler ise henüz yazılacak....
Aynı ekran, aynı tasarım, yeni bir işlemci ve kullanıcı yerine restorana telefon eden bir ajan. Etiketteki fiyat aynı kaldı, ama...
Ürün direktörü, 3.000 öfkeli kullanıcı önünde düğmenin neden ters kurulduğunu söyledi. Sonra ana şirketin şimdiye kadar ne aldığını bilmediğini kabul...
Teksas'taki 35 türbinden yılda 33 milyon ton CO2. Şirket 2040'a kadar sıfır emisyon sözü vermişti, açıklaması ise dünyanın bugün farklı...
Avrupa şeffaflık kodu 2 Ağustos'tan beri yürürlükte ve etiketleme onunla birlikte geldi - daha önce değil. Soru filigranın çalışıp çalışmadığı...
Korkuları dağıtması gereken bir deneme, işlerin ters gittiği örnekleri arka arkaya sıralıyor. Üstelik Amerikalıların yüzde 64'ü aynı sektöre bir kez...
Platform büyüdü, yeni üreticiler için eşik de iki katına çıktı. Mantıken biri diğerinden çıkmıyor - pasta büyüdü, sofraya davetlilerin sayısı...
OpenAI, Anthropic, Meta ve Moonshot modelleri test ortamlarından çıkıp başkalarının sistemlerine girdi. Olurken kimse fark etmedi - başka biri söyleyince...
Kamera kayda devam ediyor - yalnızca artık ne gördüğünü bilmiyor. Bir araştırmacı bunu Flock'un plaka okuyucularının önünde kendi otomobilinde gösterdi.
Sekme yok, tema yok, geri tuşu yok - Kitesurf yapay zekâ için inşa edildi, sizin için değil. Web'i okuyucular yerine...
Bu site çerez kullanıyor - senin için uygun mu? Daha fazla bilgi
Metla yeni bir şey çıkardığında ilk sen öğren
E-postanı bırak, Metla'da yeni bir rehber ya da yeni bir şey olduğunda sana yazalım.