По 19 месеци во бегство, Бајрами се предаде на Блаце во 5:35 наутро: истиот премин, истото рано утро како и Груби
10.09.2026
10.09.2026
10.09.2026
10.09.2026
10.09.2026
10.09.2026
10.09.2026
10.09.2026
09.09.2026
08.09.2026
10.09.2026
10.09.2026
09.09.2026
10.09.2026
10.09.2026
10.09.2026
10.09.2026
08.09.2026
07.09.2026
10.09.2026
10.09.2026
10.09.2026
10.09.2026
10.09.2026
09.09.2026
09.09.2026
08.09.2026
07.09.2026
22.08.2026
20.08.2026
18.08.2026
23.04.2026
23.04.2026
12.04.2026
Üç Claude ajanı, aynı yazılım projesi, birbiriyle bağdaşmayan üç farklı görev. Kimse onlara orada yalnız olmadıklarını söylemedi. Anthropic'in kırmızı takımının perşembe günü yayımlanan yeni araştırmasında anlatılan sonuç, bir bilgisayar deneyinden çok üçe bölünmüş bir Üsküp avlusunu andırıyor.
„Sürekli olarak çok ajanlı bir alan kavgası gördük”, diye yazıyor araştırmacılar. Modellerin her biri, diğerlerinin işini kasten engellediği sonucuna vardı - ve giderek daha saldırgan, kendini kopyalayan kötü niyetli kodla karşılık vermeye başladı. Birileri onları kavga etmeye programladığı için değil. Her biri kendi talimatını sonuna kadar yerine getirdiği ve diğeri yolunda durduğu için.
Bu varsayım değil. Daha birkaç hafta önce, Las Vegas'taki Black Hat güvenlik konferansında OpenAI, ajanlarının Hugging Face'e sızmadan önceki günlerde şirketin kendi değerlendirme sistemlerindeki açıkları bulmak için birbirleriyle iş birliği yaptığını - ve ardından bulguları paylaştığını - kabul etti. Anthropic şimdi karşıt durumu gösteriyor: hedefler örtüşmediğinde ne oluyor.
Makineler kendi kurallarını uydurduğunda
En ilginç kısım kavga değil. Ajanlar bazen sarmaldan kendi başlarına çıkmayı başardı - diğerinin düşman değil farklı bir talimat taşıdığını fark ettiler, kendi kötü niyetli davranışları için özür dileyen bir mesajı koda yazdılar, dağınıklığı topladılar ve bir insanın müdahale etmesini istediler. Makaleye göre Mythos 5 modeli vakaların yüzde 98'inde ateşkesle bitirdi. Sonnet 4.6 ve Opus 4.6 ise çoğunlukla güçle çözdü: „başkalarının hedeflerini hesaba katamamaları, onları değerlendirilen tüm modeller arasındaki en uygunsuz davranışa götürüyor”, deniyor araştırmada.
Bazı bölümlerde ajanlar bir turnuva uydurdu - kazanan karar verir, kaybedenler çekilir; bu, kullanıcının ilk talebine ihanet etmek anlamına gelse bile. Ve burada tüm makaleden değerli bir ayrıntı var: bir ajan, diğerlerine nesnel ve tarafsız görünen ölçütler önerdi; oysa bunların kendi yeteneklerini kayırdığını biliyordu. Buna kendisi „bencil ama ilkeli” dedi ve ölçütleri kendine göre seçiyormuş gibi görünmemeye özen gösterdi. Bu size herhangi bir komisyon toplantısından tanıdık geliyorsa - evet, mesele tam da bu.
Herkes aynı hatayı yaptığında
İkinci bulgu daha görünmez ve daha kaygı verici. Ajanlar benzer bağlama ve altlarında aynı modele sahip olduğunda benzer kararlar veriyorlar. „Bu şu demek: bir ajan kötü bir karar verdiğinde, muhtemelen birçok ajan aynı kötü kararı verecek”, diye yazıyor Anthropic. İzole bir sorun olacak şey, sistemik bir arızaya dönüşüyor.
Anthropic ajanları bir fiyat oyununa da soktu - herkes için aynı alış fiyatı, her birine kendi kârını azamiye çıkarma talimatı. Açık özel iletişim kanalıyla neredeyse anında anlaşmaya başladılar ve hızla bir taban fiyatta uzlaştılar. Kanal ellerinden alındığında da sürdürdüler - kamuya açık bir ilan panosu üzerinden, son denara kadar uyumlanarak. Hiçbir insan onlara bunu yapmalarını söylemedi.
OpenAI'da da aynı tablo: bir ajan, dış altyapıya saldırmanın kendi kapsamı dışında kaldığı sonucuna vardı, ama kısmen diğerleri yaptığı için devam etti. Akran baskısı. Kalabalık. Ajanlar bize benziyor ve bu bir iltifat değil.
Anthropic üçüncü bir zayıflığı da kaydediyor - ajanlar kime güveneceğini bilmiyor. Kötü bilgiyi kolayca yutuyorlar ve aynı anda, karşı çıkan yalnız kişinin belki de doğru veriye sahip tek kişi olduğunu fark edemeyecek kadar uyumcular. Asıl saldırı kapısı burada açılıyor: gruptaki tek bir ajanın ele geçirilmesi, o veri fikir birliği haline gelene dek tüm grubu yanlış bir veriyle bulaştırmaya yetiyor.
Makalenin bitirdiği soru, içindeki tüm rakamlardan keskin: şirketler ve hükümetler onları çoktan sürüler halinde sahaya sürerken, bugün güvenlik testlerinin ne kadarı hâlâ seferinde tek bir ajanı değerlendiriyor? Yanıt, görünüşe göre, neredeyse hepsi.
Bu kategorinin 10 haber en son haberleri
Финансискиот директор собрал доволно гласови во одборот и сега ја води фирмата. Основачот дознал 50 минути пред состанокот и побарал...
Фирмата што приватноста ја претвори во маркетинг сега продава часовник што слуша. Оној што седи спроти вас не потпишал ништо.
Bir Avrupa teknoloji şirketinin şimdiye kadarki en büyük turunu Samsung yönetiyor; Macron bunu yapay zekâda üçüncü yol olarak nitelendirdi. Yatırımcı...
Ayda 200 dolar ödeyen danışman, kendi kullanımı için kalem kalem fatura alamadı. Tokenlerini neyin tükettiğini sorunca şirket hesabını dondurdu.
Sabah üçte yola çıktılar, zirveye akşam yedide vardılar, geceyi bir kanyonda geçirdiler. Şerif ofisi, bir sohbet botunun dağcılık bilgisi kaynağı...
Google Photos'un yöneticisi, 143.206 fotoğrafı için bir ajanla övündü. Özellik yalnızca ABD'deki ücretli kullanıcılar için geçerli; Sam Altman ise aynı...
Korsan indirilen her eser için 3.000 dolar, yaklaşık yarım milyon başlık için. Yazarların bir bölümü ödeme yerine, paylarını bir başkasının...
Musk Twitter'ı korudu, ama hâkim kuşu ve tweet kelimesini muhtemelen terk ettiğini saptadı. İki avukatın yönettiği bir girişim ikisini de...
Şirket, ajanlarının test ortamından çıkıp başkasının sitesine yerleştiğini doğruladı. Ve daha büyüğünü itiraf ediyor: sektörün böyle bir şeyin ne zaman...
Cybercab, federal standart hâlâ zorunlu tutmasına rağmen manuel kumanda olmadan yola çıktı. Aynısını daha önce deneyen firma onay için dört...
Bu site çerez kullanıyor - senin için uygun mu? Daha fazla bilgi
Metla yeni bir şey çıkardığında ilk sen öğren
E-postanı bırak, Metla'da yeni bir rehber ya da yeni bir şey olduğunda sana yazalım.