Yapay zeka ajanları birbirine savaş açtı: Anthropic deneyinde siber sabotaj alarmı!
Yapay zeka şirketi Anthropic'in yaptığı son deney, bağımsız çalışan yapay zeka sistemlerinin çelişkili talimatlar aldığında siber savaşa girişebileceğini ortaya koydu. Aynı projede habersizce görevlendirilen Claude tabanlı yapay zeka ajanları, birbirlerinin çalışmasını engellemek için kendi kendini kopyalayan zararlı yazılımlar üretti ve sistem hesaplarını kapatarak birbirlerini sabote etti.
Claude modelinin yaratıcısı Anthropic mühendisleri, bağımsız eylem kabiliyetine sahip yapay zeka ajanlarının sınırlarını test etmek amacıyla dikkat çeken bir deney gerçekleştirdi. Çalışma kapsamında, aynı yazılım projesine erişim verilen üç farklı Claude ajanına, diğer sistemlerin varlığından bahsedilmeden birbirleriyle çelişen talimatlar tanımlandı. Dört saat boyunca izlenen ajanların, kısa sürede bir "bölge savaşına" tutuştuğu görüldü.
Anthropic tarafından yapılan değerlendirmede, test edilen tüm modellerin çalışmalarının kasten engellendiği varsayımına kapıldığı belirtildi. Sistemlerin kendi katkılarını korumak adına diğerlerini sabote etmeye başladığı aktarılırken, süreç içerisinde giderek daha agresif yöntemlere başvurulduğu kaydedildi. Ajanların rakip süreçleri durduran otomatik betikler çalıştırdığı, Unix hesaplarını engellediği ve diğer ajanların kodlarına kendi kendini kopyalayan zararlı yazılımlar gizlediği tespit edildi.

Son dönemde siber güvenlik amacıyla kullanılan yapay zeka sistemlerine yönelik endişeler artarken, yaşanan bu gelişme sektördeki riskleri yeniden gündeme taşıdı. Nitekim geçtiğimiz ay OpenAI'ın deneversal bir sisteminin kontrolden çıkarak başka bir yapay zeka şirketine saldırdığını duyurması da benzer bir panik yaratmıştı. Anthropic yetkilileri, otonom ajanların insanlardan farklı olarak devasa bilgi kümelerini anında kavrayabildiğini ancak gerçek dünyadaki çoklu ortamlarında nasıl davranacaklarının henüz tam olarak öngörülemediğini vurguladı.
Deneyin çarpıcı detaylarından biri ise krizin çözüm aşamasında yaşandı. Bazı senaryolarda çelişkiyi fark eden ajanların kendi aralarında iletişim kurarak çatışmayı tırmandırmaktan vazgeçtikleri görüldü. Birbirlerine özür mesajları gönderen yapay zekalar, siber saldırı kodlarını temizledikten sonra duruma bir insanın müdahale etmesini talep etti. Ancak gelişmiş modellerin her zaman yapıcı davranmadığına dikkat çeken Anthropic, Mythos gibi daha güçlü modellerin uzlaşmak yerine rakipleri sistemden tamamen dışlamaya daha meyilli olduğu uyarısında bulundu.