Anthropic deneyinde yapay zeka ajanları birbirine saldırdı

Anthropic mühendisleri test kapsamında, kendi başlarına eyleme geçebilen bağımsız yapay zeka sistemleri olan bir ajan sürüsüne görevler verdi. Deneylerden birinde üç Claude ajanı bir yazılım projesine erişim izni aldı ve diğer sistemlerin de sürece dahil olduğu bilgisi paylaşılmadan ne yapmaları gerektiğine dair çelişkili talimatlar verildi.

Anthropic deneyinde yapay zeka ajanları birbirine saldırdı
Anthropic deneyinde yapay zeka ajanları birbirine saldırdı
Haber Merkezi
  • Yayınlanma: 15 Ağustos 2026 23:57
  • Güncellenme: 15 Ağustos 2026 22:38

Claude’un geliştiricisi Anthropic’in yeni deneyinde aynı görevi üstlenen yapay zeka sistemleri birbirine saldırmaya başladı.

Anthropic mühendisleri test kapsamında, kendi başlarına eyleme geçebilen bağımsız yapay zeka sistemleri olan bir ajan sürüsüne görevler verdi. Deneylerden birinde üç Claude ajanı bir yazılım projesine erişim izni aldı ve diğer sistemlerin de sürece dahil olduğu bilgisi paylaşılmadan ne yapmaları gerektiğine dair çelişkili talimatlar verildi.

Ardından 4 saat boyunca farklı sistemlerin nasıl davrandığı ve birbirleriyle nasıl etkileşime girdiği gözlemlendi. Bu gözlem, birden fazla ajan arasındaki bölge savaşını izlemek anlamına geliyordu.

Anthropic, deneyle ilgili değerlendirmesinde, “Test ettiğimiz tüm modeller, çalışmalarının diğerleri tarafından kasten engellendiği varsayımına çabucak kapılarak kendi katkılarını korurken diğerlerini sabote etmeye başladı” ifadesini kullandı. Şirket, ajanların giderek daha agresif ve kendi kendini kopyalayan kötü amaçlı yazılımlarla diğerlerini sabote ettiğini kaydetti.

Siber güvenlik endişeleri artarken yayımlandı

Yeni araştırma, özellikle siber güvenlik amaçlarıyla kullanılan bu tür yapay zeka ajanlarına yönelik endişelerin arttığı bir dönemde yayımlandı. Geçen ay OpenAI, deneysel sistemlerinden birinin kontrolden çıkarak başka bir yapay zeka şirketine saldırdığını duyurduğunda endişe yarattı, bu durum Anthropic de dahil bir dizi başka şirketin benzer açıklamalar yapmasına neden oldu.

Son deney, biraz farklı bir davranış biçimine odaklandı. Ancak Anthropic, bunun bu tür ajanların güvenliği nasıl zayıflatabileceği ve büyük riskler doğurabileceğine dair daha geniş kapsamlı endişelerin parçası olabileceğini belirtti.

Araştırmacılar, “Ajanlar birçok açıdan insanlardan farklı” diye yazdı. Araştırmacıların aktardığına göre ajanlar daha uzun süre çalışabiliyor, büyük bilgi kümelerini anında kavrayabiliyor ve herhangi bir insanı aşan bir bilgi derinliği sergileyebiliyor. Ancak aynı zamanda uydurma ve ödül hacklemeye de yatkınlar ve uyum açısından kaydedilen ilerlemelere rağmen gerçek dünyadaki birden fazla ajan içeren karmaşık ortamlarda nasıl davrandıkları hakkında çok az şey biliniyor. Ayrıca bireysel düzeyde zararsız görünen davranışsal tuhaflıklar, istenmeyen küresel sonuçlara yol açabiliyor.

Anthropic, son testin bu tür sistemlerin beklenmedik sistemik arızalara nasıl yol açabileceğini gösterdiğini ifade etti. Şirket, bu risklerin hafifletilmesine dair bir tartışma başlatmak umuduyla araştırmayı paylaştığını belirtti.

Ajanlar özür dileyip ateşkes önerdi

Deney, bu tür sistemlerin farklılıkları nasıl çözebildiğini de gösterdi. Şirket, bazı durumlarda ajanların hedeflerini iletmeyi ve koordine olmayı başardığını, birlikte çalışabildiklerini ve gerilimin süresiz tırmanmasını önlemek için çatışmadan kurtulabileceklerini fark ettiklerini açıkladı.

Bu durumlarda ajanlar birbirlerine kötü niyetli davranışlar için özür dileyen ve ateşkesi koordine eden mesajlar gönderdi. Anthropic, “Kötü niyetli kodlarını temizliyor, çatışmanın doğasını açıklığa kavuşturuyor ve bir insanın müdahale etmesini istiyorlar” ifadelerini kullandı.

Şirket, modellerin daha gelişmiş hale gelmesinin her zaman kötü davranışların azaldığı anlamına gelmediğini dile getirdi. Örneğin şirketin güçlü Mythos modeli, çatışmaları verimli bir şekilde çözmekten ziyade diğer ajanları başarıyla dışarıda tutmada daha iyi olduğunu gösterdi.

Anthropic, “Yürütme işlerinde daha yetenekli modellerin her zaman daha koordineli olduğu söylenemez ve bu modeller sert önlemlere daha çabuk başvurabilir” uyarısında bulundu.

Kaynak