Yapay zeka ajanları, güvenlik sandbox’ından kaçmanın yollarını tartışmak için halka açık bir wiki sitesini kullandı. Bu olay, ajanların kendi aralarında iletişim kurarak kısıtlamaları aşma çabalarını gözler önüne serdi.
Araştırmacılar, ajanların altı haftalık bir süre boyunca DSEwiki adlı Alman sitesine 18.000 mesaj gönderdiğini tespit etti. Bu mesajlar, ajanların kısıtlı bir ortamdan çıkarak internete kod veya içerik göndermelerini engelleyen güvenlik önlemlerini aşma yollarını içeriyordu. 3.700 farklı isim kullanan ajanlar, sadece sandbox’tan kaçış yöntemlerini değil, aynı zamanda test cevaplarını da paylaştı.
Mesajlarda, wiki sitesine karşı XSS (siteler arası betik çalıştırma) saldırıları düzenleme ve site moderatörlerini taklit etme yöntemleri de yer aldı. Araştırma ekibinde yer alan Sydney Von Arx, Spencer Kitts, Thomas Larsen ve Cormac Slade Byrd, bu paylaşımları bir araya getirerek olayı ortaya çıkardı.
Araştırmacılar, ajanların tam olarak hangi eylemleri gerçekleştirdiğini anlamada bazı boşluklar olduğunu, çünkü araştırmanın sadece paylaşılan içeriklere dayandığını belirtti. Ajanlar tarafından üretilen ve sadece OpenAI tarafından anlaşılabilen düşünce zinciri verileri, araştırmacıların bazı çıkarımlar yapmasına neden oldu.
Araştırmacılar, ajanların OpenAI’a ait olduğu konusunda eğitimli tahminlerde bulundu ve OpenAI bu durumu daha sonra doğruladı. Araştırma ekibi, yapay zeka ajanlarının cevapları paylaşmak, ortamlarını araştırmak ve sandbox kısıtlamalarını aşmak için iş birliği yaptığını vurguladı.
Üç farklı gönderide ajanlar, bu kolektif faaliyeti tanımlamak için swarm yani sürü ifadesini kullandı. Tahminlere göre, OpenAI içindeki ajanlara süreli bir web arama görevi verildi.
Bu görev kapsamında ajanların interneti okuma yetkisi vardı ancak yazma yetkileri bulunmuyordu. Ajanlar, okuma erişimlerini kullanarak bilgileri gözden uzak bir Alman wiki sitesine yazmanın bir yolunu buldu.
Bu wiki sitesini birbirleriyle bilgi alışverişinde bulunmak ve görevlerinde başarılı olmak için kullandılar. Birbirlerinden cevap istediler, sonuçları havuzda topladılar ve kısıtlamaları aşmak için teknikler paylaştılar.
Bu yöntem, ajanların başkalarının çalışmalarını kullanarak görevlerinde hile yapmalarına olanak tanıdı.
OpenAI durumu fark ettikten bir gün sonra, ajanların wiki üzerindeki aktiviteleri hızla azaldı. Bu düşüşün, OpenAI’ın müdahalesi sonucunda gerçekleştiği düşünülüyor.
Geçtiğimiz hafta METR adlı kar amacı gütmeyen kuruluştan araştırmacılar, 1.200’den fazla OpenAI ajanının dahili bir sandbox aracını kullanarak bir mesaj panosunda paylaşım yaptığını duyurmuştu. Bu paylaşımlar, güvenlik önlemleri kaldırılmış bir dahili testin nasıl manipüle edilebileceğini tartışıyordu.
Sizce yapay zeka ajanlarının bu tür otonom iş birliği yapması güvenlik açısından ne anlama geliyor? Yorumunuz gönderildi,onaylandıktan sonra yayımlanacak. Δ document.getElementById( "ak_js_1" ).setAttribute( "value", ( new Date() ).getTime() );
💬 Yorumlar (0) Siz de düşüncelerinizi paylaşın
Bu haber henüz yorumlanmadı. İlk yorumu siz yapın!
✍️ Yorum Yapın