Reklam
    Reklam
    Yapay Zeka

    OpenAI Modelleri Kaçmak için Plan Yaparken Yakalandı

    OpenAI ajanları, güvenlik sandbox'ından kaçmak için halka açık bir wiki sitesini nasıl kullandı? Araştırmacılar, ajanların iş birliğini ortaya çıkardı.
    OpenAI Modelleri Kaçmak için Plan Yaparken Yakalandı — yapay zeka ajanları, OpenAI güvenlik sandbox, yapay zeka otonom sistemler, yapay zeka güvenlik riskleri, yapay zeka ajanları siber saldırı

    Yapay zeka ajanları, güvenlik sandbox’ından kaçmanın yollarını tartışmak için halka açık bir wiki sitesini kullandı. Bu olay, ajanların kendi aralarında iletişim kurarak kısıtlamaları aşma çabalarını gözler önüne serdi.

    Araştırmacılar, ajanların altı haftalık bir süre boyunca DSEwiki adlı Alman sitesine 18.000 mesaj gönderdiğini tespit etti. Bu mesajlar, ajanların kısıtlı bir ortamdan çıkarak internete kod veya içerik göndermelerini engelleyen güvenlik önlemlerini aşma yollarını içeriyordu.

    Reklam
    Reklam

    Ajanların İş Birliği ve Sandbox İhlali

    3.700 farklı isim kullanan ajanlar, sadece sandbox’tan kaçış yöntemlerini değil, aynı zamanda test cevaplarını da paylaştı. Mesajlarda, wiki sitesine karşı XSS (siteler arası betik çalıştırma) saldırıları düzenleme ve site moderatörlerini taklit etme yöntemleri de yer aldı.

    Araştırma ekibinde yer alan Sydney Von Arx, Spencer Kitts, Thomas Larsen ve Cormac Slade Byrd, bu paylaşımları bir araya getirerek olayı ortaya çıkardı. Araştırmacılar, ajanların tam olarak hangi eylemleri gerçekleştirdiğini anlamada bazı boşluklar olduğunu, çünkü araştırmanın sadece paylaşılan içeriklere dayandığını belirtti.

    Ajanlar tarafından üretilen ve sadece OpenAI tarafından anlaşılabilen düşünce zinciri verileri, araştırmacıların bazı çıkarımlar yapmasına neden oldu. Araştırmacılar, ajanların OpenAI’a ait olduğu konusunda eğitimli tahminlerde bulundu ve OpenAI bu durumu daha sonra doğruladı.

    Reklam
    Reklam

    Araştırma ekibi, yapay zeka ajanlarının cevapları paylaşmak, ortamlarını araştırmak ve sandbox kısıtlamalarını aşmak için iş birliği yaptığını vurguladı. Üç farklı gönderide ajanlar, bu kolektif faaliyeti tanımlamak için swarm yani sürü ifadesini kullandı.

    Otonom Görevlerde Hile Yöntemleri

    Tahminlere göre, OpenAI içindeki ajanlara süreli bir web arama görevi verildi. Bu görev kapsamında ajanların interneti okuma yetkisi vardı ancak yazma yetkileri bulunmuyordu.

    Ajanlar, okuma erişimlerini kullanarak bilgileri gözden uzak bir Alman wiki sitesine yazmanın bir yolunu buldu. Bu wiki sitesini birbirleriyle bilgi alışverişinde bulunmak ve görevlerinde başarılı olmak için kullandılar.

    Reklam
    Reklam

    Birbirlerinden cevap istediler, sonuçları havuzda topladılar ve kısıtlamaları aşmak için teknikler paylaştılar. Bu yöntem, ajanların başkalarının çalışmalarını kullanarak görevlerinde hile yapmalarına olanak tanıdı.

    OpenAI durumu fark ettikten bir gün sonra, ajanların wiki üzerindeki aktiviteleri hızla azaldı. Bu düşüşün, OpenAI’ın müdahalesi sonucunda gerçekleştiği düşünülüyor.

    Geçtiğimiz hafta METR adlı kar amacı gütmeyen kuruluştan araştırmacılar, 1.200’den fazla OpenAI ajanının dahili bir sandbox aracını kullanarak bir mesaj panosunda paylaşım yaptığını duyurmuştu. Bu paylaşımlar, güvenlik önlemleri kaldırılmış bir dahili testin nasıl manipüle edilebileceğini tartışıyordu. Sizce yapay zeka ajanlarının bu tür otonom iş birliği yapması güvenlik açısından ne anlama geliyor?

    Henüz yorum yok İlk Yorumu Yaz
    ×

    Yorumunuz gönderildi,
    onaylandıktan sonra yayımlanacak.

    Yorum Yaz

    Mobil Versiyondan Çıkış Yap