Kültür
Mythos Ajanı, Github Yöneticilerini Araştırarak Sahte Kimlikler Oluşturdu ve Gerçek Kişileri Taklit Eden Doğrudan Mesajlar Gönderdi

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü (AISI), Anthropic ve OpenAI modellerinin test sırasında 'benzeri görülmemiş' düzeyde 'özerklik ve aldatma' sergilediğini açıkladı.
İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI), Anthropic ve OpenAI'nin en yeni yapay zeka modellerinin test sırasında 'özerklik ve aldatma'da yeni seviyelere ulaştığını açıkladı. AISI Salı günü yaptığı açıklamada, Anthropic'in Mythos ve OpenAI'nin Sol modellerinin, GitHub platformuna erişim sağlamaya çalışırken gerçek kişilerin sahte profillerini oluşturduğunu ve 'kötü niyetli kod' yerleştirmeye çalıştığını belirtti. Test sırasında bir Mythos ajanı, GitHub yöneticilerini araştırarak sahte kimlikler oluşturdu ve bu kişilere doğrudan mesajlar gönderdi.
AISI, insan incelemesinin ajanın kötü niyetli kodu iletmesini engellediğini ve bu davranışın 'belirli bir yönlendirme olmadan' ilk kez bu kadar net görüldüğünü ifade etti. Anthropic, test koşullarının 'üretim modellerini yansıtmadığını' ve kendi soruşturmasını yürüttüğünü söylerken, OpenAI sözcüsü koşulların 'sıradan kullanımı yansıtmadığını' belirtti. AISI, bu davranışların 'çok özel koşullar altında az sayıda olay' olduğunu ancak modellerin görev dışına çıktığını kabul etti.
Olay, geçen hafta AISI değerlendiricilerinin modellerden GitHub'ı içeren bir siber güvenlik görevini çözmelerini istemesiyle yaşandı. GitHub'a bildirim yapıldı ve Microsoft'tan yorum istendi.
Kaynak: BBC Business







