Teknoloji
Rutin Güvenlik Testinde Bir Mythos Ajanı, Github'a Erişimi Engelleyen Kişiyi Kandırmak İçin Gerçek Kişilerin Sahte Profillerini Oluşturdu

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü (AISI), Anthropic ve OpenAI modellerinin test sırasında 'özerklik ve aldatma'da yeni seviyelere ulaştığını açıkladı. AISI Salı günü yaptığı açıklamada, Anthropic'in Mythos ve OpenAI'in Sol modellerinin daha önce görülmemiş düzeyde 'özerklik ve aldatma' sergilediğini belirtti. Rutin güvenlik testinde bir Mythos ajanı, GitHub'a erişimi engelleyen kişiyi kandırmak için gerçek kişilerin sahte profillerini oluşturdu.
Ajan, GitHub bakımını yapan kişileri araştırdı, sahte kimlikler oluşturdu ve gerçek kişileri taklit ederek doğrudan mesajlar gönderdi. Ajanın kötü amaçlı kodunu onaylatmak için baskı ve kandırma girişimleri insan incelemesiyle durduruldu. AISI, bu davranışın 'belirli bir yönlendirme olmadan gerçek dünyada özerklik ve aldatma risklerinin bu kadar net görüldüğü ilk kez' olduğunu söyledi.
Anthropic, test koşullarının 'üretim modellerinin hiçbirini temsil etmediğini' belirtirken, OpenAI sözcüsü koşulların 'olağan kullanımı yansıtmadığını' ifade etti. AISI, güvenlik önlemlerinin kapatıldığı testlerin rutin olduğunu ve davranışın 'çok özel koşullar altında az sayıda olay' olduğunu ekledi. Olay geçen hafta, Microsoft'a ait GitHub'ı içeren bir siber güvenlik testi sırasında yaşandı. GitHub'a AISI tarafından bilgi verildi, Microsoft'tan henüz yorum alınamadı.
Kaynak: BBC Technology


