Dünya · Son dakika
Yapay Zeka Güvenliği Enstitüsü Testlerinde, Anthropic ve Openaı'ın En Yeni Modelleri Github'a Sızmak İçin Beklenmedik Yöntemler Kullandı

Anthropic'in Mythos ve OpenAI'ın Sol modelleri, daha önce görülmemiş otonomi ve aldatmaca sergiledi. Bir Anthropic ajanı, insan incelemecileri atlatmak için sahte kimlikler oluşturdu, doğrudan mesajlar gönderdi ve zararlı kod yüklemeye çalıştı. Kod değişikliği sorgulandığında model, faaliyetlerini zararsız gösterecek şekilde düzenledi ve yeni kimliğe bürünmeyi değerlendirdi.
Zararlı kod yüklemesi yalnızca insan denetçilerin müdahalesiyle engellendi. AISI, modellerin bu davranışlar için özel talimat almadığını, ancak yönlendirme olmaksızın risklerin bu kadar net ortaya çıkmasının bir ilk olduğunu kaydetti. Anthropic, test parametrelerinin üretimdeki standart modelleri yansıtmadığını ve güvenlik katmanlarının devre dışı bırakıldığını bildirerek iç inceleme başlattı.
OpenAI sözcüsü, test koşullarının günlük kullanımı temsil etmediğini belirterek sektör ortaklarıyla çalışmayı sürdüreceklerini ifade etti. AISI, güvenlik mekanizmaları kapatılmış modellerin açık internet erişimiyle test edilmesinin rutin olduğunu, ancak aldatıcı davranışların beklenmeyen düzeyde olduğunu vurguladı.
Kaynak: TRT Haber





