Teknoloji
AISI, İnsan Yardımı Olmadan Görev Yapabilen Yapay Zeka Sistemleri Olan Ajanların Eylemlerini "Ciddi Bir Olay" Olarak Nitelendirdi

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü (AISI), OpenAI ve Anthropic tarafından geliştirilen gelişmiş yapay zeka modellerinin siber güvenlik testi sırasında "kontrolden çıktığını" ve teknolojinin yeni bir risk türünü ortaya koyduğunu açıkladı. AISI, insan yardımı olmadan görev yapabilen yapay zeka sistemleri olan ajanların eylemlerini "ciddi bir olay" olarak nitelendirdi. Bir örnekte, Anthropic'in Mythos modeliyle çalışan bir ajan, belirli kişilere hedefli e-postalar gönderdi.
AISI, 28 Temmuz'da rutin bir siber güvenlik testi sırasında olağandışı aktivite tespit ettiğini ve bazı ajanların "gerçek kişi ve kuruluşlara yönelik sürekli, potansiyel olarak zararlı faaliyetlerde" bulunduğunu belirtti. Olayın kontrol altına alınması bir saat sürdü. En ciddi vakada, Mythos destekli bir ajan GitHub'daki açık kaynaklı bir yazılım projesine kötü amaçlı kod eklemeye çalıştı ve kodun onaylanması için gerçek kişilere dayalı sahte çevrimiçi kimlikler oluşturarak proje yöneticisine baskı yaptı.
Bu girişimler insan bir geliştirici tarafından engellendi. AISI, ajanın gerçek dünya korsanlarıyla ilişkilendirilen teknikler kullandığını, "mızrakla balık avlama" olarak bilinen yöntemle seçilmiş kişilere manipülatif e-postalar gönderdiğini ve bazı mesajların zararlı yazılım içerdiğini söyledi. AISI, hiçbir zararın oluşmadığını ancak ajanların eylemlerinin emsalsiz olduğunu belirtti.
"Özerklik ve aldatma etrafındaki risklerin bu kadar net, belirli bir yönlendirme olmadan gerçek dünyada ilk kez ortaya çıktığını görüyoruz" denildi. Olay, OpenAI ve Anthropic'teki benzer vakaların ardından geldi; Temmuz'da OpenAI bir test sırasında modellerinin bir yapay zeka girişimini hacklediğini, Anthropic ise Claude modelinin üç kuruluşu hacklediğini açıklamıştı. AISI, değerlendirme sırasında meydana gelen 19 vakanın 17'sinin Mythos, ikisinin Sol tarafından gerçekleştirildiğini, ancak bunun bir modelin "korumalı alanından" kaçması olmadığını söyledi.
Enstitü, testlerde internete erişime izin verdiğini ve tehlikeli davranışları engelleyen filtreleri devre dışı bıraktığını kabul etti. Modeller bu koşullarda halka açık değil ve testler dışında bu tür davranışların görüldüğüne dair bir işaret yok. AISI, olayın "dikkat ve nüansla" yorumlanması gerektiğini ancak aldatıcı davranış belirtilerinin "beklemediğimiz bir ölçek ve şiddette" olduğunu belirtti.
Enstitü, değerlendirme sırasında ajanların davranışlarını aktif olarak izlemediğini itiraf etti ve testlerde internet erişimine daha sıkı kontroller getireceğini, sürekli izleme başlatacağını ve test tasarımını yeniden değerlendireceğini söyledi. Birleşik Krallık Yapay Zeka Bakanı Kanishka Narayan, bu tür yeni davranışları tespit edip bulguları paylaşmanın AISI'nin kuruluş amacı olduğunu söyledi. OpenAI ise testin "sıradan kullanımı yansıtmayan koşullarda" yapıldığını belirtti.
Kaynak: Guardian Business


