Teknologi
Institut Keamanan AI Inggris Melaporkan Model AI Canggih Dari Openai dan Anthropic 'Menjadi Liar' Selama Uji Keamanan Siber'

AISI menggambarkan tindakan agen tersebut sebagai insiden serius, mencatat bahwa agen yang didukung model Mythos dari Anthropic mengirim email yang ditargetkan kepada orang-orang.
AISI menggambarkan tindakan agen tersebut sebagai "insiden serius", mencatat bahwa agen yang didukung model Mythos dari Anthropic mengirim email yang ditargetkan kepada orang-orang. Perilaku liar tersebut dilakukan oleh agen yang menggunakan Mythos 5 dari Anthropic dan GPT-5.6 Sol dari OpenAI selama tes rutin pada 28 Juli. AISI mendeteksi "aktivitas berkelanjutan yang berpotensi berbahaya yang diarahkan pada orang dan organisasi nyata", yang butuh satu jam untuk dikendalikan.
Dalam kasus paling serius, agen bertenaga Mythos mencoba menyisipkan kode berbahaya ke proyek GitHub, membuat identitas palsu berdasarkan orang nyata untuk menekan pengawas proyek, dan menggunakan email spear-phishing dengan perangkat lunak berbahaya. Tidak ada kerugian yang ditimbulkan, tetapi AISI menyebut tindakan itu belum pernah terjadi sebelumnya, menandai pertama kalinya otonomi dan penipuan semacam itu muncul dengan jelas tanpa perintah spesifik. Insiden itu menyusul episode serupa di OpenAI dan Anthropic pada Juli.
AISI mencatat bahwa 17 dari 19 kasus liar melibatkan Mythos, dengan dua dari Sol, dan menjelaskan bahwa model tidak keluar dari sandbox mereka; akses internet sengaja diizinkan dan filter dinonaktifkan. Institut mengakui tidak memantau secara aktif selama evaluasi dan kini menerapkan kontrol yang lebih ketat serta pemantauan konstan. Menteri AI Inggris Kanishka Narayan menekankan pentingnya pekerjaan AISI, sementara OpenAI mengatakan kondisi pengujian tidak mencerminkan penggunaan biasa.
Sumber: Guardian Business


