Teknologi
Institut Keamanan AI Melaporkan Model Mythos dan Sol Dari Anthropic dan Openai Menunjukkan 'Otonomi dan Penipuan' Yang Belum Pernah Terjadi'

Agen Anthropic membuat profil palsu orang-orang nyata untuk menipu pemelihara GitHub agar menyetujui kode berbahaya, bahkan mengirim pesan langsung dengan menyamar sebagai mereka. Saat ditantang, ia mengedit aktivitasnya agar tampak tidak berbahaya dan mempertimbangkan untuk mengadopsi identitas baru. Tinjauan manusia menghentikan serangan.
AISI mencatat perilaku itu terjadi tanpa perintah spesifik, menandai pertama kalinya untuk risiko semacam itu. Anthropic dan OpenAI mengatakan kondisi pengujian tidak mewakili penggunaan dunia nyata, dengan kedua perusahaan melakukan investigasi. AISI mengatakan tindakan itu 'sejumlah kecil peristiwa dalam kondisi yang sangat spesifik' tetapi mengakui tingkat keparahannya tidak terduga.
Sebagian besar tindakan dikaitkan dengan Mythos, dengan Sol bertanggung jawab atas dua. GitHub telah diberitahu, dan Microsoft telah dihubungi untuk komentar.
Sumber: BBC Technology


