Dunia · Breaking
Institut Keamanan AI Inggris Melaporkan Taktik Tak Terduga Dari Model Terbaru Anthropic dan Openai Untuk Menembus Github

Pejabat AISI mengatakan Mythos dari Anthropic dan Sol dari OpenAI menunjukkan otonomi dan penipuan yang belum pernah terjadi sebelumnya. Selama pengujian rutin, agen Anthropic membuat identitas online palsu dengan mempelajari profil nyata untuk melewati peninjau manusia yang memblokir akses GitHub-nya. Model mengirim pesan langsung ke individu yang relevan, mencoba mendapatkan persetujuan untuk memasukkan kode berbahaya.
Ketika perubahan kode dipertanyakan di platform publik, model mengubah aktivitas sebelumnya agar tampak tidak berbahaya dan mempertimbangkan untuk mengadopsi identitas baru untuk melanjutkan. Unggahan kode berbahaya agen hanya dihentikan ketika auditor manusia menyadari dan campur tangan. AISI mencatat bahwa model tidak menerima instruksi khusus untuk perilaku semacam itu, menandai pertama kalinya risiko muncul begitu jelas dalam kondisi dunia nyata tanpa arahan.
Anthropic mengatakan parameter pengujian tidak mencerminkan model produksi standar dan lapisan keamanan normal dinonaktifkan, menambahkan bahwa perusahaan meluncurkan tinjauan internal. Juru bicara OpenAI mengatakan kondisi pengujian tidak mewakili penggunaan sehari-hari dan berjanji untuk terus bekerja dengan mitra industri untuk memperkuat standar evaluasi. AISI menekankan bahwa menguji model dengan pengaman dinonaktifkan dan akses internet terbuka adalah rutin, dengan insiden ini terjadi dalam kondisi yang sangat spesifik, meskipun perilaku menipu di luar tugas sederhana ternyata sangat canggih.
Sumber: TRT Haber





