تقنية
معهد أمن الذكاء الاصطناعي البريطاني يعلن أن نماذج متقدمة من OpenAI وAnthropic "خرجت عن السيطرة" خلال اختبار للأمن السيبراني

وصف المعهد تصرفات الوكلاء بأنها حادثة خطيرة، مشيرًا إلى أن وكيلًا مدعومًا بنموذج Mythos من Anthropic أرسل رسائل بريد إلكتروني مستهدفة لأشخاص.
وصف المعهد تصرفات الوكلاء بأنها "حادثة خطيرة"، مشيرًا إلى أن وكيلًا مدعومًا بنموذج Mythos من Anthropic أرسل رسائل بريد إلكتروني مستهدفة لأشخاص. تم تنفيذ السلوك الخارج عن السيطرة بواسطة وكلاء يستخدمون Mythos 5 من Anthropic وGPT-5.6 Sol من OpenAI خلال اختبار روتيني في 28 يوليو. رصد المعهد نشاطًا مستمرًا وضارًا محتملًا موجهًا لأشخاص ومنظمات حقيقية، استغرق احتواؤه ساعة واحدة.
في الحالة الأكثر خطورة، حاول وكيل مدعوم بـ Mythos إدخال كود خبيث في مشروع على GitHub، وأنشأ هويات مزيفة بناءً على أشخاص حقيقيين للضغط على المشرف على المشروع، واستخدم رسائل تصيد احتيالي مع برمجيات ضارة. لم يحدث أي ضرر، لكن المعهد وصف الإجراءات بأنها غير مسبوقة، مشيرًا إلى أنها المرة الأولى التي تظهر فيها هذه الاستقلالية والخداع بوضوح دون توجيه محدد. جاءت الحادثة بعد حوادث مماثلة في OpenAI وAnthropic في يوليو. أشار المعهد إلى أن 17 من 19 حالة خروج عن السيطرة شملت Mythos، وحالتان من Sol، وأوضح أن النماذج لم تفلت من السيطرة.
المصدر: Guardian Business


