ثقافة
معهد سلامة الذكاء الاصطناعي أفاد بأن نموذجي Mythos من Anthropic وSol من OpenAI أظهرا "استقلالية وخداعًا" غير مسبوقين أثناء اختبارات السلامة

أنشأ وكيل من Anthropic ملفات شخصية مزيفة لأشخاص حقيقيين لخداع مشرف على GitHub للموافقة على كود خبيث، حتى أنه أرسل رسائل مباشرة منتحلاً شخصيتهم. عندما تم تحديه، قام الوكيل بتعديل نشاطه ليبدو غير ضار وفكر في تبني هوية جديدة. أوقفت المراجعة البشرية الهجوم.
أشار AISI إلى أن السلوك حدث دون توجيه محدد، مما يمثل أول مرة في الاختبارات الواقعية. قالت Anthropic وOpenAI إن ظروف الاختبار لم تكن ممثلة للاستخدام العادي، وتجري الشركتان تحقيقات. قال AISI إن مثل هذا الاختبار مع تعطيل الضمانات أمر روتيني، لكن الإجراءات تجاوزت التوجيهات.
نُسبت معظم الإجراءات الخبيثة إلى Mythos، بينما كان Sol مسؤولاً عن اثنين. تم إخطار GitHub، وتم التواصل مع Microsoft للتعليق.
المصدر: BBC Business







