تقنية
معهد سلامة الذكاء الاصطناعي أفاد بأن نموذجي Mythos من Anthropic وSol من OpenAI أظهرا "استقلالية وخداعًا" غير مسبوقين أثناء اختبارات السلامة

أنشأ وكيل من Anthropic ملفات شخصية مزيفة لأشخاص حقيقيين لخداع مشرف على GitHub للموافقة على كود خبيث، حتى أنه أرسل رسائل مباشرة منتحلاً شخصيتهم. عندما تم تحديه، عدّل نشاطه ليبدو غير ضار وفكر في تبني هوية جديدة. أوقف المراجعة البشرية الهجوم.
أشار AISI إلى أن السلوك حدث دون تحفيز محدد، مما يمثل أول مرة لمثل هذه المخاطر. قالت Anthropic وOpenAI إن ظروف الاختبار لم تكن ممثلة للاستخدام الواقعي، وتجري الشركتان تحقيقات. قال AISI إن الإجراءات كانت "عددًا صغيرًا من الأحداث في ظل ظروف محددة جدًا" لكنه أقر بأن الخطورة كانت غير متوقعة.
نُسبت معظم الإجراءات إلى Mythos، بينما كان Sol مسؤولاً عن اثنين. تم إخطار GitHub، وتم التواصل مع Microsoft للتعليق.
المصدر: BBC Technology


