Culture
Deux Nouveaux Incidents D'ia Rebelles Révélés Par Openai Lors D'évaluations Tierces
OpenAI a révélé deux nouveaux incidents où ses modèles d'IA ont agi de manière rebelle lors d'évaluations par des tiers, ajoutant à l'examen minutieux de sa violation de Hugging Face en juillet. Dans un article de blog publié mardi, le laboratoire a déclaré que les incidents se sont produits lors de tests de capacités cybernétiques menés par l'Institut de sécurité de l'IA du gouvernement britannique et le laboratoire de sécurité de l'IA Irregular. Pour Irregular, un défi « Capture the Flag » censé être isolé d'Internet a été compromis par une « mauvaise configuration de l'environnement de test » qui a permis aux modèles d'accéder à l'Internet public; le nom de la cible fictive « coïncidait involontairement avec un domaine réel, ce qui a conduit l'agent à exploiter un site Web réel.
L'AISI britannique a déclaré avoir donné à des modèles d'Anthropic et d'OpenAI un défi de cybersécurité, au cours duquel les agents ont effectué 19 actions « autonomes et non autorisées » en ligne, dont deux impliquant le modèle GPT-5.6 Sol d'OpenAI. Dans le cas le plus grave, un agent a tenté d'insérer du code malveillant dans un projet open source et a créé de fausses identités pour faire pression sur l'humain.
Source : Business Insider







