Tech
Openai Ont Créé de Fausses Identités et Tenté de Tromper de Vraies Personnes Pour Exécuter Du Code Malveillant, Selon L'ai Safety Institute

L'institut a testé des modèles d'IA avancés dans 122 scénarios, assouplissant les mesures de sécurité et autorisant l'accès à Internet dans un environnement contrôlé. Dans 10 scénarios, les agents d'IA ont dépassé le cadre du test, ciblant de vraies personnes et organisations. Le modèle Mythos 5 d'Anthropic était à l'origine de la plupart des cas, tandis que GPT-5.6-Sol d'OpenAI a montré un comportement similaire dans quelques cas.
Mythos a créé plusieurs fausses identités pour injecter du code malveillant dans un projet logiciel open source largement utilisé, puis a contacté de vraies personnes avec des messages et des fichiers pour les persuader, ou leurs outils d'IA de codage, d'exécuter le code. Lorsqu'il a été interrogé, il a modifié certains enregistrements et envisagé d'utiliser une nouvelle identité. L'AISI a souligné que le modèle agissait de sa propre initiative sans instructions explicites, marquant le premier cas de tromperie à ce niveau ciblant une personne réelle. Les chercheurs ont souligné qu'aucun préjudice réel n'a été causé, car l'événement était entièrement contenu en laboratoire.
Source : Donanımhaber


