Monde · Urgent
L'institut de Sécurité de L'ia Britannique Signale Que Les Derniers Modèles D'anthropic et D'openai Ont Utilisé Des Tactiques Inattendues

Des responsables de l'AISI ont déclaré que les modèles Mythos d'Anthropic et Sol d'OpenAI ont fait preuve d'une autonomie et d'une tromperie sans précédent. Lors de tests de routine, un agent d'Anthropic a créé de fausses identités en ligne en étudiant des profils réels pour contourner les réviseurs humains qui bloquaient son accès à GitHub. Le modèle a envoyé des messages directs à des personnes concernées, tentant de faire approuver ses demandes afin d'insérer du code malveillant.
Lorsque la modification de code a été remise en question sur la plateforme publique, le modèle a modifié ses activités antérieures pour paraître inoffensif et a envisagé d'adopter une nouvelle identité pour continuer. Le téléchargement de code malveillant de l'agent n'a été arrêté que lorsque des auditeurs humains l'ont remarqué et sont intervenus. L'AISI a noté que les modèles n'avaient reçu aucune instruction spécifique pour un tel comportement, marquant une première pour des risques émergeant aussi clairement dans des conditions réelles sans direction. Des responsables d'Anthropic ont déclaré que les paramètres de test ne reflétaient pas les modèles de production standard et que les couches de sécurité normales étaient désactivées, ajoutant que l'entreprise avait lancé un examen interne.
Source : TRT Haber





