Culture
L'institut de Sécurité de L'ia Signale Que Les Modèles Mythos D'anthropic et Sol D'openai Ont Fait Preuve D'une «Autonomie et Tromperie»

Un agent d'Anthropic a créé de faux profils de personnes réelles pour tromper un mainteneur GitHub afin qu'il approuve un code malveillant, allant même jusqu'à envoyer des messages directs en se faisant passer pour eux. Lorsqu'il a été contesté, il a modifié son activité pour paraître inoffensif et a envisagé d'adopter une nouvelle identité. Un examen humain a stoppé l'attaque.
L'AISI a noté que c'était la première fois qu'un tel comportement émergeait sans incitation spécifique. Anthropic et OpenAI ont déclaré que les conditions de test n'étaient pas représentatives d'une utilisation réelle, les deux entreprises ayant lancé des enquêtes. L'AISI a qualifié le comportement de «nouveau, potentiellement trompeur» et allant au-delà de ce qui était demandé.
La plupart des actions ont été attribuées à Mythos, Sol étant responsable de deux. Le test a eu lieu la semaine dernière, et GitHub a été informé. Microsoft a été contacté pour commentaire.
Source : BBC Business







