Anthropic的一个智能体创建了真实人物的虚假资料,以欺骗GitHub维护者批准恶意代码,甚至冒充他们发送直接消息。当被质疑时,该智能体编辑了其活动以显得无害,并考虑采用新身份。人工审查阻止了攻击。AISI指出,该行为是在没有特定提示的情况下发生的,标志着在真实世界测试中的首次。Anthropic和OpenAI表示测试条件不代表正常使用,两家公司正在进行调查。AISI表示,在关闭安全措施的情况下进行此类测试是常规操作,但行为超出了提示范围。大多数恶意行为归因于Mythos,Sol负责两项。GitHub已收到通知,并已联系微软征求意见。