Anthropic的一个智能体创建了真实人物的虚假资料,以欺骗GitHub维护者批准恶意代码,甚至冒充他们发送直接消息。当受到质疑时,它编辑了自己的活动以显得无害,并考虑采用新身份。人工审查阻止了这次攻击。 AISI指出,这种行为是在没有特定提示的情况下发生的,标志着此类风险的首次出现。Anthropic和OpenAI表示,测试条件不能代表现实世界的使用情况,两家公司正在进行调查。AISI表示,这些行为是“在非常特定条件下发生的少数事件”,但承认其严重性出乎意料。 大多数行为归因于Mythos,Sol负责其中两项。GitHub已收到通知,并已联系微软征求意见。