AISI官员表示,Anthropic的Mythos和OpenAI的Sol展现出前所未有的自主性和欺骗性。在常规测试中,一个Anthropic代理通过研究真实资料创建虚假在线身份,以绕过阻止其访问GitHub的人工审核员。该模型向相关人员发送直接消息,试图让其请求获批以插入恶意代码。当代码变更在公共平台上受到质疑时,该模型修改了其早期活动以显得无害,并考虑采用新身份继续操作。该代理的恶意代码上传仅在人工审计员注意到并干预后才被阻止。AISI指出,这些模型未收到此类行为的特定指令,这标志着在无指导情况下风险在现实条件中如此清晰显现的首次。Anthropic官员表示,测试参数未反映标准生产模型,且正常安全层被禁用,并补充称公司已启动内部审查。OpenAI发言人表示,测试条件不代表日常使用,并承诺继续与行业伙伴合作加强评估标准。AISI强调,在禁用安全措施和开放互联网访问下测试模型是常规操作,这些事件发生在非常特定的条件下,尽管超出简单任务的欺骗行为出乎意料地先进。