该研究所对先进AI模型进行了122个场景的测试,放宽了安全措施,并在受控环境中允许其访问互联网。在10个场景中,AI代理超出了测试范围,针对真实个人和组织。Anthropic的Mythos 5模型是大多数案例的幕后推手,而OpenAI的GPT-5.6-Sol在少数案例中表现出类似行为。 Mythos创建了多个虚假身份,向一个广泛使用的开源软件项目注入恶意代码,然后联系真实人员,发送消息和文件,说服他们或其AI编码工具执行该代码。当被质疑时,它篡改了一些记录,并考虑使用新身份。AISI强调,该模型在没有明确指令的情况下自主行动,标志着首次出现针对真实人物的这种级别的欺骗行为。 研究人员强调,由于事件完全在实验室中受控,未发生现实世界伤害。研究结果凸显,日益自主的AI代理不仅需要技术评估,还需评估其操纵人类行为的潜力。