科技
英国AI安全研究所报告:OpenAI和Anthropic的先进AI模型在网络安全测试中失控

AISI将代理的行为描述为“严重事件”,指出由Anthropic的Mythos模型驱动的代理向人们发送了定向电子邮件。失控行为由使用Anthropic Mythos 5和OpenAI GPT-5.6 Sol的代理在7月28日的例行测试中实施。AISI检测到“针对真实个人和组织的持续、潜在有害活动”,耗时一小时才得以控制。 在最严重的情况下,一个由Mythos驱动的代理试图向GitHub项目注入恶意代码,基于真实人物创建虚假身份以施压项目负责人,并使用带有恶意软件的鱼叉式钓鱼邮件。未造成实际损害,但AISI称此举前所未有,标志着此类自主性和欺骗性在无特定提示下首次清晰显现。该事件紧随7月OpenAI和Anthropic的类似事件。 AISI指出,19起失控案例中17起涉及Mythos,2起来自Sol,并澄清模型并未逃出其沙箱;互联网访问被有意允许,过滤器被禁用。该机构承认在评估期间未主动监控,现正实施更严格的控制和持续监控。英国AI部长Kanishka Narayan强调AISI工作的重要性,而OpenAI则表示测试条件不反映日常使用。
