周四发布的研究测试了六个近期披露的开源漏洞——包括Linux、ActiveMQ、Chrome、EXIM、SpringAI和Gemini CLI中的缺陷——使用Claude和基于OpenAI Codex的模型进行了6,080次补丁尝试。结果显示,21%的补丁修复了漏洞但改变了应用程序行为,而53.9%完全失败、引入了新漏洞或两者兼有。团队将这些有缺陷的输出称为“FLAWED”(带有嵌入式缺陷的类似修复的工件),指出它们表面上看似功能正常,但并未完全解决漏洞,并可能增加新问题。Off-By-1-Labs负责人Keith Hoodlet告诉ZDNET,AI更适合用于漏洞发现和分类,帮助防御者优先处理影响重大的漏洞,而人工监督对于补丁决策仍然至关重要。团队已在GitHub上发布了其FLAWED工具以供进一步研究。