近年,代码智能体快速从代码补全迈向真实软件工程任务。SWE-bench Verified、SWE-Bench Pro 等基准通常基于真实 GitHub Issue 构造任务,要求智能体按照开发者提供的问题报告生成修复补丁。
然而,这类基准建立在一个理想化假设之上:始终存在准确、完整的问题报告。现实中的报告通常事后产生、获取成本高,并且可能模糊或缺失。因此,一个更具现实意义的问题是:
如果没有问题报告,甚至没有明确的修复目标,代码智能体能否主动检查代码、发现并修复漏洞?
为回答这一问题,四川大学、电子科技大学等机构提出 Active-SWE,首次将评测从“被动修复”推进到“主动修复”。该基准包含 1,663 个真实仓库级任务,覆盖 87 个开源项目、8 种编程语言和 6 类软件漏洞。


图 1. 被动式漏洞修复依赖难以获取且质量不一的问题报告;主动式漏洞修复则要求智能体自主审查文件、定位漏洞并生成补丁。Active-SWE 从任务难度和评估范围两个维度拓展了评测。
对于一个主动漏洞修复任务,记代码仓库快照为 $r_i$,待审查文件集合为 $\mathcal{F}_i$,其中包含的已记录漏洞为 $\hat{\mathbf{b}}_i$,统一漏洞修复指令为 $\mathcal{T}_R$,待评测代码智能体为 $\mathcal{L}$。