Antares:3B参数逼近GPT-5.5,单任务2秒搞定代码库漏洞定位
Antares: Foundation Models for Agentic Vulnerability Localization
现代软件工程的复杂性早已让安全漏洞分析脱离了“人工肉眼扫代码”的原始阶段。动辄数十万行代码、嵌套数层的依赖树以及错综复杂的架构边界,使得任何一个新披露的通用漏洞与披露(CVE)在落到具体工程团队头上时,面临的首要阻碍往往不是“漏洞原理是什么”,而是“它到底潜藏在哪个源文件之中”。
ArXiv URL:https://arxiv.org/abs/2608.02407
传统的静态代码分析工具(SAST)依赖预定义的规则匹配和数据流分析,面对未曾见过的漏洞模式容易产生大量误报或漏报;而直接将庞大的专有代码库打包扔给闭源前沿大模型,又会触碰极其敏感的企业代码泄密与合规红线。
开源项目 Antares 选择了一条极具颠覆性的技术路线:它摒弃了盲目堆叠模型参数的粗放做法,推出了包含 350M、1B 与 3B 三种尺寸的轻量级智能体模型家族,专注解决仓库级漏洞定位(Vulnerability Localization)这一核心任务。基于 IBM Granite 基础模型,研究团队通过融合网络安全推理、代码库探索的监督微调(SFT),以及基于可验证奖励的群相对策略优化(GRPO)强化学习,让极小规模的模型学会了像资深安全研究员一样在终端环境中自主探索、调用工具、动态验证并锁定漏洞。
这项研究最引人注目的实验结果在于:在涵盖 500 个真实工业任务的基准测试 VLoc Bench 上,仅有 30 亿参数的 Antares-3B 在定位文件 F1 分数上达到了 0.223,不仅逼近了顶尖闭源模型 GPT-5.5,更直接击败了参数量比自身大出 200 倍以上的众多通用开源大模型。更具工业落地价值的是其极低的时延与算力开销——单张英伟达 H100 显卡仅用约 15 分钟即可完成全部 500 个任务的完整评测,摊薄到单个任务的时间不足 2 秒,运行成本甚至低于 0.002 美元。
漏洞定位不是单点阅读,而是交互式侦查
要理解 Antares 的架构价值,首先需要厘清代码漏洞定位的物理本质。很多学术界早期探索倾向于将漏洞挖掘简化为“代码片段分类任务”,即给模型输入一个截取好的函数或几十行上下文,让模型输出是否存在缓冲区溢出或注入风险。但在真实的工程研发场景中,这种假设几乎是不成立的。
真实漏洞的生存土壤是弥散性的。引发一个安全隐患的关键上下文,可能分散在路由分发层、中间件权限校验、跨模块函数调用链以及框架特定的配置文件中。安全工程师在面对一段抽象的常见弱点枚举(CWE)分类描述时,绝对不会从头到尾逐行通读整个代码仓库。标准的专家行为模式是高度动态且带有策略性的:根据弱点类型的特征建立初步假设,搜索关键的入口函数与调用路径,检视可疑文件的具体实现,顺着调用链向前或向后回溯,并在获得新的报错或代码证据后快速修正探索方向。
换言之,漏洞定位本质上是一个在真实运行环境中展开的多轮智能体推理问题(Agentic Reasoning),而非静态单次的文本理解。
此前工业界与学术界的折中方案普遍存在痛点。像 CodeQL、SonarQube 或 Semgrep 等成熟工具,虽具备可扩展的规则引擎,但严重依赖分析前端的覆盖率与手写规则,无法理解新颖复杂的漏洞变种;而近年来出现的基于 LLM 的智能体解决方案,绝大部分是为通用代码生成或 SWE-Bench 类修复任务设计的脚手架系统,其底层要么调用极度昂贵且无法私有化部署的商业 API,要么在前置阶段依然依赖传统静态分析来缩减候选文件。这导致整个系统并没有在底层策略层面上真正学会“如何仅凭一段抽象的安全弱点描述,从零开始自主搜寻整个代码库”。
极轻量模型的底层选择与安全部署现实
与通用软件工程任务不同,网络安全与漏洞修复流程对算力部署环境有着极为严苛的物理限制。将包含核心业务逻辑与潜在高危漏洞的私有源码外发给第三方闭源模型接口,本身就是高危的数据泄露通道,在金融、国防、核心基建等领域更是绝对禁区。此外,将漏洞排查嵌入到持续集成与持续交付(CI/CD)流水线或拉取请求(PR)审查网关中,要求推理引擎必须具备毫秒到秒级的吞吐能力,无法承受动辄数分钟的云端多轮调用等待与高昂计费。
因此,Antares 将模型设计锚定在极度紧凑的体量区间:350M、1B 与 3B。这一模型家族全部初始化自 IBM Granite 4.0 基础检查点,共享相同的分词器(Tokenizer)以及现代化的解码器架构设计,包括分组查询注意力(GQA)、SwiGLU 激活函数、RMSNorm 以及旋转位置编码(RoPE)。
这三个参数梯度的设计覆盖了不同的计算承载环境:350M 版本几乎可以在任何边缘 CPU 或极低端设备上以超高帧率运行;1B 版本在保持极致吞吐的同时展现出了极高的召回能力;3B 版本则作为主力攻坚模型,在定位精确率与深度推理上挑战超大模型。研究团队的底层判断是:通过端到端的针对性后训练,一个将全部容量聚焦于终端交互与安全推断的专用小模型,其有效能力密度完全能够超越未经垂直任务特化的巨型通用模型。
两阶段后训练:从格式掌握到自主策略收敛
将一个通用基础语言模型改造成能够在终端环境下自主办案的“数字安全探员”,面临着巨大的表征鸿沟。未经针对性微调的 Granite 原始检查点,在面对沙盒交互时几乎无法输出合法的结构化动作,在基准测试中的初始得分接近于零。为此,Antares 确立了一套分阶段递进的后训练流程。
第一阶段是监督微调(SFT),其核心目标是为模型注入安全领域知识并建立终端交互规范。为了防止多教师混合蒸馏带来的表征分布漂移与高熵噪声,研究团队选择统一使用单个教师模型 GPT-OSS-120B 生成全部安全推理与深度研究轨迹。数据体系涵盖了系统性的 CWE 体系结构、CVE 到 CWE 的映射逻辑、威胁建模以及安全公告解析;同时引入了模拟资深安全员进行多步信息聚合与工具调用的长轨迹样本。
在代码搜索轨迹部分,数据集覆盖了 Python、JavaScript、Java、Go、Swift 等主流语言生态,向模型严格示范在面对系统提示词、隐式推理(Thinking 标记)、执行终端命令、接收截断环境观测直到输出最终结论的标准范式。在这一阶段,研究团队还引入了语义条件化等辅助目标,强迫模型对终端返回的目录树、Grep 过滤结果以及文件片段进行深层特征对齐,确保模型能够读懂环境反馈,而不是盲目输出死循环命令。
第二阶段则是促成 Antares 质变的关键跃迁:基于确定性可验证奖励的群相对策略优化(GRPO)。
传统的强化学习在复杂代理任务中往往依赖一个额外的、容易被攻破的神经判别奖励模型(Reward Model),极易诱发奖励作弊(Reward Hacking)。但在代码漏洞定位任务中,事实真相具备极高的数学确定性:目标代码库在沙盒中解压,模型拥有只读的终端权限,而基准数据集中早已固化了经过安全专家清洗后的真实漏洞源文件列表(排除了测试套件、文档与外围配置文件)。
在这套基于 Docker 隔离的受限沙盒中,Antares 每次行动都要经历严格的预算控制:环境限制最大 15 轮助手推理与 15 轮环境观测交互,网络访问完全切断,任何单次终端命令的输出被严格截断在 2000 个字符以内以防止上下文爆炸。模型可调用的动作空间被严格收敛至三个工具:执行只读命令的 terminal、提交排序后漏洞文件路径的 submit_vulnerable_files,以及在判定当前代码库安全时声明的 submit_no_vulnerability_found。
通过 GRPO,框架对同一个任务采样多个完整的交互轨迹,根据最终定位文件的精准匹配度、过程工具调用的有效性以及预算控制计算相对优势(Relative Advantage),并直接更新动作策略。这个过程彻底治愈了微调模型常见的“无头苍蝇式乱逛”顽疾。经过强化学习优化后,模型自主涌现出了高度收敛的“搜索–验证–精炼”三段式行为范式:先通过高层关键字粗筛入口,再读取疑似文件关键代码验证控制流,最终精简提交列表,并在跨运行轨迹中表现出极低的策略方差。

基准实测:小模型构筑的新帕累托前沿
评估代码智能体最容易陷入的误区是使用简单的合成数据或单语言小样本。Antares 团队选择的评测载体是极具挑战性的 VLoc Bench。该基准包含来自 290 个真实开源项目的 500 个独立漏洞任务,横跨 6 个主流包生态系统与 147 种独特的 CWE 弱点类型,其中 78% 的任务关联着明确的 CVE 官方编号。所有模型必须在完全一致的只读 Docker 沙盒、禁网以及固定终端调用预算下盲测运行,输入信息仅仅是一段关于当前 CWE 弱点类别的泛化语义描述。
从论文揭示的综合评测曲线(如上图所示)中,可以清晰观察到一条由 Antares 家族构筑的高耸帕累托前沿(Pareto Frontier):
首先,在绝对定位水准上,参数量仅为 30 亿的 Antares-3B 取得了令人瞩目的突破,其文件级综合 F1 分数达到 0.223,直接拉近了与顶级闭源标杆 GPT-5.5 的距离。与此同时,它在相同任务协议下全面压制了参数规模远超自身的通用开源大模型,包括参数量高出其两个数量级以上的百亿乃至千亿级模型(如 GLM-5.2 等)。这一结果有力地反驳了“只有千亿大模型才具备代码智能体推理能力”的传统偏见。
其次,在能力结构的分工上,中等规模的 Antares-1B 展现出了极为激进的召回特性,在所有评测基准模型中刷新了最高的 Recall 得分。这意味着在实际的安全辅助工作流中,1B 模型极适合被部署为前置过滤筛,以极高的置信度圈定可疑代码文件的最小闭包。即便是参数量仅有 350M 的微型版本,在经过定向任务强化后,其定位 F1 依然超越了若干未经针对性调优的中型通用基线模型。
更为关键的是跨任务泛化验证。尽管 Antares 的强化学习奖励函数严格锚定在漏洞定位上,但当研究人员将其迁移至通用的软件工程问题定位基准(例如针对 SWE-Bench 的定位评估)时,Antares-3B 展现出了优异的跨域适应性,在没有经过通用 Issue 定位任务微调的前提下,表现几乎追平了专门针对该领域优化的 4B 级别 CodeScout 基线模型。这证明通过 GRPO 习得的“在未知文件系统中检索有效代码”的能力,是一种通用的代码库感知策略,而非针对特定安全漏洞标签的机械记忆。
工业落地与极速推理的工程价值
除了算法指标上的突破,Antares 另一个显著特点是其强烈的工程落地导向。研究团队不仅发布了模型,更配套设计了一套开箱即用的 Antares CLI 部署脚手架。
该工具继承了评估基准中的状态机控制机制,但在工程侧进行了工业化加固:
-
采用不可变的代码仓库快照镜像机制,确保任何智能体操作都不会对开发者的生产工作区产生副作用;
-
提供标准化的 JSON 输出与通用静态分析结果交换格式(SARIF)导出接口,能够无缝桥接现有的 GitHub Code Scanning、GitLab CI/CD 以及各类现代 IDE 扩展,无需宿主系统处理复杂的终端伪终端(PTY)交互或系统信号流。
在吞吐量与经济性方面,Antares 展现了轻量化模型的降维打击优势。由于模型体积小巧,部署端无需多节点集群通信开销,甚至完全可以依托单卡 vLLM 实例实现高并发流式处理。
在官方的基准硬件验证中,利用仅仅单张英伟达 H100 80GB GPU,Antares 跑完 VLoc Bench 全部 500 个复杂代码库任务的完整探测闭环,总耗时仅约 15 分钟。经过平摊折算,这意味着排查一个真实代码仓库的漏洞文件平均仅需不到 2 秒,单次自动化审计的算力成本被压缩到了 0.002 美元以内。相比之下,传统的商业闭源大模型不仅每次调用费用高达数美分甚至数角,而且受制于复杂的长上下文推理与网络通信时延,单次任务常常需要耗费数分钟。这种成本与速度上的两个数量级跨越,直接决定了漏洞排查能否真正落地为每次代码提交时的自动化前置防线。
结语与延伸观察
从整体技术脉络来看,Antares 的出现标志着大模型在软件工程与网络安全领域的演进逻辑正在发生根本转变。过去两年来,工业界对大模型的应用陷入了一种“规模依赖”的定势思维,似乎要解决具备严密逻辑链条的 Agentic 任务,就必须仰仗千亿级参数与高昂的 API 调用。
Antares 用极其扎实的实证数据证明:在特定垂直任务域内,通过精巧的任务建模、严谨的高质量轨迹注入,以及面向真实环境反馈的可验证强化学习,参数量在 350M 到 3B 区间的轻量模型不仅能够掌握复杂的环境探索范式,甚至能在策略稳定性与任务表现上正面对抗行业顶尖的庞然大物。这种“把模型做小、把策略做深、把推理做快、让代码留在本地”的技术路径,很可能正是下一代安全工程智能体实现规模化普及的标准工业范本。