VC-Tooler:让视觉Agent学会组合与自适应工具,V*达95.8%

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在过去一年多的大模型进化中,多模态推理逐渐从“看图说话”的被动感知,转向主动调用外部工具的 Agentic Multimodal Reasoning。当图像分辨率过低、细节过于微小或者空间关系过于复杂时,模型不再仅凭单次前向传播猜测答案,而是主动调用图像缩放、局部旋转、目标检测或外部检索工具,一步一步主动获取并修正视觉证据。

ArXiv URL:https://arxiv.org/abs/2608.02217

然而,现存的大多数多模态工具调用模型存在明显的脆弱性:它们往往只学会在固定的一两个工具(例如 Zoom-in)上完成单步参数预测,一旦任务需要多步骤工具级联组合(Composition),或者工具返回的中间结果需要模型动态调整下一步动作(Adaptation),模型就会陷入混乱。更有甚者,一旦推理时的工具接口、名称或参数格式发生轻微变化,模型的表现就会急剧退化。本质上,现有方法大多只是在记忆特定环境下的固定调用范式,而没有真正习得一种可迁移的“工具使用能力”。

针对这一痛点,开源多模态智能体研究推出了 VC-Tooler。该项研究明确提出:视觉工具调用不应被视为对死记硬背参数的拟合,而是一种包含视觉接地(Grounding)、多步组合(Composition)与自适应反思(Adaptation)的通用能力。通过设计覆盖三层能力的层次化轨迹合成流水线,并结合包含工具采纳奖励的两阶段训练架构(冷启动 SFT + Agentic RL),VC-Tooler 在主流基准上取得了开源模型的领先水平:在细粒度视觉感知基准 V* 上达到 $95.8\%$,在多步组合工具基准 VTC-Bench 上达到 $35.3\%$,且在面对从未见过的全新工具接口时展现出极强的零样本泛化能力。

现有方法多停留在单一熟悉工具的调用,而VC-Tooler能够跨步骤组合多种工具并自适应观察反馈

视觉工具调用的核心瓶颈:数据稀缺与模式僵化

纯文本大模型(如通过 Function Calling 驱动的 Agent)之所以能灵活调用各类 API,很大程度上得益于海量真实代码库、丰富接口定义以及成熟的合成文本轨迹。但在视觉领域,构建工具调用的交互轨迹难度呈指数级上升。视觉工具的每一次执行,都会改变图像的状态空间或引入全新的多模态上下文(例如局部裁剪放大后的图像、标注了边界框的新图),这要求执行环境具有完全的可交互性和状态转移能力。

由于缺乏高质量、跨环境的多步交互数据,绝大多数工作只能在一个极其狭窄且封闭的工具集合中进行微调。这就导致模型学到的并不是“如何根据当前视觉缺陷去选择合适工具”,而是“看到特定问答对就机械地触发某个预设函数”。如图 1 所示,面对复杂场景,现有模型往往在调用了一次局部放大后就无法继续,甚至无法理解放大后图像所提供的新信息,更不用说在放大之后衔接锐化、旋转或跨模态检测等后续操作。

要彻底解决这一问题,必须从形式化定义出发,明确视觉工具调用所必需的三项核心底层技能:

  1. 视觉工具接地(Visual Tool Grounding):模型必须准确理解工具的 Schema 规范,将工具调用的输入参数精准定位到当前图像的视觉线索中(如准确预测目标区域的归一化坐标)。

  2. 多步工具组合(Compositional Tool Use):面对单次观察无法解决的复杂查询,模型能自主规划多步工具调用链路,将前序工具的产出作为后序工具的输入,递进式提取关键证据。

  3. 环境自适应(Adaptive Tool Use):工具执行后返回的环境反馈(Observation)可能证实假说,也可能证伪最初的判断;模型需要根据返回的新图像或文本信息重新接地后续决策,并能够灵活迁移到全新的、未曾见过的工具 API 规范上。

VC-Tooler整体框架:层次化轨迹监督冷启动与融入工具奖励的强化学习

层次化轨迹合成:从基础接地到千种接口泛化

为了向模型注入上述三层能力,研究团队构建了一套层次化轨迹生成流水线(Hierarchical Trajectory Synthesis),从大规模原始视觉问答与推理数据中提炼出高质量的多轮互动轨迹。合成过程并不盲目堆砌数据,而是先根据多样性(涵盖丰富多模态场景)、可验证性(具有确定可核对的最终答案)以及智能体相关性(排除了单步感知即可直接回答的平庸样本)进行严格筛选。

在此基础上,合成流水线划分为两个互补的阶段:先规划后执行(Plan-then-Execute)工具上下文重实例化(Tool-Context Reinstantiating)

轨迹合成流程:规划-执行与工具上下文重实例化

在“先规划后执行”阶段,合成系统首先根据问题 $q$、参考答案 $\hat{y}$、输入图像 $v$ 以及当前可用的工具集合 $\mathcal{T}$,生成高层的工具调用规划序列:

\[\pi=(t^{\text{plan}}_{1},\ldots,t^{\text{plan}}_{M})\sim p_{\text{plan}}(\cdot\mid q,\hat{y},v,\mathcal{T})\]

随后进入多步交互循环。在第 $k$ 步,执行策略 $p_{\mathrm{exec}}$ 依据包含过往交互历史的上下文 $h_k$ 与预设步骤 $t^{\mathrm{plan}}_k$,预测当前思维状态 $s_k$ 与工具执行参数 $u_k$:

\[h_{k}=(q,v,s_{1},a_{1},o_{1},\ldots,s_{k-1},a_{k-1},o_{k-1})\] \[(s_{k},u_{k}) \sim p_{\mathrm{exec}}(\cdot\mid h_{k},t^{\mathrm{plan}}_{k}), \quad a_{k}=(t^{\mathrm{plan}}_{k} ,u_{k}),\quad o_{k}=\mathrm{Env}(a_{k})\]

这一机制确保了生成的轨迹在多步串联时具有严密因果逻辑。然而,如果所有多步轨迹都仅绑定在固定的几个工具实现(如基础的 Zoom-in、Crop 等)上,模型依然会走向过拟合。

合成轨迹中的多样化工具接口分布与词云

为了打破这一壁垒,流水线引入了“工具上下文重实例化”。在该步骤中,生成模型会审视状态转移对 $(o_{k-1}, o_k)$ 以及推理状态 $s_k$,在保留原始语义操作逻辑的前提下,将具体的工具调用重写为上千种接口形态各异的模拟有效工具(Mock but Valid Tools):

\[(\tilde{t}_{k},\tilde{u}_{k})\sim p_{\text{ctx}}(\cdot\mid o_{k-1},o_{k},s_{k},\mathcal{T})\]

这一操作让模型在微调阶段接触到了超过 1,000 种各异的视觉工具定义与参数调用规范。模型由此被迫学会去“根据 Prompt 中的 API 文档理解工具”,而不是“记住特定函数的参数签名”。最终的 SFT 轨迹库囊括了单工具基础样本、多工具复杂链条以及多样化上下文样本,为后续训练打下了兼顾广度与深度的结构先验。

两阶段训练:冷启动奠基与工具奖励强化学习

拥有了高质量的轨迹库后,VC-Tooler 采用了“监督冷启动 + 智能体强化学习”的两阶段训练范式。基础模型选用了 Qwen3-VL-8B,全流程基于 ms-swift 与 verl 分布式框架实现。

第一阶段为冷启动监督微调(Cold-Start SFT)。模型在合成的轨迹库上进行标准的自回归交叉熵损失训练,仅计算 Assistant 轮次的 Token 损失。由于训练数据同时注入了单工具操作、多步链式推理与超千种变体接口,模型在不依赖实际环境交互前,就已经建立了对多轮交互协议、视觉坐标映射以及 API 文档解析的基础认知。此外,数据集中还保留了少量无需工具的直接推理样本(如来自 ChartVerse 的数据),以防止模型形成“无论遇到什么问题都强行调用工具”的过度依赖。

进入第二阶段后,研究团队采用基于 GRPO(Group Relative Policy Optimization) 的强化学习算法,对策略模型进行环境对齐。多模态工具 RL 面临的一个核心挑战是奖励稀疏:如果仅仅根据最终答案的对错给出稀疏的二值奖励,模型很容易产生欺骗性行为——通过胡乱调用工具拖延轮次,或者在根本没有利用工具返回结果的情况下靠基座模型的幻觉蒙对答案。

为了引导模型真正利用工具产生的观察结果,VC-Tooler 设计了一种精细的复合奖励机制:

\[R_{\text{total}} = 0.8 R_{\text{acc}} + 0.2 R_{\text{tool}} + 0.2 R_{\text{fmt}}\]

其中,$R_{\text{acc}}$ 代表最终答案的准确性奖励;$R_{\text{fmt}}$ 为格式奖励,严格约束模型的思考标签 <think>、工具调用标签 <tool_call> 以及最终输出结构;最关键的创新在于 $R_{\text{tool}}$(工具反馈采纳奖励)。该奖励不仅仅评估模型是否调用了工具,而是深入判定模型在工具执行返回新视觉观察 $o_k$ 之后,其后续生成的思考过程 $s_{k+1}$ 是否实质性地引用、分析了 $o_k$ 中的视觉特征。如果模型调用了工具却对其返回的证据视而不见,或者反复调用冗余工具,该项奖励就会予以抑制。

这种设计迫使强化学习梯度的更新方向聚焦在“推理决策与工具反馈的深度耦合”上,彻底杜绝了模型把工具当成摆设的形式主义调用。

实验评测:全场景性能跃升与零样本迁移

评估体系涵盖了两大维度:通用高分辨率理解基准(V*、HRBench-4K/8K、CharXiv、MME-RealWorld)与专注智能体交互的评测基准(VTC-Bench、TIR-Bench)。在推理阶段,系统结合 Qwen-Agent 与 vLLM,支持长达 10 轮的动态交互。

从整体表现来看,VC-Tooler 在所有开源多模态智能体模型中均取得了极具竞争力的成绩。在衡量细粒度视觉感知的 V* 基准上,模型取得了 $95.8\%$ 的高分,证明其通过精准的局部工具调用大幅弥补了原始 Vision Encoder 在超高分辨率下的信息折损。而在专为多步工具组合设计的 VTC-Bench 上,模型得分达到了 $35.3\%$,显著拉开了与传统只具备单步工具调用能力开源模型的差距。

更具启发意义的实验来自于工具空间发生变动时的鲁棒性分析。研究人员设置了四种完全不同的推理环境:

不同工具空间配置下各模型的性能趋势:VC-Tooler在混入全新工具(Mixed)时依然保持稳健甚至正向迁移

如图 5 所示,现有的大多数多模态 Agent 在工具空间改变时表现出了极大的脆弱性。当从未见过的工具被引入提示词中时,许多传统模型的表现甚至低于不使用任何工具的基线,这是因为它们无法应对陌生的参数格式与文档干扰。

相比之下,VC-Tooler 在混入未见工具的 Mixed 环境下,性能不仅没有崩溃,反而与原生环境持平甚至有所超出。这一现象有力地证明:经过多样化接口合成数据微调与 RL 训练后的 VC-Tooler,真正掌握了基于上下文 Schema 解析工具逻辑的能力,而非死记特定的 API 调用模态。

VC-Tooler多步组合与自适应工具调用的典型推理案例

在实际的案例可视化中(图 6),VC-Tooler 展现出了清晰的自适应行为。面对一张极低对比度且主体被严重遮挡的图表,模型首先调用了局部剪裁放大工具获取潜在区域;当发现放大后的区域存在严重的过曝与角度倾斜时,模型并未草率给出答案,而是自发在下一步组合调用了色彩平衡与仿射变换工具,最终在新生成的清晰观察中提取到了微小的数值证据。整个决策链条展现出了高度拟人化的探究式推理特征。

消融实验:SFT结构先验与RL奖励的深层互动

为了解开各技术模块对最终策略模型的贡献度,研究团队对 SFT 数据配比与强化学习奖励函数进行了细致的剥离分析。

1. SFT 数据成分对下游 RL 的长远影响

消融实验对比了三种不同训练数据构成的演化路径:基础单工具接地(ST)、多工具组合(MT)以及多样化工具上下文(DTC)。

一个反直觉却极其深刻的发现是:在仅完成第一阶段冷启动 SFT 时,同时加入了高难度 MT 和 DTC 数据的模型,其在部分基准上的表面指标甚至略微低于单纯训练 ST 的模型。原因在于,强行让模型在监督阶段模仿包含上千种接口的复杂长轨迹,具有更高的拟合难度。

然而,一旦进入第二阶段强化学习,局面发生了根本性逆转。只训练了 ST 的模型在 RL 阶段很快遇到性能瓶颈,因其缺乏多步推理与接口泛化的先验,策略探索极其容易陷入局部最优;而吸收了 ST、MT 和 DTC 完整数据的模型,在强化学习的打磨下潜力被彻底释放,在 HRBench-8K 上从仅使用 ST 的 80.4 分一跃提升至 83.8 分,VTC-Bench 更是达到 35.3 分。这说明,SFT 数据的价值不能仅由冷启动结束时的即时准确率来判定,即便某些复杂的合成数据难以被完美拟合,它们所赋予模型的结构先验(Structural Priors)依然为后续的强化学习提供了不可替代的探索边界。

2. 工具采纳奖励的必要性

在强化学习阶段,团队对比了三种不同的奖励函数设计方案:

评测数据明确显示:单纯给予“工具存在奖励(TE)”不仅没有带来增益,反而导致模型在所有基准上的表现全面恶化。这是因为盲目的存在性奖励诱导模型产生了“套利行为”——模型学会了在回答每个问题前毫无意义地调用一次缩放工具,以此骗取基础分,反而破坏了原有视觉主干直接感知的流畅度。

只有当奖励信号绑定在“工具反馈是否实质性驱动后续推理”上时,模型才真正学会了审时度势。如强化学习前后的工具调用分布图所示,经过有效 RL 训练的模型并没有盲目增加调用频次,而是在简单样本上收敛到更精简的单步或无工具推理,在长尾难例上则自主演化出更多步骤的组合调用,呈现出高度动态的任务敏感性。

强化学习前后工具调用分布与平均调用次数的变化对比

走向自主演进的多模态智能体

VC-Tooler 的突破为大模型与多模态智能体领域提供了关键启示:让多模态模型使用工具,绝不是提供几个 API 描述然后微调参数那么简单;工具调用的本质是视觉证据的动态更新与主动探索。

通过将工具使用解构为视觉接地、链路组合与环境自适应,并结合大规模的接口重实例化合成,VC-Tooler 成功让 8B 级别的开源视觉语言模型突破了“固定接口依赖”的桎梏。随着强化学习范式在多模态领域的深入推进,赋予模型主动操纵环境、采集视觉证据并自发验证假说的能力,将是通向更可靠、更自主的物理世界与数字世界智能体的核心必由之路。