ToolVision:能力对齐解决工具调用失灵,8B模型跨级超越32B!

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

ToolVision:能力对齐解决工具调用失灵,8B模型跨级超越32B! 论文图示

让多模态大模型“学会像人类一样思考并操作工具”(Thinking with Images),正成为提升视觉感知极限的核心路线。由于单一前向推理对超高分辨率图像、密集文本或微小目标的感知能力有限,让模型在推理过程中编写代码,主动调用裁剪、缩放、OCR 识别或目标检测器,理论上能以极小的参数代价获得越级挑战强感知模型的能力。

ArXiv URL:https://arxiv.org/abs/2608.08907v1

然而,在当前的“监督微调(SFT)接强化学习(RL)”经典管线中,这一设想在 8B 尺度的开源模型上屡屡碰壁。复旦大学、上海交通大学与中国科学院大学的研究团队在一篇最新工作中指出:传统训练流存在两处致命的“能力不对齐”(Capability Misalignment)。SFT 阶段本该教会模型“如何用工具”,但直接蒸馏强教师模型生成的轨迹,让小模型染上了“照猫画虎”的坏毛病——它学到了调用工具的语法表面模式,却没有教师模型的原始感知底子,盲目预测裁剪坐标导致次次扑空;RL 阶段本该教会模型“何时该用工具”,但只看最终答案对错的单一奖励使得调用工具变成极高风险的负累,引发“工具退化”,模型最终完全不敢调工具;反之,若盲目对工具调用给予固定加分,又会导致模型无节制地进行空转和无效翻转。

为了彻底纠正这两种扭曲,研究团队提出了名为 ToolVision 的能力对齐视觉工具调用框架。ToolVision 在 SFT 阶段通过多智能体管道探索轨迹,并由包含学生尺寸模型的委员会量化评估逐步证据增益,只保留学生真正能吸收的有效轨迹;在 RL 阶段,离线对比冻结 SFT 模型在有无工具下的表现差异,仅在工具确实能带来净收益的问题上激活工具成功奖励。在七大主流多模态基准测试中,仅有 8B 参数的 ToolVision-8B 全面超越基座模型,在高分辨率基准上击败了 Thyme-7B、CodeVision-8B 和 CodeDance-7B,甚至在 V* 和 HRBench 8K 上击败了 32B 规模的 Qwen3-VL-32B-Thinking。

视觉工具在经典 SFT 与 RL 管线中的两类典型失效模式

经典工具训练范式的两重困境

要理解 ToolVision 的精妙之处,首先必须看清过往代码化工具调用(Code-as-Tool)训练策略为何总在小模型上失效。

第一重困境发生在 SFT 阶段的“如何用工具”(How to Use)。以往研究普遍依赖 Qwen-Max 或闭源大模型等强教师模型生成多轮工具调用轨迹,随后直接对学生模型进行行为克隆。然而,教师模型具有极其敏锐的原生视觉感知能力,在面对一张大图时,强教师往往一眼就能大致估算出目标物体在图中的像素范围,从而直接在 Python 代码中写出绝对裁剪坐标 crop(x1, y1, x2, y2)。然而,8B 规模的学生模型根本没有这种“肉眼定坐标”的高精度空间感知力。学生模型在模仿了教师的这一代码模式后,面对具体问题时依然只会生硬地预测数值坐标,结果往往裁剪到空地或切偏边缘,反而丢失了关键线索。教师的成功依赖于学生无法复现的隐含感知,这种监督信号的错位让微调后的学生模型徒有调用工具的架势,却得不到有用的感知增益。

第二重困境发生在强化学习阶段的“何时用工具”(When to Use)。在进入大模型后训练阶段时,RL 往往肩负着激发策略探索的重任。如果在这一阶段使用纯结果导向的奖励机制(Outcome-only Reward),即最终答案答对给正分、答错给零分,就会引发灾难性的“工具使用萎缩”。因为调用工具需要经历代码生成、沙盒运行、工具回传和中间信息理解四个环节,只要有一处报错就会全盘皆输;相比之下,直接蒙一个答案或者靠直觉回答,反而能避开复杂的长链路风险。实验数据显示,在结果导向优化下,随着模型总奖励逐步攀升,每个回答的平均工具调用次数迅速降为零,策略彻底退化为放弃工具。

如果为了保住工具调用,生硬地在奖励函数里加上“只要用了工具且回答正确就给固定额外奖励(Uniform Bonus)”,局面又会走向另一个极端。模型会敏锐地抓住规则漏洞,在原本一眼就能看穿的问题上疯狂调用“重载原图”、“旋转 360 度”或“无意义对比度调整”等操作,刷取工具奖励。这不仅大幅拉低推理效率,还因为引入大量噪声图像而直接损害了最终的答题准确率。

证据增益剪枝:构建能被学生消化的有效 SFT 轨迹

针对 SFT 阶段教师与学生之间的感知不对齐,ToolVision 放弃了由单一强教师直接“口述答案与轨迹”的做法,转而设计了一套基于证据增益(Evidence Gain)评估的多智能体生成流程。

ToolVision 的能力对齐 SFT 数据构建管道

该流程的核心思想是:强模型(如 Qwen3.6-plus)只充当候选动作的“提议者”(Planner)和执行沙盒代码的“实现者”(Executor),而不充当最终的裁判。在一个包含密集文本阅读、微小物体计数、多步空间推理的公共任务数据池中,如果基座模型不需要工具就能直接答对,该问题就被保留为简短的直接回答样本,以确保模型不会丧失裸机推理本能;如果基座模型答错了,该样本才会进入规划搜索循环。

在多轮交互中,Planner 观察当前积累的视觉与文本证据,提出至多两个候选工具动作并由 Executor 生成 Python 脚本投入沙盒运行。系统集成的异构工具库极其完备,既包含 OCR 引擎、开放词表检测器与分割模型、单目度量深度估计器、开放世界计数器等专业模块,也包含裁剪、旋转、对比度微调等纯图像变换操作。

更关键的环节在于随后的分支剪枝机制。当工具执行返回了新的中间图文结果 $z_t$ 并追加到累积证据 $E_t$ 后,ToolVision 并不假设这一步必定有用,而是引入了一个由 8 个不同尺度模型组成的评审委员会(Committee),其中明确包含了学生模型同等尺度的轻量级多模态模型。评审委员会在给定当前累积证据 $E_t$ 的前提下对问题进行作答,并计算平均得分 $J(E_t; x)$。这一步产生的边际证据增益被严格量化为:

\[\Delta_t = J(E_t; x) - J(E_{t-1}; x)\]

只有当 $\Delta_t$ 显著为正,即新增的工具返回结果切实帮助到了委员会中的小模型回答问题时,这一步分支才会被保留;否则,即使该操作在语法和执行逻辑上完全正确,也会被视为无效分支直接剪除。通过这种方式,只有那些最终顺利跑通且答案正确、每一步都真正产生可用证据的轨迹,才会被并入最终的 SFT 训练集(共计 4,057 条)。

这种严苛的对齐机制带来了一个显著的行为变化:学生模型不再盲目学习教师“靠肉眼猜坐标裁剪”的坏习惯,而是学会了将定位任务委派给工具箱里的开放词表检测器。由检测器返回高精度边界框后再进行裁剪,使小模型能够稳健地获取到放大的清晰目标。

必要性感知强化学习:按需激活的奖励机制

完成了 SFT 阶段的矫正,模型已经具备了“如何正确产生有用证据”的实操能力,但何时该出手、何时应收手,仍需要在 RL 阶段进一步厘清。

ToolVision 在强化学习环节采用了基于序列的分组策略优化算法(GSPO)。为了解决传统奖励机制在“不敢用”与“瞎滥用”之间走极端的矛盾,研究团队提出了“必须使用工具”(Must-Use-Tool, 简称 MUT)的必要性感知机制。这一机制坚信:一个问题是否需要调用工具,是与模型本身的能力紧密绑定的(Model-conditioned)。对于一个 32B 甚至更庞大的旗舰模型而言可以一眼看清并直接回答的问题,在 8B 尺寸的冻结 SFT 模型上可能就必须依赖 OCR 或检测器放大;反之,若某个问题即使给出了工具,小模型调用后依然无法答对,那么在训练中强行诱导它使用工具也毫无意义。

因此,ToolVision 在正式启动 RL 训练之前,对冻结后的 SFT 检查点进行了一次离线基准测试。针对训练池中包含图表理解、科研图表、空间推理和计数的 24,921 道问题,分别在“禁用工具”和“启用工具”两种设定下进行多轮采样展开,据此判定该问题对当前模型的必要性置信度 $w(x, \pi_{\text{SFT}})$:

对于那些禁用工具时几乎全错、启用工具后成功率显著上升的高收益问题,标记为强 MUT 问题,赋予最高置信度权重;对于工具带来收益不明显的标记为弱 MUT 问题;而对于本来就能直接答对或即便调用工具也无法解决的问题,则归入普通问题,将其工具加分权重置零。

在后续的 RL 策略更新中,全局奖励函数被精细设计为:

\[R = R_{\text{acc}} + \lambda R_{\text{proto}} + w(x, \pi_{\text{SFT}}) R_{\text{mut}} - \mu \max(0, n - \tau)\]

其中,$R_{\text{acc}}$ 为最终答案正确性奖励,$R_{\text{proto}}$ 规范代码格式与交互协议,最后一项对超出阈值 $\tau$ 的多余调用步数实施轻微惩罚。最关键的设计在于 $w(x, \pi_{\text{SFT}}) R_{\text{mut}}$:只有在该问题已被离线确认为“必须用工具且能带来净增益”时,成功使用工具才能拿到额外的 MUT 奖励加成。在那些普通问题上,$w = 0$,模型即使答对也拿不到额外的工具红利,从而彻底失去了无病呻吟式滥用工具的动机;而在强 MUT 问题上,这笔额外的奖励又足以对冲掉多步代码执行的潜在风险,有力拉动了模型的工具探索欲望。

实验评测:从多维度基准到跨级超越

研究团队在包含高分辨率感知、文本图表、真实世界场景、科研图解和计数等九大基准测试上对 ToolVision-8B 进行了系统性评测。

在七大核心公开基准上,ToolVision-8B 相较于 Qwen3-VL-8B-Thinking 基座模型展现出了统治级的提升:在真实世界综合基准 MME-RealWorld-Lite 上,得分从 46.9 跃升至 59.5(净增 12.7 分);在中文评测 MME-RealWorld-CN 上,从 57.4 提升到 68.7(净增 11.3 分);而在衡量精细感知的 HRBench 4K 上,成绩从 72.4 提升到 81.4(净增 9.0 分)。

更具说服力的是与同类代码工具增强系统的横向对比。在当前最具代表性的三大 Code-as-Tool 系统中,Thyme-7B 在高分辨率基准 V* 上的得分为 82.2,CodeVision-8B 为 82.4,CodeDance-7B 为 84.8;而 ToolVision-8B 一举达到 85.9。不仅如此,在 HRBench 8K 这一极其考验极端分辨率感知的测试中,ToolVision-8B 录得 75.9 分,同样全面压制了上述三个专用系统。

最为亮眼的一组对比发生在跨尺寸模型的竞争中。参数量仅为 8B 的 ToolVision-8B,在 V*(85.9 vs. 84.8)和 HRBench 8K(75.9 vs. 74.8)两项硬核指标上,正面击败了参数规模近其 4 倍的 Qwen3-VL-32B-Thinking。这一表现直接印证了工具调用的杠杆价值:通过给较小尺寸的模型装上“思考并精准调用专门工具”的臂膀,完全可以补足甚至超越更大模型仅凭隐式前向感知所能触达的精度天花板。

在特定领域的极端任务上,工具的加持更为明显。在面向学术论文图表精细阅读的 ArxivQA-2k 测试中,ToolVision-8B 的准确率从基座的 58.3% 飙升至 74.5%(提升 16.2 个百分点);而在密集物体计数基准 FSC-147-test 上,平均绝对误差(MAE)从基座的 44.7 骤降至 11.6,相对误差直接缩减了 74%。

深度消融:模型到底学会了怎样的工具行为?

一系列阶段消融实验进一步撕开了模型能力演变的黑盒,证实了 ToolVision 针对两阶段不对齐所做设计的不可替代性。

在 SFT 阶段的对比中,如果使用未经对齐的传统蒸馏方法(Distilled SFT,即直接拟合强教师的工具轨迹),模型在三大高分辨率基准上的准确率全面落后 ToolVision SFT 达 8 到 17 个百分点。深入的行为分析揭示了这一差距背后的根本原因:传统蒸馏微调的模型虽然在 54% 至 74% 的问题上都在疯狂调用裁剪,并且耗费了 2 到 3 倍的推理轮次,但其调用基于检测器引导裁剪(Detection-guided crop)的比例竟然是 0%。这说明它彻底继承了强教师直接写坐标的恶习,却根本没有瞄准目标的能力;而经过 ToolVision SFT 微调的模型,有 29% 到 35% 的裁剪操作完全交由检测器定位来引导,以更少的轮次换取了极高精度的局部证据。

更耐人寻味的是,哪怕在 Distilled SFT 的产物上继续施加后续的 MUT 强化学习(即 Distilled SFT + MUT RL),最终模型的整体准确率依然全面输给完整的 ToolVision-8B。在随后的三项基准测试中,该对比组调用检测器引导裁剪的频率依然趋近于 0(仅为 0.0%、0.5% 和 0.1%)。这充分证明:后训练阶段的强化学习本质上是在激活和重新加权模型已经在 SFT 阶段建立的“实用支撑区”(Practical Support);如果模型在 SFT 阶段根本没有学会可执行的合理工具调用逻辑,单纯依靠后期的 RL 探索,小模型几乎不可能凭空跨越复杂的长链路去发现最佳工具路径。

而在完整的 ToolVision-8B 策略下,模型在经历强化学习后展现出了令人惊叹的自适应专精化:面对 FSC-147 计数任务时,调用专门计数工具的比例达到了 100%;面对 OCRBench 任务时,OCR 工具的调用比例达到 84%;在 V* 视觉搜索中,开放词表定位工具的调用比例稳定在 72%;与此同时,曾经极易造成灾难性翻车的无感知手动坐标裁剪在所有基准测试中几乎彻底清零(全线低于 0.1%)。

启示与未来

ToolVision 的核心贡献,不仅在于刷出了一组亮眼的评测分数,更在于它为多模态智能体(Agent)系统的训练范式提供了一剂清醒剂。

长期以来,业内在构建多模态长思维链或工具智能体时,往往习惯性地套用纯文本大模型的“教师蒸馏 + 结果奖励”思维定势。但视觉感知在物理世界中的异构性决定了:强模型的“看”无法直接套给弱模型的“看”。如果只教表象不审视证据可用性,蒸馏出来的不过是花架子;如果只看对错不考虑能力局限,强化学习奖励就会变成毒药。

ToolVision 通过“步骤级证据增益”和“模型条件化的必要性门控”,成功把工具学习拉回到了能力对齐的正轨。这一框架不仅证明了开源 8B 模型借助代码与工具足以实现“以下克上”,也为未来更多端侧、轻量级具身智能体如何高效接入复杂外部 API,提供了一套高度自动化、无需额外人工标注且自洽落地的演进方案。