SpeechAgent-R:让音频大模型学会按需调工具,泛化推理提升15分

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

现有的多模态音频大模型(LALM)在处理常规的语音转录、语种识别或简单问答时已经表现出色,但在面对真实复杂的声学环境时,依然经常遭遇系统性瓶颈。当一段长音频中同时混杂着多人交叠说话、强背景噪声、混响以及空间声源变化时,人类通常不会试图“一口气听出所有答案”,而是先借助声学先验,逐步对声源进行空间定位、分离目标人声、比对说话人声纹,最后再进行语义理解。每一步决策,都依赖于前一步操作所返回的中间声学或文本证据。

ArXiv URL:https://arxiv.org/abs/2608.01881

传统的大音频语言模型由于受限于固定的黑盒参数化推理,缺乏在推理阶段主动调用声学工具、获取外部增量观测并动态调整后续行动的能力。哪怕给大模型配上工具接口,模型也往往难以在多轮交互中掌握复杂技能的调度逻辑,容易陷入工具选错、参数乱传、甚至直接无视工具返回结果的窘境。

针对这一问题,最新研究提出了“听、调用、理解”(Hear–Invoke–Understand,简称 HIU)的全新范式,并开发了具备技能调度能力的多模态音频 Agent —— SpeechAgent-R。研究团队构建了包含 65,492 条交互轨迹、时长达 507.6 小时的音频交互语料库 HIU-Corpus,通过“轨迹级有监督微调(SFT)+ 多轮群组相对策略优化(GRPO)强化学习”的两阶段训练,使模型学会了根据即时声学线索与技能文档自主编排工具链。在兼顾分布内(ID)与强分布外(OOD)迁移评测的全新基准 HIU-Bench 上,SpeechAgent-R 取得了 80.05 的总分,相较于同等运行环境下的基座模型大幅提升了 15.04 分,在未见过的 OOD 工具流组合上同样取得了 14.23 分的显著增长。这项工作标志着音频大模型正从被动接受输入的“静态端到端听觉器”,演进为能够主动探测、介入并推理解释声学环境的“交互式智能体”。

HIU 框架总览:听、调用与理解的闭环

从“死记硬背”到“按需探查”:音频推理范式的转变

过去几年,音频大模型的技术演化路径大多遵循着与视觉多模态类似的脉络:通过扩大参数量、构建海量音频问答对、在更长上下文音频上进行自回归预训练。然而,固定输入的端到端推演存在着先天的信息瓶颈。当声学信号本身模糊不清、混叠严重或包含复杂空间信息时,强行让单一网络在单次前向传播中完成从原始波形到复杂高阶语义的跨越,往往会导致严重的音频幻觉或逻辑混乱。

在纯文本领域,Agent 已经可以通过阅读工具文档(Tool Documentation)和 API 规范,自主拆解问题并分步调用搜索、代码执行器或数据库。但将这一机制迁移到音频领域并不容易:

一方面,现有的音频 Agent 方案大多存在割裂。有的方法仅用一个纯文本大模型充当“总调度”,通过调用一系列独立的音频分析小模型来拼凑结果,调度器本身完全丧失了原生的多模态感知能力,无法听到原始音频中的细微语气与声学质感;有的方案虽然引入了强化学习来进行单步工具路由,却缺乏多轮工具链协同编排的能力;还有的方案仅支持让模型回听同一段音频切片,无法引入新的声学算子去实质性改变或增强输入信号。

另一方面,更深层的难点在于“技能抽象与动态协同”。在真实的声学解决过程中,工具往往不是孤立存在的。例如,语音分离工具需要依赖空间到达角定位的参数,而说话人确认工具又需要等待分离后的纯净语音片段输出。这就要求音频模型必须能够理解抽象的“技能(Skill)”定义,在多步交互中将前一步工具吐出的文本摘要或者处理后的中间音频作为全新的上下文,与原始声学场景深度对齐,进而迭代推导出下一步决策。

HIU 框架的核心思想正是打破这种静态限制:将音频复杂问题求解重构为一个动态的执行轨迹 $\tau={(h_{k},a_{k},o_{k})}_{k=1}^{K}$。模型先调用原生感知听到原始输入,再根据需求检索技能文档并触发工具,最后吸收工具返回的多模态观测,直至得出最终答案。

HIU-Corpus:从任务到可执行技能的高质量轨迹构建

要让多模态模型学会这一复杂的推理闭环,最大的瓶颈在于缺乏具备长程交互轨迹的高质量多模态数据。现有的音频理解数据集大多只有“输入音频 - 提问 - 最终答案”的三元组,完全抹去了中间求解的思考与调用过程。

为此,研究团队设计了一套三阶段数据构建流水线,打造了规模达 65,492 条轨迹的 HIU-Corpus 数据集。

HIU-Corpus 与 HIU-Bench 的系统化构建流水线

构建流水线首先从 24 个需要复杂声学推理的任务切入,覆盖语音识别、重叠语音分析、说话人辨识、音频真实性鉴别以及复杂声学事件检测等领域。为了进一步贴近真实世界的严苛声学条件,数据管线引入了音频动态混叠、时间重叠注入以及空间混响渲染等操作,人为提高声学特征的解析难度,确保任务无法通过单次端到端盲猜解决。

其次,研究团队摒弃了“任务即工具”的僵化映射,引入了“技能(Skill)”这一层抽象机制。多个具有相似目标但需要组合不同算子的场景被归入同一技能类目下。例如在特定空间音频处理技能中,可能同时包含方向估计、波束成形以及降噪工具。针对每一个技能,团队手动编写了规范的自然语言技能文档,详细定义输入输出协议、适用边界与组合策略,并通过前沿大语言模型进行规则覆盖度与接口清晰度的多轮迭代校准。

在最关键的轨迹合成阶段,研究团队根据任务类型分流生成:对于简单声学特征支持直接作答的样本,让基座多模态模型生成端到端显式推理轨迹;而对于需要借助外部算子的样本,则在真实环境中执行工具链,记录工具的实际输出(包括结构化文本或中间生成的声学切片),再将问题、工具反馈与技能文档输入超大参数规模的语言模型合成完整的决策逻辑链。为了避免外部工具偶发的不稳定或错误反馈污染训练监督信号,流水线还引入了严格的自动化逻辑一致性验证,对异常的中间观测依据标准标注进行校正。

最终建成的 HIU-Corpus 中,有 87.6% 的轨迹包含外部工具调用,10.7% 包含复杂的多工具链式调用,交互轮数最高达到 10 轮,平均达到 3.24 轮,为后续 Agent 的行为克隆与策略对齐打下了坚实的数据基底。

SpeechAgent-R 的两阶段进化:轨迹 SFT 与多轮 GRPO

拥有了高质量的数据轨迹后,如何高效训练音频 Agent?直接进行端到端无约束强化学习往往会导致行动空间过大而极难收敛,而仅依靠有监督微调又容易导致模型在面对未见过的交互分支时缺乏容错与策略自愈能力。研究团队因此采用了两阶段训练范式:先通过轨迹级 SFT 建立结构化的调用规范,再通过多轮强化学习实现决策优化。

SpeechAgent-R 的两阶段训练与多轮交互示意图

轨迹级监督微调(Trajectory-based SFT)

模型以全模态思考模型 Qwen3-Omni-Thinking 为起点。在 SFT 阶段,训练目标仅对 Agent 自主生成的思考 Token、技能检索指令以及工具调用参数进行交叉熵损失计算,而将外部环境返回的声学信号观测、文本状态以及系统 Prompt 完全掩蔽(Mask)。这种做法让模型专注于学习两件事:什么时候应该停止思考发起调用,以及如何精准提取上下文中的关键实体来填补工具参数。

多轮群组相对策略优化(Multi-turn GRPO)

单纯的模仿学习容易让模型对特定任务模式产生机械依赖。当工具返回了非预期的格式、或者第一步工具给出了模棱两可的弱置信度结果时,SFT 模型往往会机械地执行下一条既定指令,无法根据反馈自适应修正。

为此,团队引入了面向多轮对话场景定制的 GRPO 强化学习框架。在微调后的 Thinker 模块线性层上挂载 LoRA 适配器,针对每个音频查询采样 $G$ 条候选交互轨迹,并设计了一个多维联合奖励函数:

\[R(\tau) = \lambda_f R_f(\tau) + \lambda_t R_t(\tau) + \lambda_a R_a(\tau)\]

该奖励函数从三个维度精准约束 Agent 行为:

在最终权重设置上,团队采用了 $(0.05, 0.25, 0.70)$ 的配置。实验证明,过分抬高答案奖励权重(例如提升到 0.8 以上)会导致模型铤而走险尝试端到端“盲猜”,进而破坏工具调用的稳定性;而赋予交互过程足够的相对比重,才能引导模型在多轮试错中探索出更具弹性的工具组合路径。

HIU-Bench 评测:在未见过的技能世界中真正泛化

评估一个音频 Agent 是否真正具备通用的工具协同能力,关键在于它能否迁移到训练集未涵盖的工具和全新工作流中。以往的很多基准将评测集与训练集限制在相同的工具库下,极易掩盖模型的记忆过拟合现象。

为此,研究团队专门构建了评测基准 HIU-Bench,总共包含 56 个任务、1,395 个独立样本。该基准被严格划分为两大板块:

这一严苛的设置要求模型在面对 OOD 任务时,必须纯粹依赖现场阅读技能说明书,当场理解新工具的功能边界,并在缺乏任何先验样本示范的情况下,将新工具即兴组合成解决路径。

评测结果清晰地揭示了不同架构与范式之间的鸿沟:

在不接入外部工具的直接作答(Direct)模式下,所有前沿模型在复杂音频任务上的表现普遍不尽如人意,整体得分仅在 33.90 到 45.89 之间徘徊。面对声源空间混叠与强噪声,纯内生推断遇到了难以逾越的物理表征限制。

而在赋予了统一的 Agent 外部调用 Harness 环境后,各模型的表现开始分化。像 Gemini-3-Flash 这类通用大模型在接入工具后总分从 42.22 跃升到 68.08,表明其拥有较强的常识推理底座;然而部分专用模型如 Kimi-Audio,即便在能够获取工具的环境下,得分也仅有 26.60,大量调用因格式错误、参数类型不符以及陷入死循环而崩溃。这说明直接给音频模型开放 API 接口,并不能自然孵化出可靠的 Agent 行为。

经过 HIU-Corpus 轨迹微调后,SpeechAgent-SFT 在相同 Agent 环境下总分提升至 75.20 分。而进一步经过 GRPO 强化的 SpeechAgent-R 达到了全场最高的 80.05 分:在 ID 分支取得 84.17 分(相比基模提升 15.40 分),在 OOD 分支取得 70.94 分(相比基模提升 14.23 分)。

更值得关注的是错误分布的结构性变化。对 OOD 失败案例的深层统计表明,从 SFT 进化到强化学习后,模型出现“选错工具”的失败占比从 32.4% 下降了近三分之一,而“未能有效利用工具返回结果”的失败占比也减少了 16.3%。强化学习并未给模型灌输任何新的外挂工具知识,但它教会了模型如何在不确定的多模态交互中动态规划,降低了盲目试探的试错代价。

SFT 与 RL 模型的典型案例对比:工具选择与反馈利用的显著差异

进阶剖析:Agent 的能力边界与瓶颈究竟在哪?

为了进一步探究 SpeechAgent-R 的核心动力来源,研究人员在固定外部工具性能的条件下进行了工具层面的逐项分析,并构建了理想工具(Oracle Tool)对照实验。

在针对各工具实际表现的评估中,基座模型、SFT 模型与最终的 SpeechAgent-R 在工具底层算子的纯输出指标上(例如 ASR 的字符错误率、降噪信噪比等)几乎处于同等水准(分别为 72.0、74.5 与 75.5)。这意味着,性能的飞跃并不是由外挂算子能力的改变带来的,完全归功于 Agent 侧对于何时调、调哪个、怎么组合工具的策略优化。

那么,制约当前音频 Agent 继续向更高上限突破的瓶颈到底在哪里?研究团队将真实的工具输出替换为真值标注(Ground Truth),消除了所有外部工具的执行误差与噪声:

在此理想环境下,SpeechAgent-R 的整体评分从 84.2 进一步推高到了 91.4。其中,工具调用准确率(Tool-call Score)仅微微上升,而最终答案得分(Answer Score)从 78.6 剧增到 88.5。这一对照揭示了一个关键的技术事实:在当前的训练机制下,Agent 的技能选择与工具调用逻辑已经高度收敛并趋近可靠;制约系统进一步演进的核心制约,重新回到了“外部工具的实际精度”以及“大模型本体消化多模态复杂观测的理解深度”上。

如典型案例中的对比所示,当外部声学分离工具由于声学重叠极度严重而给出了略有残损的人声片段时,SFT 模型往往会机械地将残损片段认定为全部事实,直接得出错误结论;而经过强化学习对齐的 SpeechAgent-R 能够将这个“残损的中间声学观测”与最初听到的全局环境音频进行交叉互证,凭借自身的多模态推理能力修正工具反馈的局限,最终锁定目标说话人的身份。这种在外部工具能力与内生理解之间的弹性互补,正是以往单纯的 API 级联系统所无法企及的特质。

总结与展望

传统的纯端到端音频大模型在处理结构复杂、信噪比低的深层声学任务时,正逐步显露出物理推断能力的局限。SpeechAgent-R 的探索为下一代多模态系统的演进提供了一条极具说服力的解题思路:通过建立规范的技能抽象体系,配合轨迹数据挖掘与多轮交互强化学习,大模型完全可以成为一个具有主动感知、自我反思与工具协同意识的“声学探员”。

这一成果的意义不仅在于刷新了若干音频基准的量化指标,更在于它打通了大模型从“固定声学上下文的被动解码”到“开放交互环境下的主动决策”的关键鸿沟。随着后续接入的专业工具库进一步扩充,从声学传感器阵列控制、水下声呐信号排查,到复杂的智能座舱多轮声场调度,具备技能调用能力的音频 Agent,正展现出深入真实物理世界声学复杂系统的广阔潜力。