从碎片化到全场景扩展!AgentOmnia将四榜宏平均提升至41.69%
AgentOmnia: Scaling Agentic Models for Full-Scenario Applications

大语言模型在智能体(Agent)方向的进化一日千里,但一个令许多开发者感到挫败的现象依然存在:在某个框架或基准测试中表现卓越的“高分智能体”,一旦被放入全新的工具生态、面对跨系统的长周期任务,或是遇到难以预测的用户追问时,往往会迅速崩溃。当前的智能体进展在很大程度上是“碎片化”的,零散地分布在不同的应用领域、能力维度和交互协议中。
ArXiv URL:https://arxiv.org/abs/2607.23124v1
这篇由华为团队主导的研究,正是为了终结这种碎片化局面。作者明确提出了“全场景智能体扩展(Full-scenario agentic scaling)”的概念,并带来了全新的解决方案:AgentOmnia。这一框架建立了一个统一的三维坐标系,将任务定义、数据合成、后训练、评估乃至持续改进,全部纳入一个可追溯、可迭代的闭环体系之中。最为独特的是,AgentOmnia 引入了工业界非常熟悉的“产品需求文档(PRD)”机制,让模型像产品经理一样,根据自身的失败经历自动生成演进需求。
结果极具说服力。以 Qwen3-30B-A3B-Thinking-2507 为基础模型,AgentOmnia 不仅在极具挑战性的 OmniaBench 子集上将任务通过率从 9.16% 大幅提升至 37.11%,还在包含 OmniaBench、$\tau^2$-Bench、DeepPlanning 和 VitaBench 的四个权威基准测试中,将宏观平均分从 22.86% 提升至 41.69%。凭借统一的评估协议,它甚至跨级别超越了参数量大得多的 Qwen3-235B-A22B-Thinking-2507 模型。这些数据的背后,是一场关于智能体如何摆脱“应试教育”、走向真实全场景落地的系统性重构。
高分低能背后的“盲人摸象”
要理解 AgentOmnia 为什么重要,必须先看清当下智能体生态面临的三大结构性障碍。目前的基准测试大多围绕有限的特定平台或交互模式展开,具有相同聚合总分的模型,其底层的能力图谱可能天差地别。一个擅长处理 API 调用的模型,可能完全不具备维持全局状态约束或从错误中恢复的能力。
第一个障碍在于覆盖度与诊断的脱节。现有的数据集和评估体系缺乏一个共享的坐标系。当你拿到一个糟糕的测试分数时,你很难知道究竟是模型不懂电商领域的知识,还是它缺乏多步逻辑规划的能力,抑或是它应对环境干扰的鲁棒性太差。数据构建、训练和评估各自为战,总分无法为下一步的迭代指明方向。
第二个障碍是环境与任务扩展的矛盾。真实世界的 API 能够提供最真实的反馈,但调用成本极高且受到严格限制;而纯粹依赖大模型脑补生成的任务,又常常缺乏执行难度和状态正确性的保证。如何在一个足够广阔的覆盖面下,既能生成极具挑战性的复杂任务,又能保证任务状态和结果的可验证性,是阻碍智能体走向深水区的一大难题。
第三个障碍则是如何从“彻底失败”中学习。对于真正的困难任务,仅仅模仿往往会继承教师模型的局限性甚至错误。而在策略内学习(On-policy learning)中,如果智能体对某个任务的尝试全盘皆输,它几乎得不到任何有用的梯度信号。即便观察到了这些失败,如何将它们转化为结构化、可验证的目标,再去指导下一轮的数据构建,也是一个悬而未决的工程难题。
构建全场景坐标系:告别一维打分
为了打破这些僵局,AgentOmnia 的第一步是建立一套极具野心的“全场景分类学(Full-Scenario Taxonomy)”。它放弃了简单粗暴的任务列表堆砌,转而采用 $Domain \times Capability \times Atomic Difficulty$(领域 × 能力 × 原子难度)的三维结构来精准定位智能体的表现边界。

这个坐标系的领域轴(Domain)被划分为三大核心应用场景:面向消费者(ToC)、面向企业(ToB)和面向员工(ToE)。ToC 涵盖了购物、差旅、支付和售后服务等,考验模型对用户偏好、预算约束和多轮澄清的处理能力。ToB 深入到金融、制造、物流等行业系统,侧重于结构化业务实体、跨系统状态和工作流协同。ToE 则抽象出各行各业通用的办公活动,如邮件处理、项目协调、知识管理和数据分析。在这三大类下,作者极其细致地拆分出了 90 个一级领域和 354 个二级领域,形成了一个具有极高还原度的任务底图。
能力轴(Capability)则独立于具体领域,描述了智能体需要具备的 10 项核心能力。这使得评估不再局限于“它会不会订机票”,而是深入到“它在订机票过程中,是否具备状态跟踪或约束满足的能力”。原子难度轴(Atomic Difficulty)则通过 8 个独立的难度因子,将任务复杂化的原因拆解开来。这种设计确保了同一项能力可以在不同的领域和难度配置下进行正交验证,从而让系统能够精准区分模型到底是某一类知识储备不足,还是根本不具备底层的逻辑推理能力。

双向合成:让环境与任务真正咬合
有了精确的图纸,接下来就是在这个坐标系中填充真实弹药。AgentOmnia 采用了一种非常精妙的双向数据合成范式(Bidirectional Synthesis)。过去的方法往往陷入单向思维:要么先苦苦搭建一个复杂的沙盒环境,然后再在里面硬凑几个任务;要么先想好一个复杂的任务,却发现现有的沙盒根本无法支撑其执行。
AgentOmnia 将环境供给与任务需求彻底打通。环境导向的路径会首先构建具有高度可复用性的底层环境,随后在其上大量生成接地气的任务,从而摊薄环境开发成本;任务导向的路径则从一份高难度的任务描述出发,反向倒逼环境的构建或适配,确保极端的长尾场景也能得到支持。

为了支撑这种双向合成,研究团队打造了一套完全基于代码驱动的、具备状态记忆的环境管线。从异构种子挖掘开始,大语言模型通过深度搜索提取出具备真实世界属性的实体、关系和约束条件,从而生成结构化的状态空间。紧接着,系统为这些状态空间合成一套高度复杂的工具集。这些工具不再是简单的单参数调用,而是包含了多分支选择、参数间约束耦合以及需要后续字段提取的复杂操作。在这个过程中,系统共构建了 5018 个可追踪状态的代码驱动环境,孕育出超过 25 万个高度仿真的执行工具。
在任务层面,单纯的执行流已经无法满足全场景的要求。因此,AgentOmnia 引入了三种并行的任务构建策略。有向无环图(DAG)合成专门负责生成具有极强工具依赖和超长跨度的工作流;程序结构合成则负责引入循环、分支和依赖数据的动态执行路径;而基于求解器(Solver-based)的合成更是跳出了局部执行的局限,专门针对具有全局约束的资源优化和多目标规划任务进行对抗性生成。这种多管齐下的策略,最终沉淀出 52361 个高质量、经过严格验证的可执行任务。

绝境求生:弱到强的后训练与回滚机制
拥有了海量的复杂环境与任务之后,如何训练智能体成了新的难题。当面对极其复杂的长线任务时,即便是基础能力极强的大模型,往往也会在某一个细微的步骤上失足,导致整个轨迹彻底失败。为了解决这个问题,研究团队设计了一套融合弱监督与强约束的后训练方案。
在这里,程序、全局求解器和结构化验证器成为了“强”的规则依靠,它们为模型在探索过程中的状态转移提供确定的正确性信号。通过控制信息泄漏的特权引导(Privileged guidance),系统能够辅助模型生成那些原本不可能一次性跑通的困难任务轨迹,而在最终提供给模型学习的数据中,这些特权提示又会被完全抹除,确保模型学到的是真正的解题逻辑而非捷径。
最令人惊艳的设计之一是回滚课程学习(Rollback curriculum)。在智能体强化学习的在线探索阶段,如果一个高难度任务让模型尝试了无数次依然全盘皆败,普通的算法可能就直接丢弃了这个样本。而 AgentOmnia 则会从一条已知的“黄金轨迹”中截取一段前缀作为起点,让模型只从这个中间状态继续往下探索。如果模型依然失败,就保留更长的前缀,降低起跑难度;随着模型策略的逐渐强大,前缀被逐步缩短,直到模型能够从零开始完整通关。这种动态的难度适配,极其优雅地挽救了大量原本无法提供梯度信号的高价值失败数据。
像产品经理一样自我进化
如果说前面的机制确保了单次迭代的高效,那么引入产品需求文档(PRD)则赋予了系统持续自我繁衍的灵魂。在以往的许多研究中,模型评估完之后,开发者只能凭借经验去手动微调数据集。但在 AgentOmnia 中,评估失败本身就是驱动演进的燃料。
当智能体在 OmniaBench 等基准测试中折戟后,系统会将这些失败精确映射到前述的三维坐标系中,生成一份详尽的能力缺陷诊断报告。随后,这些报告会被大语言模型“翻译”成标准的 PRD 文档。这份文档极其严谨,它会明确指出:目标场景是什么、当前的具体能力缺口在哪里、下一阶段需要生成什么语义环境、合成任务必须满足哪些刚性约束,以及如何才算达标。
更有趣的是,这个接口不仅对内开放,对外也允许业务专家和产品经理直接用人类逻辑注入新的 PRD。无论是机器自省的缺陷,还是人类新指派的业务场景,最终都被统一纳入 PRD 协议,精准制导下一轮的环境合成、工具打磨和数据采样。这彻底改变了数据合成的盲目性,将其转变为一种高度可解释、可追踪的工程管理过程。
实验结论:不只是刷榜,而是全面升维
AgentOmnia 带来的不仅是一套理念,更是实打实的硬指标提升。在没有任何投机取巧的统一评估协议下,基于 Qwen3-30B-A3B 构建的智能体在多项独立基准中展现了压倒性的进化。
它最大的亮点并不在于某一项单点数据的爆发,而在于提升的广度。在四项基准测试的总览中,其宏观平均成绩从基座模型的 22.86% 跃升至 41.69%。更为难得的是,这种提升不是依靠“刷偏科题”获得的。通过细粒度归因分析,作者明确指出,这些能力增益跨越了 ToC、ToB 和 ToE 三大板块的 76 个一级领域,全面覆盖了所有的 10 项核心能力维度和 8 个难度因子。换句话说,这是一个木桶所有短板被同步拉长、没有任何明显漏洞的六边形战士。
并且,面对参数量高达 235B 的同源基座模型,AgentOmnia-30B 展现出了极为顽强的竞争力,甚至在四榜平均分上实现了反超。这也印证了作者的一个核心判断:在这个阶段,相比于盲目增加模型的底层参数规模,在全场景环境和任务上的系统性延伸扩展(Agentic Scaling)能带来更高的边际收益。
尽管目前关于 PRD 引导的自我进化只进行了一轮初步验证,但作者毫不掩饰对此机制的看好。初步的单轮测试已经明确证明,基于诊断生成的针对性数据比随机数据带来了更加显著的宏观收益。虽然更长周期的演进稳定性和收益递减效应还有待在真实的工业环境中进一步考察,但这篇工作无疑为接下来真正可控、可验证的“通用智能体”开发,指明了一条极具可行性的破局之路。