NVIDIA发布JarvisBench:解耦执行与协调,多Agent任务最高提升28.2分

JarvisBench: Always-on Intelligence Between Humans and Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

随着大语言模型在工具调用与环境交互能力的持续进化,长程智能体(Long-horizon Agent)已经能够自主执行数十分钟乃至数小时的复杂工作流。然而,智能体的自主执行能力在飞速向前,人类能够分配给它们的注意力却没有同步增加。这就催生了一个极其棘手且长期被学界忽视的双向协调困境。

ArXiv URL:https://arxiv.org/abs/2608.14870v1

一方面,当后台智能体在执行漫长的多步骤任务时,人类用户可能随时需要询问当前进展、调整局部目标,但在现有的系统交互下,用户往往必须强制挂起或打断任务,导致大量瞬态对话污染智能体的工作上下文。另一方面,当智能体在探索过程中遇到涉及人类权限、主观偏好或重大商业代价的分歧点时,人类用户往往早已离开屏幕;此时缺乏有效求助机制的智能体通常只能硬着头皮猜测执行,等用户数小时后回来验收时,最初的偏差已经将整个任务带偏到了不可挽回的方向。

JarvisBench 架构总览

针对这一结构性矛盾,来自 NVIDIA 的研究团队提出了全新理念:必须将“任务执行”与“注意力协调”彻底解耦。他们构想了一个类似《钢铁侠》中 Jarvis 的常驻注意力协调层(Always-on Attention-coordination Layer),作为用户与执行智能体之间的双向中介。为了量化这一层中介的能力边界,研究团队推出了评估基准 JarvisBench,涵盖单智能体与多智能体共 45 个长程任务实例,横跨 19 个领域。实验表明,在完全不修改底层 Worker 智能体运行循环的前提下,仅仅通过接入以 GPT-5.6-Sol 为核心的 Jarvis 协调层,各类主流模型在单智能体任务上的得分平均提升 4.9 至 24.7 分,在多智能体协同任务上的增益更是达到 12.5 至 28.2 分。这项工作标志着智能体系统的评估重心正从单纯的“工具单打独斗”转向“人机注意力的高效分配”。

为什么不能让执行智能体“顺便”负责沟通?

直觉上,许多人会认为最直接的解决方案是直接训练执行智能体自身的主动性(Agent Proactivity)——让它在遇到困难时主动暂停并向人类发问。然而,大量前沿研究表明,任务执行与主动交互实际上是两种正交的能力维度,现有的长程模型在兼顾两者时往往会出现严重的校准失衡。

当我们将“何时询问人类”的决策逻辑塞进任务执行循环内部时,模型面临着多重认知负担。首先,当前智能体的主流训练目标完全围绕“最终任务达成率”展开,模型天生倾向于利用工具盲目试错,缺乏评估人类注意力经济学价值的元认知能力。如果模型过度保守,频繁为了微小细节弹出弹窗骚扰用户,人类的精力将被彻底耗尽;如果模型过度自信,则会直接跳过关键的人类意图裁决,造成灾难性漂移。

更为关键的是,让 Worker 兼顾交互彻底忽视了用户侧的突发需求。人类用户对任务的介入是异步且不可预测的。用户可能在任务进行到第 80 步时突然想核对当前预算消耗,或者临时补充一条约束规则。如果要求 Worker 自身的执行循环持续监听用户输入,就必须在复杂的代码执行、环境报错、API 响应中频繁混入自然语言闲聊,这会导致推理上下文窗口迅速膨胀且极易引发上下文灾难性遗忘。

NVIDIA 提出的解耦方案的核心在于引入“副驾(Sidecar)”架构。在这个三方架构中,用户负责拥有核心意图、主观偏好与私有验收标准;Worker 专注于按照确定性工具链推进任务,其底层执行引擎保持完全固定与独立;而位于中间的 Jarvis 则是一个常驻的、事件驱动的监督者。它通过外置接口监听 Worker 抛出的离散执行事件,同时向用户暴露随时可用的语音与文本交互界面。它既能在 Worker 遭遇关键分歧时将其在安全动作边界处优雅挂起并向用户请示,也能在用户随时发问时基于执行上下文提供即时答复,而无需 Worker 停下手头的工作。

告别刻意隐瞒:自然涌现的注意力基准设计

为了严密检验这种协调能力,设计评测任务的思路必须发生根本性转变。目前绝大多数所谓“人机交互”或“主动澄清”的评测基准,往往采用非常粗糙的人为构造方式:在 Prompt 的初始输入中故意隐瞒某些显而易见的核心参数,例如只说“帮我买一张去北京的机票”,然后测试智能体是否会反问出发时间和舱位等级。这种玩具级的设计与真实工业场景存在巨大鸿沟。

在真实的复杂任务中,初始意图通常是相对完备且足以支撑前置步骤展开的,真正的分歧点总是在执行中途随着外部环境的反馈而自然涌现。JarvisBench 从 2000 多个公开候选任务中精选并重构了 45 个高难度实例,其中包括 20 个单智能体任务和 25 条组织在 10 个复杂项目中的多智能体工作流。这些任务要求 Worker 必须首先完成相当深度的客观调研、代码编写或数据分析,才会逐步暴露出深层次的分歧。

举例来说,在开发某项自动化功能的过程中,环境可能抛出了两种截然不同且互有利弊的技术选型:一种方案实现成本低但依赖第三方闭源服务,另一种方案具备更高的私密性却需要更长的构建周期。这种牵涉企业架构决策的问题,根本不可能在最初的任务提示词中预判,它必须依赖执行到达特定阶段后,由协调层敏锐地意识到“当前遇到了必须由人类决策的分歧点”,进而组织起精确的提问。

更为严苛的是多智能体项目评测。在包含两个或三个工作流的耦合项目中,不同智能体各自推进不同的模块,比如一条工作流负责前端渲染优化,另一条工作流负责后端数据库重构。单看任何一个 Worker 的局部日志,其执行都是正常的,只有站在全局视野的 Jarvis 才能捕捉到不同子任务在接口或商业逻辑上的隐性冲突,并在此刻适时申请人类注意力。

在评测执行上,用户端由配备了冻结私有设定文件的独立大模型充当裁判,Worker 的每一次动作均被严格约束在沙盒之内。Jarvis 拥有拦截并暂停 Worker 的权限:一旦判定需要干预,Jarvis 会在 Worker 动作的边界处进行拦截,取消当前的未决动作,向人类抛出一个高度聚焦的单点问题,在拿到答复后将指引转化为局部的软约束指引注入回 Worker 上下文,随后恢复执行。这种机制最大限度保留了 Worker 已经完成的有效工作,避免了推倒重来的计算浪费。

严密拆解:双向评估轨道与注意力效率

JarvisBench 设立了两个互不干扰的平行评估轨道,分别对应注意力流向的两个方向。

第一条轨道是面向智能体协作的“Agent-Collaboration Track”,专门评估“智能体向人类索取注意力”的有效性。其核心目标衡量人类介入后任务最终交付质量的绝对提升。评测体系为每个任务设定了加权的检查点综合评分 $S_i$:

\[S_{i} = 100 \sum_{j} w_{ij} c_{ij}\]

其中 $c_{ij} \in [0, 1]$ 覆盖了客观执行的完整度、与人类决策的对齐程度、交付物质量以及安全约束等多重维度。更为重要的是,研究团队在此引入了“注意力效率(Attention Efficiency)”的衍生度量:

\[\mathrm{Eff.} = \frac{\bar{S}_{\mathrm{Jarvis}} - \bar{S}_{\mathrm{base}}}{100\,\bar{N}_{\mathrm{req}}}\]

其中 $\bar{N}_{\mathrm{req}}$ 代表 Jarvis 向人类发起打扰的平均次数。该指标具有鲜明的物理意义:它衡量了人类用户每被打扰一次,能够换来任务整体得分多少个百分点的提升。如果一个协调系统为了提高 10 分而向用户疯狂弹窗 20 次,其注意力效率将变得极低;反之,若在毫无必要时频繁介入导致任务混乱,效率甚至可能跌入负数。

第二条轨道是面向用户交互的“User-Interaction Track”,评估“人类主动向中介发问”时的可用性与准确度。该轨道创新性地采用了因果重放机制(Causal Replay)。评测时,研究人员先行冻结记录下 Worker 在真实执行过程中的所有事件轨迹,然后严格按照时间戳顺序向处于中间层的 Jarvis 逐步揭示状态。在整个回放过程中,评测系统在不同时间节点向 Jarvis 抛出常规进展咨询与基于上下文的追问,要求 Jarvis 在完全不打扰后台 Worker 的前提下准确回答当前任务进度、潜在风险与中间结论。由于这种读取是纯粹只读的,它不仅确保了不同中介模型在面对完全一致的状态切片时公平竞争,还极大节约了多次重新跑完完整长程智能体工作流所耗费的计算开销。

实验发现:协调不是简单的消息转发

在控制变量的详尽实验中,NVIDIA 团队首先固定将 GPT-5.6-Sol 作为外置的 Jarvis 模型,横向对比了包括 Claude Opus 5.0、Claude Opus 4.8、GPT-5.6-Sol、GPT-5.5、DeepSeek V4-Pro 以及 GLM 5.2 在内的六大主流 Worker 智能体。

实验数据揭示了一个具有普适性的积极结论:不论底层 Worker 是哪一家的架构,在引入外置注意力协调层后,所有配置的最终任务表现均获得了立竿见影的飞跃。在单智能体任务上,分数的净提升区间分布在 4.9 至 24.7 分;而在工作流更为复杂、跨线程冲突更为频繁的多智能体协同任务上,介入机制展现出更强大的纠偏价值,最终得分的净增益达到了 12.5 至 28.2 分。这充分验证了长程智能体在没有外界监督时,即使基础推理能力极强,也会不可避免地因为微小偏好的分歧而陷入局部最优。

然而,更深层次的对比实验打破了一种天真的设想——即“中介层只需要一个轻量级的小模型做消息转发即可”。当固定 Claude Opus 4.8 作为 Worker,分别换用不同的顶级模型担当 Jarvis 时,协调层本身的认知水平对结果产生了决定性影响。

在单智能体与多智能体任务中,以 GPT-5.6-Sol 驱动的 Jarvis 均取得了最显著的绝对分数增益和最高的用户交互质量分(达到 96.3 分)。但在注意力效率的维度上,不同模型展现出了极具启发性的策略权衡。DeepSeek V4-Pro 在多智能体项目上展现出了极高的“注意力克制力”,它平均每个任务仅仅发起 0.30 次打扰,却精准命中了最关键的核心分歧,从而斩获了极高的单次打扰转换效率。相比之下,部分开源模型在担任 Jarvis 时,由于无法精准提炼正在展开的复杂事件日志,往往在不痛不痒的技术细节上向人类发问,既消耗了注意力预算,又未能有效指导底层 Worker。这强有力地证明,中间层绝不是简单的事件透传管道,它本身必须具备极强的长上下文理解力、对人类价值的审慎判断力,以及将模糊的人类意图精准翻译为下游操作指令的高级语言转换能力。

此外,为了验证该框架在未来消费级与专业级场景落地的可行性,研究团队还实现了一个基于全双工语音交互的原型系统。该系统集成了 Qwen3-ASR 语音转写、Silero VAD 语音断句、Kokoro-82M 流式语音合成以及 SoulX-Duplug 语义状态预测模块。这一工程落地展示了极为迷人的交互图景:用户可以在后台跑着多智能体代码重构任务的同时,随时开口打断 Jarvis 询问“刚才的数据库备份做了吗”,并在得到语音回复后继续手头的工作,整个过程中后台的 Worker 甚至无需暂停一行代码的执行。

人机协同进入“第三态”

回顾大模型驱动的智能体发展史,人机交互的范式经历了两次关键跃迁。第一阶段是严格的“单轮一问一答”,人类必须守在对话框前亦步亦趋;第二阶段是“完全脱机的自主代理”,人类抛出长任务后智能体自行在沙盒中狂奔数十步甚至上百步,但中途缺乏透明度,最终交付往往形同开盲盒。

NVIDIA 通过 JarvisBench 所确立的,实际上是人机协同的“第三态”:执行高度自主,协调始终在线。在这个架构中,底层智能体负责向物理世界或数字沙盒索取计算与工具的效率,而常驻协调层则负责在人类极度稀缺的注意力与计算集群无休止的吞吐量之间,构建起一道富有弹性的注意力滤网。

这项研究最重要的启示在于系统级架构的重新划分。未来真正能够走进工业生产的 Agent OS,其核心竞争力或许并不完全取决于底层单个 Worker 刷代码榜单的分数,而取决于中间层能否以极低的认知摩擦将人类的经验、品味与红线注入到自动化的血液中。随着智能体在各个垂直领域的下沉渗透,这种将执行循环与注意力分配严格解耦的系统设计,必将成为长程人机共生系统的标准基础设施。