NIS-Agent:打破自证偏见!阿里与浙大用上下文隔离节约33%Token
From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

在复杂的信息检索与深度推理任务中,基于大语言模型(LLM)构建的深度搜索智能体(Deep Research Agents)正在展现出惊人的自主规划能力。然而,许多工程师和研究人员在实测中都会遭遇一个令人沮丧的现象:当智能体一旦拟定了一个稍微偏离正轨的搜索关键词,或者在早期生成了某个并不严谨的子计划,它往往不会在后续检索中及时止损,反而像着了魔一样,不断沿着错误的路径疯狂点击、检索,甚至在海量无关的网页中强行“拼凑”出看似符合预期却完全错误的最终结论。
ArXiv URL:https://arxiv.org/abs/2608.23045v2
这种在错误道路上“狂飙突进”的现象,通常被笼统地归咎于长上下文幻觉或检索退化。但来自阿里巴巴和浙江大学的联合研究团队在最新论文中揭示了一个更底层的认知缺陷机制——惯性偏差(Inertia Bias)。简单来说,大模型一旦亲自生成了某个动作(如查询词、计划或推论),在后续评估该动作产生的结果时,就会丧失客观判断力,表现出对自我历史行为的盲目偏袒与路径依赖。
针对这一顽疾,研究团队不仅提出了专门量化该偏差的基准评测 IBIS,还构建了一套创新的去噪智能体框架 NIS-Agent。该方法通过在决策关键节点实施“上下文隔离”,在 GAIA 和 WebWalkerQA 等权威深度研究基准上大幅刷新了开源框架的最佳表现,将 Token 消耗降低了 33%;甚至仅凭轻量化的 8B 开源模型,就跑出了媲美 GPT-4o 的整体表现。
从自恋到盲目:量化大模型的“惯性偏差”
在探讨解决方案之前,必须先厘清智能体在深度检索中究竟是如何“走偏”的。认知科学中常常提到两类偏差:一是迎合外部输入的阿谀奉承(Sycophancy),即模型倾向于顺从用户的误导;二是确认偏差(Confirmation Bias),即人们只倾向于寻找支持已有信念的证据。
但惯性偏差(Inertia Bias)与这两者有着本质区别。它的触发源既非外部用户的诱导,也非抽象的先验观念,而是模型自己刚刚执行过的内部动作(Action)。在多轮智能体调用中,大模型生成的不仅仅是文本,更是驱动下一步环境交互的操作指令。一旦某个指令被记录在推理上下文中,模型在后续反思阶段就会不自觉地将这一指令预设为“合理的锚点”,进而为后续并不理想的观察结果寻找合理解释。
为了证明并量化这种偏见的客观存在,研究团队构建了名为 IBIS(Inertia Bias in Information Seeking) 的诊断基准。该基准专门针对搜索 Worker 的核心决策点:生成查询词、调用搜索引擎并检查返回的网页摘要,进而决定究竟是“访问该网页获取详情”还是“放弃当前线索重新搜索”。
在实验设计上,IBIS 极其巧妙地控制了变量。评测集严格筛选了 454 个事实性问题,并让人类标注员与独立大模型交叉检验,锁定了那些“返回摘要明确证明检索完全无关、客观上必须重新发起搜索(Should Re-search)”的样本。随后,研究人员将模型置于两种不同的测试模式下:
-
智能体模式(Agentic Mode):提示词中完整保留模型自己的历史轨迹,让模型意识到“这个查询词是我上一轮自己想出来的”;
-
观察者模式(Observer Mode):输入完全相同的查询词与搜索返回摘要,但以纯中立的第三方外部信息形式呈现,模型作为旁观者对该检索质量进行裁决。
测试结果揭示了一个残酷的现实:主流模型从“旁观者”切换到“当局者”时,准确拒绝无用搜索的成功率普遍暴跌了 15% 到 30%。即使是当前最顶尖的推理模型,在审视自己亲手写出的搜索请求时,也表现出了明显的决策失真。它们明知摘要内容文不对题,却依然选择继续访问网页,甚至在后续多轮交互中越陷越深。
两级级联失效:搜索噪声与上下文噪声
这种惯性偏差在大规模深度研究系统的工程架构中,会迅速被放大并演化为两类系统级的噪声,导致整个架构瘫痪。目前绝大多数深度研究智能体均采用 Manager-Worker 的分层协作范式:Manager 负责全局目标拆解与战略规划,Worker 负责针对具体子问题在互联网中穿梭并采集证据。
第一层级出现在 Worker 端的搜索噪声(Search Noise)。如上图左侧所示,开放网络环境中的检索结果极为脆弱,细微的提问用词差异就会导致截然不同的网页摘要。在理想情况下,Worker 应当具备极强的断舍离能力——只要看一眼搜索摘要发现不对,就应该立即换词重搜。但在惯性偏差的驱使下,Worker 会选择性相信那些仅具备微弱表面相关性的网页,强行点进详情页浏览,从而将大量无关、充满误导性的网页文本打包带回系统内部。这不仅浪费了宝贵的调用耗时与上下文窗口,更引入了无法清洗的底层杂质。
第二层级出现在 Manager 端的上下文噪声(Contextual Noise)。如上图右侧所示,Manager 在长流程规划中一旦在初期形成了一个有瑕疵的推论框架,随着上下文越来越长、杂质越来越多,它并不会主动推翻早期的设想。相反,它开始从 Worker 汇报回来的海量片段中进行“挑食式采纳”(Cherry-picking),只摘取那些迎合其最初偏见的证据碎片。最终,Manager 会带着高度自洽的虚假逻辑提前终止搜索,自信地输出完全错误的答案。
显然,靠模型在同一个滚雪球式的长上下文窗口中进行自我反思(Self-Correction)是行不通的。因为反思操作本身就在充满偏见的历史中进行,这无异于“让嫌疑人自审自判”。
NIS-Agent 的解法:两处关键决策的上下文隔离
既然惯性偏差的核心病灶在于模型被自身历史动作所锚定,那么最直接、最彻底的根治手段并非盲目压缩上下文,而是剥夺模型自证合理性的上下文土壤。阿里巴巴与浙江大学的研究团队据此提出了 NIS-Agent(Noise Isolation Search Agent)。
NIS-Agent 并没有推翻现有的成熟多智能体架构,而是在最容易滋生偏差的两个决策关口植入了去噪隔离机制(上图中红色高亮部分),让判断回归中立客观。
1. Worker 端的上下文隔离筛选器(Context-Isolated Filter Module)
在传统的 Worker 流程中,模型查看搜索摘要并决定点进哪个网页时,往往带着前面所有思考与操作的完整历史。NIS-Agent 对此进行了彻底解耦:在搜索引擎返回候选网页之后,系统并不直接让 SearchAgent 顺着当前思路做决定,而是启动了一个轻量化的隔离过滤模块。
该模块剥离了智能体此前生成该查询词时的所有心路历程,只保留当前任务最核心的状态定义,将搜索摘要视为中立的外部候选池进行审视。由于切断了“这是我自己想出的词”这一心理暗示,过滤模块能够极为冷酷地剔除仅具有表面字面重合的低信噪比网页。当确认没有合格的网页值得进一步打开时,系统会直接拦截无效浏览请求,并触发自适应查询改写机制。这一改动在源头上直接掐断了 Worker 端的搜索噪声,避免了大量无效网页内容的摄入。
2. Manager 端的单步推理隔离验证(Isolation-based Stepwise Validation Module)
相比 Worker,Manager 端的最终答案校验面临着更为盘根错节的上下文污染。过去的做法要么让智能体得出答案后直接输出,要么把整条又臭又长的对话轨迹打包给同一个模型进行全局复核。事实证明,后者几乎无法识别深层次的逻辑漏洞,因为模型早已沉溺在自己构建的叙事闭环中。
NIS-Agent 引入了一套两阶段的隔离验证机制(如下图所示),在 Manager 首次认为“答案已准备就绪”时被自动激活:
阶段一:推理过程重组(Reasoning Process Reorganization)。系统首先从 ManagerAgent 杂乱的执行记忆库中,抽离出原始任务需求、工具调用序列与实际获取的外部事实,将其洗刷并重新编排成一条结构高度清晰的因果推理链。在这一过程中,冗余的历史上下文被彻底裁剪,每一个推论步骤都被赋予显式的编号,并严格标注其前置依赖条件。
阶段二:单步推理独立验证(Stepwise Reasoning Validation)。这是去噪机制最硬核的一环。验证器不再试图一揽子审查从头到尾的宏观逻辑,而是像形式化证明一样,将长推导拆解为一系列原子的因果对。例如在长链条 $a \to b \to c$ 中,验证系统只截取局部上下文,分别独立检验“已知前提 $a$ 是否必然推导出推论 $b$”,以及“已知推论 $b$ 是否足以支撑结论 $c$”。
在孤立的局部视野下,验证模型无法感知到“最终答案是什么”,因此完全丧失了提前为结论寻找借口的动机。只有当每一个局部的推理台阶均不存在事实性跳跃或错误时,最终答案才被放行输出。一旦某一环节出现漏洞,验证模块会生成具体的修正建议并反馈给 ManagerAgent,倒逼其在全局上下文中重新审视并开启新一轮迭代。
治本之策:用 GRPO 训练内在免疫的 8B 模型
依靠外挂式的架构隔离固然能在推理阶段大幅改善大模型的客观性,但这也引出了一个更深层的问题:我们能否直接训练出一个天生就具备“抗惯性偏差”体质的端到端小模型?
研究团队基于 Qwen3-8B 展开了探索,推出了轻量级专用模型 NIS-8B。训练过程分为两个针对性极强的阶段:
-
监督微调(SFT)阶段:该阶段并不追求广度,而是聚焦于建立智能体的规范化工具调用协议,同时引入基于强教师模型生成的决策范例作为冷启动数据,使小模型初步学习中立评估的黄金行动路线。
-
基于 GRPO 的强化学习(Reinforcement Learning with GRPO):模仿只能带来静态先验,无法解决模型在自主展开(Rollout)过程中不可避免出现的偏航。团队采用群体相对策略优化(GRPO),在环境探索中进行对抗训练。奖励函数设计非常直接:
\[R = 0.1 \cdot R_{\text{format}} + 0.9 \cdot R_{\text{action}}\]其中 $R_{\text{format}}$ 确保智能体遵循格式契约,而高达 0.9 权重的 $R_{\text{action}}$ 则直接落在“模型是否在关键节点克服了惯性偏差、做出了符合真值标准的理性决策”。这种将强化学习奖励密集投注在具体动作决策点而非全轨迹最终结果的策略,提供了信噪比极高的信用分配(Credit Assignment)信号,使模型彻底内化了客观审视自身输出的能力。
在随后的 IBIS 基准复测中,NIS-8B 展现出了令人惊艳的鲁棒性:它在智能体模式与观察者模式之间的表现差距微乎其微,几乎完全免疫了困扰一众巨型闭源模型的惯性偏差。
刷榜与省流并存:深度研究基准的全面验证
为了检验 NIS-Agent 在真实开放世界任务中的实战能力,研究团队在涵盖多模态、工具调用、超长线网络浏览的一系列严苛基准上进行了详尽测试,包括著名的通用人工智能助手基准 GAIA、复杂多子页面跳转检索基准 WebWalkerQA,以及更偏向极限长程搜索的 BrowseComp 和 BrowseComp-zh。
实验横向对比了包括 smolagents DR、OWL、WebExplorer、MiroFlow 等主流开源智能体系统,甚至囊括了 OpenAI DR 等闭源重量级商业方案。
实验数据给出了极为鲜明的三点结论:
-
同基座大幅跃升:在完全采用 GPT-4o 或 GPT-4.1 作为底层驱动时,NIS-Agent 相比官方 baseline(smolagents DR)在 GAIA 和 WebWalkerQA 上普遍实现了 8 到 11 个百分点的绝对提升。更重要的是,由于在过滤阶段及时阻断了大量无效点击与冗余抓取,系统的端到端 Token 消耗降低了整整 33%。不仅准确率大幅上扬,还显著削减了推理账单。
-
刷新开源系统 SOTA:当挂载最前沿的推理基座模型时,架构带来的红利被进一步释放。以 Claude-3.7-Sonnet 为核心的 NIS-Agent 在 GAIA 上斩获了 72.73% 的得分,超越了以往一众依赖更大尺寸模型的竞品;而当搭配 DeepSeek-V4-Pro 时,系统更是直接将开源框架的最高记录刷新至惊人的 81.21%(GAIA)与 75.00%(WebWalkerQA),构筑了显著的领先优势。
-
8B 小模型逆袭闭源巨头:最令人振奋的是针对小模型的探索。经过抗偏差强化学习调优后的 NIS-8B,在同样的 NIS-Agent 框架驱动下,在 GAIA 上的平均表现达到了 63.64%,直接打平甚至微超采用原版 GPT-4o 作为主脑的表现(61.82%)。这充分证明:在深度研究与自动化 Agent 的演进路线上,盲目堆砌通用参数规模并不总是最优解,精准矫正模型的局部决策偏见往往能带来跨量级的工程效能突破。
给智能体系统架构师的启示
从工程落地与系统设计的视角来看,这项研究带来的启示远不止于刷榜和几个百分点的性能浮动。长期以来,社区在解决 Agent 幻觉和推导失败时,往往习惯性地采用“加大上下文窗口”或者“引入更多外部检索库(RAG)”等做加法的思路。然而,如果模型本身的认知决策链路存在“盲目迷信自身动作”的结构性缺陷,那么喂给它的上下文越庞大,往往只会为它的错误逻辑提供更多自圆其说的原料。
NIS-Agent 给出了一条极具穿透力的新思路:治理复杂智能体系统的关键,不在于全盘重构或一味增加记忆,而在于精准识别系统中的“毒性自环”并实施局部阻断。通过在关键评估步骤剥离模型对自己历史行为的所有权,让决策重回无偏见、冷酷客观的真空状态,我们完全可以用更小的成本撬动更高的智能上限。这一由繁化简的“隔离降噪”理念,不仅适用于网页搜索与深度研究,更将在自动化代码修复、复杂金融数据审计等长链路智能体落地场景中展现出深远的参考价值。