Iris:网页拓扑反向构题加SFT-RL爬升,单Agent拿下92.9分
Iris: Climbing to the Search Frontier

在各类大模型智能体(Agent)的榜单竞赛中,搜索类任务正在演变成一场越来越昂贵、也越来越扑朔迷离的“系统工程军备竞赛”。为了在复杂长链路检索基准上刷出高分,现存的许多方案倾向于堆叠复杂的外挂机制:多智能体嵌套分工、测试时多次重试(Retry)、反思纠错乃至专门的重判验证器(Re-verification)。这种工程堆砌往往掩盖了一个核心问题:如果不依赖花哨的测试时外挂,仅靠一个朴素的单体 ReAct 智能体,模型本身的自主搜索与推理边界究竟能推到多高?
ArXiv URL:https://arxiv.org/abs/2609.04304
近期开源的 Iris 给出了一套强有力的正面回应。这项工作推出了两个不同参数体量的搜索模型:35B-A3B 规模的 Iris-mini 与 397B-A17B 规模的 Iris-pro。令人瞩目的是,Iris 完全摒弃了子智能体协作和测试时重验证机制,仅凭借一个纯粹的单 ReAct 循环,在具有挑战性的 DeepSearchQA 上斩获了 92.9 的超高 F1 分数,并在 BrowseComp、BrowseComp-ZH 和专家级学术评测 HLE(Humanity’s Last Exam)上分别交出了 88.6、85.1 和 56.4 的成绩,刷新了同参数量级开源搜索智能体的最佳表现。
Iris 证明了高质量模型并不必然依赖繁复的外挂系统。其突破主要源自三个底层机制的协同创新:基于真实超链接拓扑逆向合成的抗作弊多跳数据、过滤与前缀复用兼备的高吞吐训练流水线,以及被称为 SFT-RL Climbing(监督微调与强化学习交替爬升) 的闭环进化策略。
逆向构题:彻底斩断字符串匹配的捷径
训练一个真正具备深层推理能力的搜索智能体,最大的拦路虎往往是低质量的合成数据。许多基准与训练集中的“多跳问题”,表面上看是复杂的链式推理,实则由于问题中包含了极具辨识度的专有名词或特定实体,模型只需在搜索引擎中直接命中该字符串,就能绕过中间推理、一键直达答案。这种现象被称为“锚点捷径”(Anchor Shortcut)。
为了从根本上铲除这一投机取巧的模式,Iris 设计了一套从真实网页超链接拓扑出发的逆向数据构建流水线。
构建的第一步是实体图谱抽取。流水线从维基百科或广阔 Web 语料中挑选种子页面,顺着页面的真实超链接结构爬取其出链(Out-links),构建一个局部的实体子图 $G_e$。在这个子图之上,算法自动铺设出必须跨越多张网页才能连通的多跳关系链。
最关键的环节在于随后的锚点抽象化(Anchor Abstraction)。设多跳路径上的最终目标答案为 $y$,而路径上所有支撑推理的非答案中间实体集合为 $V_e \setminus {y}$。Iris 定义了一个抽象重写算子 $\mathcal{A}$,对路径中出现的每一个中间实体 $e$ 进行描述性代换:
\[\mathcal{A}(e):\quad\mathrm{name}(e),\ \mathrm{alias}(e)\notin\mathcal{A}(e)\ \wedge\ \mathcal{A}(e)\ \text{uniquely identifies}\ e,\qquad\forall\,e\in V_{e}\setminus\{y\}\] \[\tilde{q}=f_{\text{abs}}(q_{0},\mathcal{A})\]这一算子的硬性约束是:重写后的表述绝对不能包含实体 $e$ 本身的标准名称或任何已知别名,但同时又必须提供足够丰富且唯一的属性描述,使得该实体能够被逻辑唯一锚定。例如,系统不会直接询问“A 导演在拍完电影 B 后的下一部作品是什么”,而是将电影 B 改写为其核心主创、获奖经历或独特剧情的复合描述。经过抽象算子处理后的问题 $\tilde{q}$,彻底失去了直接拿字符串去搜索引擎撞大运的可能,强制智能体必须执行“先语义推理消歧、再定向搜索验证”的认知过程。
并非所有生成的抽象问题都具有训练价值。为了确保问题既有挑战性又是客观可解的,Iris 引入了严格的双重标准验证机制(Dual-Criteria Verification)。流水线将生成的候选样本 $(\tilde{q}, y)$ 提交给一个独立的参考裁判模型 $M_{\text{ref}}$,并设定两个截然相反的关卡:
\[c_{\text{diff}}(\tilde{q})=\mathbb{I}\!\left[\,M_{\text{ref}}(\tilde{q})\neq y\,\right],\qquad c_{\text{solv}}(\tilde{q})=\mathbb{I}\!\left[\,M_{\text{ref}}(\tilde{q}\mid G_{e})=y\,\right]\] \[\mathcal{D}=\bigl\{\,(\tilde{q},y)\ \bigm\vert{}\ c_{\text{diff}}(\tilde{q})\cdot c_{\text{solv}}(\tilde{q})=1\,\bigr\}\]第一道关卡是难度判据 $c_{\text{diff}}$:在没有任何外部工具、完全闭卷的条件下,参考模型必须答错该题。这直接剔除了那些仅仅依靠预训练隐性记忆就能猜出的浅层事实。第二道关卡是可解性判据 $c_{\text{solv}}$:当把由网页拓扑蒸馏出的实体子图 $G_e$ 作为上下文补充给模型时,模型必须能够准确推导并给出唯一答案 $y$。如果提供全部背景事实后模型依然无法作答,说明该问题存在逻辑漏洞、表述歧义或答案非唯一,直接予以丢弃。通过这道严密的双向夹逼,Iris 最终筛选出一批高质量的合成问题集。
轨迹清洗:粗细两级过滤与上下文对齐
有了严谨的高难度问题后,下一步是由能力出众的教师模型 $M_T$ 与真实搜索工具交互,生成长程 ReAct 轨迹 $\tau$。然而,即便是最顶级的商业模型,在面对多跳长链搜索时也会产生幻觉、死循环或无效翻页。直接拿原始交互轨迹做微调,只会把教师模型的低效习惯全盘继承给下游模型。
Iris 对此提出了由粗到细的二级清洗策略。粗粒度过滤针对整条轨迹进行硬性指标截断:
首先是端到端正确性门控,轨迹必须正常终止,且提取的最终答案必须通过大模型裁判的语义对齐检验;
其次是基于 zlib 压缩率的退化检测(Degeneracy Check)。长程智能体极易在找不到线索时陷入反复搜索相似 query 的局部循环,Iris 监控滑动窗口 $w$ 的压缩比 $\rho_{\text{cr}}(w) = \lvert w \rvert / \lvert \mathrm{zlib}(w) \rvert$,一旦超过预设阈值 $\tau_{\text{cr}}$ 即视为退化死循环,整条轨迹直接作废; 最后是探索深度门控,工具调用次数 $T_{\text{tool}}(\tau) \ge K$ 必须达到一定深度,以此过滤掉教师模型单步蒙对的简单样本。
粗过滤固然能剔除失败样本,但在那些最终成功的长链轨迹内部,往往潜伏着“局部有毒”的操作——比如某一步做了一次完全脱靶的无用检索,或者推理文本中规划的操作与实际调用的工具完全脱节。通常的做法要么是整条抛弃,导致稀缺的难题样本损失惨重;要么是人工介入修正,但这在规模化训练中显然难以落地。
Iris 采用了一种细粒度轮次掩码(Turn-level Masking)技术。团队并没有主观臆断一组死板的过滤规则,而是让大模型裁判自主研读大量成功轨迹并生成自由形式的批评报告,团队再将反复出现的典型缺陷提炼为标准化打分准则(Rubric)。针对轨迹中的每一个模型回合,裁判结合完整历史与前后局部窗口进行判定,输出保留(1)或掩码(0)的标记 $m_t$。
为防止过滤模型过于激进地扼杀智能体在复杂环境中的合理试错探索,Iris 施加了一条保护性上限:任何单条轨迹中被掩码的模型轮次不得超过 10%。在 SFT 损失计算中,这些被掩码的不良回合依然保留在上下文历史 $C_{<t}$ 中,忠实保留智能体所处的交互真实场景,但在反向传播时将梯度置零:
\[\mathcal{L}_{\text{SFT}}(\theta)=-\,\mathbb{E}_{(q,\tau)\sim\mathcal{D}_{\text{sft}}}\sum_{t=1}^{T+1}m_{t}\,\log\pi_{\theta}\!\bigl(u_{t}\mid C_{<t}\bigr)\]通过这种策略,模型既学会了如何在包含局部噪声的长历史中继续决策,又不会主动去模仿那些低效甚至错误的推理步骤。
训练闭环:请求级局部 Rollout 与内部化双职引擎
在监督微调奠定基础后,模型进入强化学习阶段,直接与在线检索环境交互优化。这一阶段最大的工程壁垒在于超长交互序列的推理开销与极端的“长尾延迟”(Heavy-tail Latency)。在多跳搜索场景下,绝大多数查询在十余步内就能结束,但少数极其复杂的长尾样本会持续消耗数十步,导致同步调度下的所有 GPU 陷入长时间的闲置等待。如果完全转向异步训练,又不可避免地遭遇严重的策略滞后(Policy Lag)。
Iris 在工程架构上做出了极具启发性的创新:请求级局部展开(Request-level Partial Rollout)与前缀复用(Prefix Reuse)。
系统不再在“任务级”做一刀切的流式处理,而是把未完成的请求拆解为树状消息节点。当一个训练批次收集到足够数量的已完结轨迹后,那些耗时过长的在途会话并不会被粗暴抛弃,而是在请求层级被即时中断挂起。该会话已经生成的有效前缀(Prefix)及其对应的 Token 概率、Mask 和权重版本快照会被完整缓存。到了下一个优化步,该任务直接从缓存的前缀节点继续往下 Rollout。对于拼接了不同策略版本前缀的轨迹,算法利用截断重要性采样(Truncated Importance Sampling)在数学层面修正权重偏差。这一机制以大约两倍的过采样作为缓冲余量,在严格保持同步训练特性的同时,极大拉平了长尾延迟对集群算力的吞吐损耗。
另一个扫除工程不确定性的举措是奖励模型与摘要器的集群内共置(Co-located In-house Engines)。传统的 Agent 强化学习高度依赖商业外部 API 进行网页解析和结果裁决,这不仅成本高昂,而且经常因为网络抖动、速率限制或商用模型的无预警对齐调整,导致训练信号出现系统性漂移。
Iris 在训练集群内部直接部署了数个基于 FP8 运行的 Qwen3.5-397B-A17B 引擎,同时承担双重角色:
其一作为生成式奖励模型(GenRM),针对最终抽取出的答案 $\hat{y}_\tau$ 与标准参考答案 $y^*$ 进行严格的二值化对齐打分,不设任何花哨的格式奖励项,模型只要因格式崩溃未输出答案即默认归零;
其二作为实时文档摘要器(Observation Summarizer),直接抓取检索返回的冗长网页原始 HTML 并压缩为与当前查询高度相关的精练摘要。智能体在训练和推理全程看到的交互 Observation 始终是统一的文档级摘要,彻底消除了历史窗口滑动修剪带来的训练/推理表征不一致问题。
SFT-RL Climbing:交替爬升的动态自适应课程
在强化学习阶段,常见的策略梯度算法往往面临两难:对于难度极高的样本,当前策略探索到正确解答的概率极低,导致这些关键样本在分组相对奖励(Group-relative Reward)计算中长期提供零梯度;而如果一直沿用初期的 SFT 知识,策略又无法在自主探索中发现更优路径。
Iris 将这一演进模式总结为 SFT-RL Climbing(迭代爬升):
每一个爬升周期都由一轮 RL 探索起步。在当前策略与环境充分交互后,系统从海量采样的 Rollout 中提取出最具价值的样本子集 $\mathcal{S}_q$:
\[\mathcal{S}_{q}=\bigl\{\tau_{i}\mid R(q,\tau_{i})=1,\;T_{\text{tool}}(\tau_{i})\geq K_{\text{rft}}\bigr\},\qquad\tau^{\star}_{q}=\operatorname*{arg\,min}_{\tau\in\mathcal{S}_{q}}T_{\text{tool}}(\tau)\]这个筛选条件包含两个极具深意的约束:
其一是深度约束 $T_{\text{tool}}(\tau_i) \ge K_{\text{rft}}$,确保入选的轨迹经过了扎实的多步检索与证据链推理,排除凭借浅层直觉侥幸蒙对的偶然样本;
其二是在所有成功且深度合格的轨迹中,唯独选取步数最短的解答 $\tau^*q$($\arg\min T{\text{tool}}$),以此显式惩罚冗余多余的无意义搜索。
这些在 RL 探索中脱颖而出的“精炼高难解题路径”,会被重新送入下一轮监督微调(SFT)进行快速知识内化,固化稀有样本的正确推理通路。随后,RL 从更新后的权重底座上再次起跑。随着智能体基底能力的持续增强,符合筛选条件的问题集合自动向更难的区间迁移,形成了一套完全无需人工干预的自适应课程学习(Self-paced Curriculum)机制。当某一轮生成的候选池自然衰减枯竭时,爬升流程便自然收敛。
拆解神话:上下文管理与评测公平性
在评估智能体性能时,行业内存在一个普遍却常被掩盖的现象:推理时的上下文管理策略(Context Management, CM)对基准最终得分的影响,往往超过了模型体系本身的结构差异。
如果一个系统在上下文溢出或检索迷失时,通过不断触发全部重试(Retry)、经验总结追加甚至外挂二次校验,其得分能够被人为大幅拉升,但这并不代表模型本身的检索策略有了本质飞跃,反而伴随着成倍飙升的推理开销。针对这一乱象,Iris 在评测设计上秉持了非常克制且坦诚的标准:统一将 DeepSeek-V3.2 提出的 Discard-all 策略作为默认基线。该策略仅在运行上下文触达阈值且未得出结论时清空历史从头重试,不额外引入任何花哨的外挂总结或多轮审判机制。
在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 HLE 四项极具含金量的搜索与长链推理基准上,Iris 与业内主流模型进行了严格对齐的正面交锋。在保持相同工具集、相同上下文上限与统一裁决器设定的前提下:
在以极难多跳实体检索著称的 BrowseComp 上,Iris-pro 斩获了 88.6 的准确率,Iris-mini 达到了 82.2;
在中文多跳基准 BrowseComp-ZH 上,Iris-pro 和 Iris-mini 分别取得了 85.1 与 84.8 的高分;
在注重证据链全景召回的 DeepSearchQA 上,Iris-pro 更是以 92.9 的 F1 分数刷新了开源智能体的天花板,35B 级别的 Iris-mini 亦取得了 86.9 的强悍成绩;
在极具挑战性的专家级综合推理基准 HLE(文本子集)上,Iris-pro 取得了 56.4,Iris-mini 达到 52.3。
针对上下文管理策略的消融实验进一步证实了团队的判断:如果在 Discard-all 的基础上叠加类似 MiroThinker 的失败经验追加重试(Retry),Iris-pro 在 BrowseComp 上的得分甚至能一举冲破 90 分大关。然而,这种策略每进行一次 Retry 就意味着再耗费一整轮完整的长程搜索计算预算。Iris 坚持以 Discard-all 的成绩作为主榜呈现,正是为了呼吁研究社区将算力成本与模型本身的泛化能力纳入核心考量,而不是沉迷于复杂的测试时外挂技巧。
从专项搜索到智能体原子能力
从系统架构的角度来看,Iris 的最大贡献在于它打破了“专用搜索智能体必须依赖复杂调度器”的思维定势。无论是从图谱拓扑中剔除字符串捷径的数据逆向构建法,还是通过请求级挂起解决长尾延迟的集群工程解法,抑或是用步数惩罚驱动的 SFT-RL 交替爬升,其本质都是在夯实基础模型对于“不完全信息决策”的底座承载力。
更为深远的一个发现在于跨领域的知识迁移。研究团队在消融实验中观察到,经过这套高难度搜索流水线训练出的模型,以及用其蒸馏出的轻量模型,在完全未经过专门对齐的通用工具调用基准(如 BFCL、$\tau$-bench)与协同办公任务(如 OfficeQA、APEX)上,展现出了高度正向的能力迁移。
这带来了一个全新的范式认知:搜索不应仅仅被视作 Agent 生态下的一个垂直专精工具,它本身就是一种底层的基础原子能力。在面对海量不确定输入、信息不完全甚至充满噪声的复杂真实世界时,智能体所展现出的主动探索、假设检验、自我纠错与信息聚合逻辑,在最底层是完全同构的。Iris 的成功不仅为开源社区提供了一套完备且可复现的工业级搜索智能体构建范式,更揭示出大模型向高阶自主智能体演化过程中的关键基石——当一个模型真正学会了如何在信息的汪洋中严谨求证,它也就同时迈过了通往复杂场景通用推理的重要门槛。