不是答案对才有用!DHD证实多Agent中超4成错误消息反而是神助攻
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages
在多智能体(Multi-Agent)系统的常规设计中,工程师几乎遵循着一条心照不宣的准则:如果一个智能体给出的最终答案是错的,那么它的发言大概率就是噪音甚至毒药,应当在多轮协商、投票或消息路由中被尽早过滤掉。当系统引入一致性检验(Self-Consistency)、置信度评估或过程打分(PRM)时,潜意识里的假设都是一致的——只有“大概率正确”的发言,才配进入下一个推理环节。
ArXiv URL:https://arxiv.org/abs/2608.14375v1
来自阿贡国家实验室、布鲁克海文国家实验室、芝加哥大学与休斯敦大学的研究团队在最新论文《Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages》中,对这个行业直觉提出了尖锐的质疑:一个答案完全算错的智能体消息,其内部的推理过程是否可能恰好补齐了下游决策者最需要的那块拼图?
研究团队正式将这一现象命名为“错误但有用”(Wrong but Useful)。为了严谨量化一条消息到底对后续推理带来的是建设性推力还是破坏性干扰,他们提出了名为 DHD(Diverse Hypothesis Deliberation,多样假设审议)的控制测量协议。跨越 5 个主流数学与跨学科科学基准、涵盖开源大模型的大规模实验显示出一个颠覆直觉的规律:在所有改变了最终输出正误的“错误答案消息”中,竟然有超过四成(>40%)实际上帮助了下游集成器推导出了完全正确的最终答案。这项工作明确指出,提案正确性并不决定轨迹价值,大模型在协同推理时,不能再简单按最终答案“以貌取人”。
提案正确性不等于轨迹价值:拆解大模型的协同错觉
人类科学史和工程研讨中充斥着“方向正确但计算失误”的例子。一个研究员提出了完美的奇偶分解方法,但在最后一步算错了一个边界特例;只要另一个研究员顺着这套分解框架走下去,顺手修掉边界漏洞,就能解开整道难题。相反,一个看似答对数值的人,其论证过程可能充满了巧合或有偏见的前提假设,一旦被采纳,反而会将讨论带进沟里。
然而在大模型多智能体架构中,这种区分长期处于模糊状态。当前多数框架只关注端到端的最终准确率,这导致研究者无法区分系统之所以失败,究竟是因为池子里从一开始就没产生好思路,还是好思路明明存在却被下游集成模块当成垃圾抛弃,亦或是被某些包装精致的有害消息给带偏了。
为了理清这一因果链条,论文明确解耦了两个评判维度。第一个维度是提案正确性(Proposal Correctness),它关注消息本身的局部结论:该消息给出的最终答案与标准答案是否等价。第二个维度是轨迹价值(Trajectory Value),它关注消息在上下文中的系统影响:把包含完整推理与答案的整条消息输入给下游负责汇总的智能体(Integrator)时,与隐藏该消息相比,下游智能体推导出正确最终答案的概率究竟是上升、下降还是持平。
在这套定义下,消息被自然划分出两种反直觉的偏离象限:一种是“错误却有益”(Wrong-Helpful),即给出的答案不对,但下游看了它反而做对了;另一种则是“正确却有害”(Correct-Harmful),即给出的答案虽然正确,但其论证方式或提示的歧义干扰了下游,导致最终结果翻车。

DHD 测量协议:把整池消息固定,才能做纯净的“留一法”回放
测量多智能体内部某句话的真实因果效应是极度困难的。在大模型自由辩论中,只要稍微改变一个 Token,后续对话就会全部随机漂移,导致研究者根本无法确认终局的变化究竟归功于某一句话的内容,还是仅仅因为模型采样的偶然扰动。
DHD 协议正是为了攻克这一测量难题而设计的。它是一个严格受控的单步假设审议框架,而不是一个为了在榜单上刷分的搜索策略。其核心流程分为四个严格隔离的阶段:
首先是角色分配与独立生成。面对一个具体的科学或数学难题,协调角色(Recruiter)在完全看不到标准答案的前提下,动态拆解出 5 个互补的角色视角。随后,5 个假设生成器(Hypothesizers)基于各自的角色提示词独立工作,它们彼此之间不可见,也接触不到任何评分反馈或标准参考,各自输出一段结构化的消息。每条消息由两部分构成:思考推理链路(Reasoning)以及最终提议的答案(Proposed Answer)。这 5 条消息生成后被原样缓存进静态池子中,自始至终不再重新生成。
其次是下游集成与回放对比。为了衡量某条特定目标消息 $h_i$ 的贡献,系统运行同一个下游模型作为集成器(Integrator)。在基线运行中,集成器接收池子里的全部 5 条消息;在测试运行中,系统采用“留一法”(Leave-One-Out, LOO),仅仅将目标消息 $h_i$ 隐藏,其余 4 条消息保持完全相同。

通过对比这组匹配运行,单条消息对下游轨迹的因果推动力被清晰量化为三种结果:如果全量池子算对了而扣除该消息后算错了,则该消息标记为有益($\Delta = +1$);如果全量池子算错了而扣除该消息后反而算对了,则标记为有害($\Delta = -1$);如果两种情况下的正误结果相同,则标记为中性($\Delta = 0$)。
除了全池的留一法剔除,DHD 还设计了单消息对照实验,即只向集成器提供单条消息,并与完全不提供任何额外参考的独立求解器($K=0$)进行同台对比。整个评估端只对比最终字符串判定,裁判智能体完全看不见中间推理过程,从而彻底阻断了评测偏置。
颠覆直觉的跨模型实验:错解翻转时,超四成是在“神助攻”
研究人员在两个具备代表性的开源权重模型——$120\text{B}$ 参数级别的 gpt-oss-120b 与 $31\text{B}$ 参数级别的 gemma-4-31B-it 上,展开了涵盖五大高难度科学基准的全面评测。这五个数据集包括综合高难度数学题库 Omni-MATH-2、印度高难度理工联考题 JEEBench、大学物理与化学计算基准 SciBench、长文本证据链生物医学多选评测 LAB-Bench,以及材料科学问答 MaScQA。
数据呈现出令人震惊的一致性:在所有十个“模型-基准”的组合实验中,无一例外全都稳定观测到了“错误却有益”的消息现象。
更关键的统计差异体现在因果翻转的比例上。统计所有附带错误答案的消息,当下游因为这些消息的出现而发生最终结论正误反转时(排除了正误不变的中性样本),有益翻转的占比在两个模型体系中均突破了 40%。具体而言,在 gpt-oss-120b 中,因错误消息引发的正误突变里,有高达 $40.5\%$ 的情况是下游由错变对;而在 gemma-4-31B-it 中,这一比例更是达到了惊人的 $47.3\%$。这意味着,当一条包含错误答案的消息在多智能体系统内部激起波澜时,它几乎有一半的概率是在充当“神助攻”,而不是在帮倒忙。
哪怕放大到所有生成的错误提议消息全集(包含绝大多数未引发最终翻转的中性消息),仅凭一条错误消息就让整个 5 人团队最终扭亏为盈的绝对比例,在 gpt-oss-120b 上达到了 $6.3\%$,在 gemma-4-31B-it 上也达到了 $3.2\%$。
为了确认这一结论不是模型解码随机性所带来的伪影,作者在每个模型上专门抽取了 1,000 个题目进行严格的重复性受控实验。大模型在相同输入下的确存在小概率的输出分歧(gpt-oss-120b 的完全同质输入翻转率为 $7.3\%$,gemma-4-31B-it 为 $2.1\%$)。研究团队通过构建 5,000 个在局部样本块内置换“全池”与“留一”标签的零假设数据集进行非参数置换检验。统计结果表明,真实世界中观测到的错误有益效应集中度,完全无法用解码波动来解释,显著性水平达到了令人信服的 $p = 0.0002$。在经过极度严苛的 Benjamini–Hochberg 多重检验校正后,具有稳定可复现性的错误有益现象依然在各大跨学科题型中坚挺保留。
为什么错误消息反而能帮上忙?探寻黑盒里的因果机制
面对这一结果,最关键的追问在于:这个助攻效果到底来自于什么?是因为下游集成器从错误的推理中读出了闪光点,还是仅仅因为模型存在某种盲目猜测答案的统计偏好?
为了拆解这一机制,论文针对具备稳定可复现特征的“错误有益”典型样本,设计了成分掩码干预(Component Masking)实验。研究人员在保持消息位置和格式完全不变的情况下,分别对单条消息实施四种不同的外科手术式切除,观察下游集成器的做题胜率变化:
第一种是全量消息提供(完整推理 + 错误提议答案),此时集成器的成功率高达 $82\%$;第二种是掩蔽掉最终的错误答案,只提供完整的推理过程,成功率依然保持在 $64\%$ 的高位;第三种是掩蔽掉其推理过程,只保留那个错误的答案,集成器的成功率骤降至 $44\%$;第四种是在原位填充一段字数大致相当的中性占位文本,成功率仅有 $46\%$;而当把整条消息彻底物理删除时,成功率跌至谷底的 $26\%$。
这组递进的胜率曲线清晰地表明:错误提议之所以能够逆风翻盘,其核心动力在于推理链条本身所携带的逻辑价值,而非最终那一行附带的错误结论。
论文中的真实案例直观地还原了这一场景。在 Omni-MATH-2 的一道关于下取整求和是否为完全平方数的代数问题中,一个被赋予“增长边界分析师”角色的智能体在消息中写道:“应当将正整数 $L$ 分拆为奇数和偶数分别讨论,当 $L=2m$ 时求和必然为完全平方数,当 $L=2m+1$ 时求和转化为相邻连续整数乘积从而不可能是完全平方数。”该智能体的逻辑结构完全正确,但他在最后下结论时,粗心大意漏掉了 $L=1$ 这个导致连续数乘积退化的边界特例,交出了一份错误的提议答案。
当包含这段分析的消息进入全量池子后,下游集成器顺着“奇偶分类讨论”这套清晰有力的降维框架继续推导,在全局审视中轻松修补了 $L=1$ 的边缘情况,最终输出了完美的参考答案。然而在留一法回放中,一旦把这条消息从池子里抽走,下游集成器在面对原题时就彻底陷入了复杂的整除遍历泥潭,最终由于算力耗尽同样遗漏了特例,全盘皆输。
这一发现揭示出一个长期被忽视的机制:智能体在处理极度复杂的数学与物理问题时,最稀缺的往往不是最后那一个数值,而是高维解题空间中的结构性约束、变量边界剔除、或某种行之有效的变量代换视角。一个智能体可以因为代数加减法失误算错最终答案,但它给出的正交分类法却足以启发下游同伴避开死胡同。
与此相反,论文也记录了“正确却有害”的负向干扰机制。在一道材料科学关于硫化橡胶交联密度的化学题中,某智能体算出了正确的百分比,但在推理中节外生枝,过多讨论了“一个硫原子是否可能跨两个交联位点而导致比例翻倍”的特殊假设。当下游集成器看到这段分析后,这种原本用来体现逻辑严密的备选假设反客为主,诱导集成器相信翻倍计算更符合出题本意,最终合成出一个翻倍的错误答案。
候选可用性与集成瓶颈:为什么堆砌智能体并不总是灵丹妙药
除了微观的消息因果归因,DHD 协议在宏观上也暴露出当前多智能体架构普遍面临的系统级瓶颈。
许多人认为,智能体越多,群智涌现的效果越强。但在基准测评中,从单个智能体独立求解($K=0$)扩展到 5 个角色协同审议($K=5$),宏观平均准确率的提升却极为微弱:在 gpt-oss-120b 上仅微增 $+1.6$ 个百分点,在 gemma-4-31B-it 上更是只有 $+0.3$ 的微弱波动。某些基准甚至出现了加入更多智能体后准确度倒挂退步的尴尬局面。
是智能体群无法生成正确答案吗?并非如此。研究团队进一步统计了候选可用性(Candidate Availability)——即在 5 个生成的独立提议中,只要有任意一个智能体碰巧蒙对或算对了标准答案,就算作候选可用。数据表明,在 gpt-oss-120b 上,候选可用性在各基准上达到了 $76.0\%$ 至 $95.4\%$,整整高出最终实际集成准确率 $4.2$ 到 $36.2$ 个百分点。
这构成了多智能体系统在现实中的核心困境:候选池里其实早已存在通往正确答案的路径,但下游集成器缺乏准确鉴别和萃取的能力。简单的多数表决在这里彻底失效——在 gemma-4-31B-it 的所有样本中,只有 $36.9\%$ 的池子具备绝对多数的正确票,但最终的集成正确率却能达到 $78.7\%$,这证明下游并非在按人头数票。然而在配对差异诊断中,有接近 $7\%$ 到 $10\%$ 的问题,集成器面对单条消息时能做对,面对全部 5 条消息时反而被纷乱的上下文带进沟里。
当大量有用与有害的信息交织在上下文窗口中时,彼此正负抵消,导致端到端层面的宏观准确率呈现出近乎停滞的假象。这也从侧面印证了 DHD 协议的必要性:如果不做单变量受控剔除回放,任何基于最终准确率的评测都会彻底掩盖智能体之间极其剧烈的逻辑交锋。
重新思考多智能体通信:下一代 Agent 该学会何时倾听
DHD 研究所带来的技术启示,对未来设计复杂多智能体协作、通信剪枝以及过程奖励模型具有非常直接的工程指引。
长期以来,工业界在做多智能体通信降本和剪枝路由(Pruning)时,偏向于使用快速打分器过滤掉低置信度、答案不一致或看似错误的发言。但本篇论文证明,根据消息携带的最终答案来决定消息的生死去留,无异于买椟还珠。
在基于留一法效应的跨折交叉验证实验中,研究团队做了一个对比:如果在同一个问题内部,依据先前重复采样累积的“轨迹价值”证据来做出“保留全部消息或剔除某一条消息”的决策,系统在两个模型上的最终准确率分别可以提升 $1.68$ 和 $2.61$ 个百分点;而如果单纯依据“提议答案的正确性”来决定是否丢弃某个消息,准确率的提升幅度仅有 $0.94$ 和 $1.00$。
这明确展示出一条通向更高推理上限的路径:未来的通信过滤机制,不应该盲目寻找“正确答案”,而应该学习评估“推理价值”。
在实际开发中,这一认知至少会驱动多智能体框架在两个层面做出调整。首先,在上下文组装层,系统应当允许智能体之间传递无明确结论、甚至结论相互矛盾但推导严密的中间思维快照,将解题骨架与数值判定分离。其次,在设计过程奖励模型(PRM)或路由分类器时,监督信号不应仅仅与最终答案是否正确强行绑定,而是应当引入类似 DHD 协议所标注出的离线“轨迹因果标签”,训练系统识别出那些虽然包含计算笔误、但成功给出了正交分解法、边界排查约束或关键守恒定律的优质探索。
大模型的推理进阶,往往伴随着对人类认知规律更深层次的复刻。一个真正高效的协作系统,绝不是一帮只附和标准答案的随波逐流者,而是一个能够容忍瑕疵推导、并敏锐地从中提炼出核心洞见的智慧网络。DHD 协议第一次在大规模量化层面上确立了这一界限:永远不要过早宣判一条带有错误结论的消息为死刑,在通往真相的曲折轨迹里,它的解题思路或许正是破局的关键。