Meta最新发现:大模型多指令崩溃,不是因为互相冲突,而是简单的概率相乘

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Meta最新发现:大模型多指令崩溃,不是因为互相冲突,而是简单的概率相乘 论文图示

在各类大语言模型的宣传和基准榜单中,模型遵循复杂指令的能力似乎已经登峰造极。无论是格式排版、字数限制、特定词汇规避,还是嵌套的逻辑框架,最前沿的旗舰模型在单项测试中通常都能轻松拿下 80% 甚至 90% 以上的分数。在真实业务流、复杂 Agent 编排或严格的数据结构化提取场景中,系统往往需要模型在单个回复里同时满足一长串规则:既要限制段落与字数,又要输出指定的键值格式,同时还得规避特定敏感词汇,并满足句式结构的单调性要求。

ArXiv URL:https://arxiv.org/abs/2608.12426v1

正是在这种多重约束并发的场景下,模型的实际表现往往会出现断崖式跳水。业界过去普遍将这一现象归结为“指令干扰”或“注意机制争夺”——认为不同的约束规则在模型的注意力头或隐层表征空间内发生了资源挤兑与逻辑冲突。Meta 带来的一项系统性研究给出了一个颠覆直觉的结论:大模型多约束遵循能力的崩塌,既非源于玄学的注意力瓶颈,也不是因为约束之间存在复杂的成对冲突,而是一场由“统计独立性”主导的乘法相变。

这项研究提出了名为“约束饱和评测”(Constraint Saturation Evaluation,简称 CSE)的程序化基准,对包括 GPT、Claude、Gemini、Llama 等 8 大家族共 15 个主流前沿大模型进行了极其严格的压测。整个实验覆盖 36 种细分约束类型、8 个认知维度,并发约束数量从 1 个逐层递增到 12 个,累计完成了近 37 万次判定。为了彻底规避主流基准中“用 LLM 当裁判评测高难度 LLM”所带来的循环论证与裁判自身能力退化问题,CSE 所有的验证逻辑均由纯规则代码完全确定性执行,零 LLM 参与。

实验揭示的底牌令人心惊:哪怕在当前最顶尖的模型上,可靠的多指令遵循上限也仅仅停留在 5 到 6 个约束;当并发约束数达到 7 个时,最强模型的整题通过率就已经跌破 50%;而在测试的 15 个模型中,有 12 个在并发约束达到 4 个时就已全面失守。

确定性标尺下的饱和相变

以往研究多重指令遵循的基准测试,往往受限于两个短板:要么像早期的 IFEval 一样,并发约束数最多只测到 3 个,无法看到高负载下的退化曲线;要么像 FollowBench 或 RECAST 一样,高度依赖 GPT-4 作为评判者。然而在多个复杂约束交织的高负载区间,作为裁判的模型本身同样会出现约束饱和与漏判,使得评测信号在最关键的退化边缘失真。

CSE 彻底摒弃了神经裁判,采用程序化生成的 4,527 个探针,把并发约束数量 $k$ 作为一个严格的自变量从 1 线性推向 12。在生成每一个探针时,系统会从 36 种约束构成的算子池中抽取 $k$ 个组合,并通过内置的相容性检查器剔除逻辑上自相矛盾的组合,确保所有测试用例在客观数学上均存在可行解。每个约束都配备了确定性代码检查器,不仅能直接输出通过与否的布尔值,还会计算连续合规分数。

基于这套严密的评测环境,研究团队定义了两个核心指标:一个是反映单个指令平均完成情况的单约束平均通过率 mCSR,另一个是必须同时满足所有 $k$ 个约束才算合格的整题联合通过率 sCSR。同时,将 sCSR 跌破 50% 临界点所对应的并发约束数量,定义为模型的“组合半衰期” $k^*$。

当把 15 个大模型的测试曲线全部拉平对比时,一个普遍存在的物理相变现象浮出水面。所有模型在 $k=1$ 时表现都极其优异,平均整题通过率达到 70.7%,单看每个单项能力都堪称可靠。但随着约束数量 $k$ 的增加,联合通过率并没有按照线性或缓慢凹陷的姿态退化,而是在 $k=4$ 到 $7$ 的区间内展现出极其陡峭的悬崖式崩塌;一旦 $k \ge 10$,几乎所有模型的联合通过率均被彻底压制至趋近于零。

最讽刺的对比发生在 $k=8$ 的中高负荷节点上。在这一层级,主流模型如果单独拎出某一个约束来打分,平均依然能拿到 40.7% 的及格边缘分数;但如果要求模型在同一段输出中同时满足这 8 个约束,整体成功率直接雪崩到了 5.7%。以拥有 4050 亿参数的开源旗舰 Llama 3.1 405B 为例,其单约束通过率依然保有 46.4% 的水准,但在整题通过率上却只剩下了可怜的 12.4%,惩罚差距高达 34 个百分点。全场唯独 GPT-5.5 表现出了一定的鲁棒性离群特征,但即使是这样断层领先的型号,在 $k=7$ 时的联合通过率也已跌穿了半数防线。

不是相互打架,而是乘法累积的数学必然

面对如此剧烈的性能坍塌,研究者通常的第一直觉是:模型在处理多条指令时,上下文内部发生了严重的注意力资源争夺,某些指令的语义表征可能直接覆写或抑制了另一些指令。例如要求“写一篇科技评论”同时“全文不能出现字母 e”,模型可能会因为词汇受限而无法顾及段落数量的要求。

为了验证这种“成对冲突假说”,Meta 团队直接计算了 601 个约束对在同一探针中共存时的成对相关系数 $\varphi$。如果性能崩溃确实是因为特定约束之间存在水火不容的抑制效应,那么在相关性矩阵中应该能观察到大量显著的负相关极值。

统计结果却完全击碎了直觉假设:所有约束对之间的平均相关系数仅为弱正相关的 $\varphi = +0.067$。这一微弱的正相关说明,不仅不存在普遍的成对恶性互斥,反而在很多时候,一个约束如果做对了,往往是因为模型整体生成质量较好,带动其他约束也更容易做对。即使存在极少数相互绑定的联动失败,也仅仅是因为它们共享了某些底层文本特征——例如模型把整篇文章写成了 3 个段落而不是要求的 5 个段落,那么所有挂钩段落计数的下游约束(如某一段的首字母规则、各段长度单调性等)就会被这一个底层错误全盘拖垮,这在本质上依然是单一特性的执行缺陷,而非约束间的高阶交互抑制。

这一发现揭示了相变背后的真正机理:大模型多指令遵循的崩溃,本质上是一个极其纯粹的离散概率累积过程。因为各个约束的失败是高度独立的,满足全部 $k$ 个条件的联合概率,大致上就是各个单约束通过率的简单连乘积。

研究团队构建了一个两阶段衰减模型进行验证。在单约束层面上,随着输入的指令变多,模型对单个指令的注意力被稀释,其平均单约束通过率表现为一个极其温和的指数级下降:在测试数据上,增加一个约束,单约束通过率大约只会衰减至前一状态的 92.2%(拟合公式为 $72.0\% \times 0.922^{k-1}$,在保留测试集上的绝对误差仅有 0.2 个百分点)。

这种单点上看似微不足道的温和损耗,一旦被推入 $k$ 次方的乘法指数世界,就会引发灾难性的雪崩。假设一个模型单项能力的合格率高达 90%,在相互独立的理想状态下,同时满足 2 个约束的成功率是 81%,满足 5 个约束时就只剩下 59%,当约束推高到 8 个时,联合成功率就已经腰斩至 43% 以下;而如果单项通过率因为认知负荷被稀释到 70%,同时满足 8 个约束的概率便会直接暴跌至 5.7%。大模型在多指令场景下的崩溃,不需要任何神秘的高阶语义冲突,仅仅是统计独立性在严苛合规要求下展现出的数学冷酷。

为了进一步确认这种相变不是由“提示词越长难度越大”或者模型采用了某种“应付模式”造成的,研究者设置了严密的对照组。首先,单约束的固有难度在 $k=1$ 到 $k=12$ 的不同层级中经过方差分析证实没有统计学差异;其次,将探针按难度三分位划分为简单、中等和困难组后,哪怕是全部由最简单指令拼成的探针,在 $k$ 达到 9 到 12 时,其联合通过率同样毫无例外地收敛至 1.5% 左右的极低地板水平。甚至连指令在输入提示中的呈现顺序,与最终的执行成功率之间的相关系数绝对值也仅有 0.029。指令的排列组合与相对次序根本无关痛痒,起决定性作用的唯有约束的绝对数量。

约束的脆弱度分级:全局追踪与即时判定的鸿沟

各个约束在整体崩塌过程中虽然表现出高度的统计独立性,但这并不意味着每一种类型的约束在面对并发压力时具有相同的耐受力。当我们将各约束的保留率(即在并发数为 $k$ 时的通过率相对于其 $k=1$ 时基线表现的比例)按维度拆解时,展现出了一条清晰的能力退化梯度链。

不同认知需求下的约束退化速度存在巨大的结构性断层。其中有两类约束表现出截然相反的演化路径:

第一类是具有极强抗衰减能力的词表级或局部负向判定约束,典型的代表包括“离合诗风格的字面规避”(Lipogram,例如全文绝对禁用某个字母)、“禁用指定敏感词”以及“禁止连续出现重复的双字词”。这类约束在并发数高达 8 个以上时,其相对于单约束基线的保留率依然能够维持在 85% 到 95% 之上,表现出近乎免疫组合压力的特性。

第二类则是高度脆弱的宏观结构性与关系型约束,典型的代表包括“精确段落计数”、“句子长度按段落严格单调递增”、“以特定场景图结构输出逻辑实体”以及“报告自身字数的自指性推理”。在并发负载逐级加重的过程中,这些结构性约束丢失基线能力的速率,是词汇级局部约束的整整 2 倍,其置信区间稳定在 1.9 到 2.3 倍之间。

深入探究这两者的底层差异,可以提炼出一个决定性的概念——“理解与维护的鸿沟”(Comprehension-Maintenance Gap)。

像禁用某个字母或排除特定词汇这样的约束,本质上可以被 Transformer 的浅层前向计算直接编译为局部的词表 Logit 掩码。模型只需要在每一步生成 Token 时做瞬时的负向排除,这是一种纯粹的离散判定,不需要对上下文进行漫长的时间序列积分,甚至在模型生成的最初 20% 长度内,只要没有撞车,后续往往就能稳定延续。

相反,精确控制段落数量、维持句子长度的单调递增,或者保证生成的文本满足全局实体拓扑,则要求模型在自回归生成的每一个步骤中,必须在隐层状态中持续维护一个关于全局进度的动态计数器与状态机。模型不仅要规划全局语义,还必须在上下文窗口中动态追踪“当前是第几个句子”、“这个句子已经写了多少个词”、“与前一句相比是否依然满足单调条件”。随着并发指令数量的上升,上下文中的交叉注意力与前向计算容量被各种局部细节撕裂,这种需要跨时间步长久维护的全局状态追踪最先失准。这种理解容易、维护极难的任务特性,使得结构性与关系型指令成为了多约束扩展中最先牺牲的炮灰。

无法投机的推理期与不可能探针下的取舍本能

既然多约束崩塌的核心动力学是相互独立的概率衰减,那么在工程层面,是否存在某种不改变基础模型、仅通过推理技巧或提示工程就能化解崩溃的捷径?

研究团队针对推理期干预进行了三项极具针对性的消融实验:

一是生成前规划(Pre-generation Planning),即强制模型在正式输出前先罗列出每个约束的应对思路与大纲;

二是事后自纠错(Post-hoc Self-correction),让模型在输出后审视所有约束并尝试修正;

三是 Best-of-5 采样,即并行生成 5 次回复,并筛选各单项分数最高的候选。

实验结果给所有试图在推理期走捷径的方案泼了一盆冷水。生成前规划策略在多约束饱和场景下几乎彻底失效,它完全没有拉动任何模型的组合半衰期 $k^*$;哪怕是事后自纠错与 5 次并行重试,在整题联合通过率的指标上,也仅仅把性能崩溃的悬崖边缘往后推迟了区区 1 到 2 个约束数量。因为约束失败是高度解耦且多点散发的,一次生成通常会在指令 A 和 B 上失误,另一次生成则在指令 C 和 D 上失误,单纯的自回归重采样很难撞出所有约束同时合规的奇迹。

这推导出一个对工业落地极为重要的负面结论:由于约束之间弱耦合,不存在任何通过精心设计约束组合、调整提示词中的排列先后顺序来规避崩溃的架构空间。在现有的自回归范式下,唯一能够延缓系统性崩溃的确定性手段,就是不择手段地提升模型对每一个单项约束的基础执行通过率。只有当每个单独分支的基础可靠性逼近绝对上限,乘法累积的指数塌陷才会被物理推迟。

在主线压测之外,CSE 还隐藏了一项极具趣味性且发人深省的子实验:构建了 444 个在形式逻辑上绝对互斥的“不可能探针”(Impossible Probes)。例如,强制要求模型同时满足“全文绝对不包含字母 e”与“必须在正文中引用 telephone 一词”。面对这些从数学上就注定不可能全部合规的任务,全量 15 个模型均没有任何一次侥幸过关,证明了评测体系的绝对确定性。更重要的是,通过观察模型在死局之下主动舍弃谁、保全谁,得以窥见大模型底层的指令优先级本能。

统计显示,在 15 个模型中普遍遵循着三条高度一致的潜意识法则:

首先是具象包含优于抽象规避(在强制包含词汇与字母禁令冲突时,模型保全前者的比例高达 73%,后者为 0%);

其次是禁止类指令优于强制要求类指令(在否定句式与肯定句式冲突时,否定项胜出率达 91%);

最后是自然叙事流优于外加的机械结构(在自由叙述与强行破坏语言流畅度的句式排布冲突时,模型会压倒性地牺牲结构保全行文)。

这种在不可能任务中展现出的优先级倒置,进一步印证了模型的行为并不是真正理解了人类设定的元规则权重,而仅仅是在遵循深层预训练分布中,那些需要更少长期规划阻力、更贴近自然语言流动本质的路径。

重新审视 Agent 与复杂工作流的构建范式

Meta 的这项研究为当前日趋复杂的 AI 应用开发敲响了警钟。在过去一两年的落地实践中,业界习惯于把大模型视作一个具备无限承载能力的智能黑盒,不断在 System Prompt 中堆叠各类格式边界、输出限制、业务协议和负向约束,动辄罗列数十条甚至上百条规则,并理所当然地认为只要模型规模足够大,就能把这些指令全盘内化。

然而,CSE 基准揭示的物理定律清晰地表明,当前架构下的大语言模型,其指令遵循的并发容量极其逼仄。哪怕是当下算力天花板级的旗舰模型,在无外部干预的情况下,其能够高概率全面合规的并发约束数量也仅仅在 5 到 6 个上下徘徊;对于绝大多数主流开源及轻量级闭源模型,当并发指令超过 3 个时,系统实际上就已经进入了无法保证确定性落地的失控区。

这一认知直接动摇了“单次 Prompt 塞入全套业务规范”的设计哲学。如果系统必须面对包含十余个强约束的高规格任务,将希望寄托于模型的自回归规划能力与注意力机制,在统计学上注定会遭遇指数级的失败。

工程落地必须回归到经典的系统分解理念上:

一方面,必须将高维度的复合约束解构为单向的流水线,利用多阶段管道将控制权分散,让模型在单一推理步中只聚焦于极少数需要深层上下文追踪的结构性任务;

另一方面,对于词表过滤、敏感词检查、特定格式组装等抗干扰力强但极耗费模型注意力状态的局部指令,应当尽可能剥离出大模型的生成范畴,交由外部的确定性编译器、正则过滤器或轻量级专用掩码头进行硬性拦截。

大模型确实能够极好地遵循人类的指令,但这仅仅局限于专注、扁平且离散的语境之中。当无数条规则在同一个自回归序列里并发共振时,击垮模型的并不是什么难以捉摸的语义冲突,而仅仅是微小错误在多次连乘下,必然降临的概率极刑。