AsymSpec:小模型读全文大模型读摘要,用0.2倍算力找回90%精度
AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

在构建基于大语言模型的智能体(Agent)系统时,工程师们几乎都会撞上一堵难以逾越的高墙:上下文膨胀。从多轮对话历史、工具返回的冗长 JSON、外部知识库检索出的海量切片,再到多模态交互生成的信息,上下文窗口往往会迅速拉长到几万乃至几十万 Token。随着每一步操作不断累积,Transformer 在推理阶段的前向传播延迟呈现超线性暴增,长上下文直接成了生产环境中最沉重的开销负担。
ArXiv URL:https://arxiv.org/abs/2608.26004v1
为了压低服务延迟和运行成本,行业里最常用的折中手段就是上下文压缩。无论是用小模型提取摘要、通过 Prompt 剪枝工具剔除次要 Token,还是在多模态工作流中只把高阶 Caption 喂给模型,压缩确实立竿见影地降低了 Prefill 阶段的计算量。但这往往伴随着代价:大量关键细节被无情抹去,多跳推理链条断裂,工具调用参数丢失,Agent 的任务准确率出现灾难级下滑。面对“吃不消的完整上下文延迟”和“经不起折腾的压缩后性能崩溃”,推理架构似乎陷入了两难。
华为与中国科学技术大学的研究团队在最新论文中给出了一个打破常规的解法:AsymSpec(Asymmetric Speculative Decoding,非对称推测解码)。这项工作敏锐地捕捉到了长上下文推理背后的计算非对称性——主导延迟的是参数庞大的大模型(Verifier),而轻量级草稿模型(Drafter)哪怕读完数万字,计算开销依然极其微小。研究团队打破了推测解码领域长期默认的“草稿模型与验证模型必须输入完全相同 Token”的对称假设,让小模型通读完整上下文,大模型只看极度压缩后的摘要,再通过精巧的对比 Logits 融合与自适应门控完成纠偏。
实验结果极为亮眼:在四大 Agent 孤立能力评测以及端到端 GAIA、SimpleQA 智能体基准上,AsymSpec 仅以完整上下文基准 0.2 至 0.3 倍的计算量(FLOPs),实现了 1.3 到 1.7 倍的端到端吞吐加速,同时成功找回了因压缩丢失的绝大多数推理精度,平均恢复到全上下文水平的 90% 左右。这项技术甚至可以直接让纯文本大模型以零硬件改造的姿态,借由视觉草稿模型获得敏锐的多模态图表理解能力。

对称性迷思:推测解码为何在长上下文压缩前失效?
推测解码(Speculative Decoding, SD)是近年来大模型高效推理的标配技术。其经典逻辑并不复杂:由一个小参数的草稿模型快速串行生成若干个候选 Token,再交由大参数的验证模型一次性并行打分;只要候选 Token 落在验证模型的概率分布接受区内,就能以几倍的速度推进解码进度,同时在数学上严格保证输出分布与纯大模型完全等价。
然而,现存所有的推测解码架构(包括 Medusa、EAGLE 及其各类 KV 缓存稀疏优化变体)都受制于一条心照不宣的铁律:输入一致性。验证模型看到了什么,草稿模型就必须看到什么。在传统的推理场景中,这保证了验证的目标分布是固定的。但在 Agent 的长上下文压缩场景下,这种对称性直接剥夺了推测解码解决核心矛盾的能力。
如果为了保证精度让两边都读全量上下文,大模型的验证前向传播依旧奇慢无比,推测解码无法打破长序列带来的算力惩罚;反过来,如果为了追求吞吐而对上下文进行压缩,并将压缩后的内容同时喂给小模型与大模型,推测解码就只能“加速一个已经变傻的模型”,根本无法恢复被压缩丢弃的上下文信息。
问题的突破口恰恰在于两者的计算不对称性。大模型的前向计算不仅受制于庞大的权重矩阵,在长上下文下还会产生极其庞大的 KV Cache 显存读写瓶颈;而一个小参数模型(例如 1B-4B 级别)在前向处理万级 Token 时,耗时和能耗相比 32B 或 70B 级别的大模型只占极小的比例。既然如此,为何不彻底解耦两者的视野?让轻巧灵活的小模型扛起“阅读长篇大论”的脏活累活,把最容易导致大模型卡顿的长上下文在验证端彻底砍掉,再由小模型在解码过程中把关键信息“输送”回大模型的决策中。
这便是 AsymSpec 的出发点。但要让“大盲眼”验证模型顺利采纳“全知全能”草稿模型的建议,必须解决两个致命的技术挑战:第一,草稿模型本身的参数小,如何保证它带给大模型的是客观的事实增量,而不是小模型自己胡思乱想的幻觉偏见?第二,当压缩后的输入与原输入差异极大时,草稿模型生成的词必然与大模型原本基于残缺输入的预测产生分歧,传统的固定阈值拒绝采样机制会瞬间崩溃,导致极高的拒绝率,最终拖垮整体推理速度。
对比 $\delta$-fusion:提纯纯粹的上下文信息增量
为了让小模型安全地将全量上下文的信息注入大模型,AsymSpec 没有直接拿草稿模型在全量上下文下的预测结果去强行覆盖,而是巧妙地引入了对比解码(Contrastive Decoding)思想,构建了同模型跨上下文的对比 Logits 融合机制。
具体而言,设任务的全量提示词为 $x_{\text{full}}$,经过黑盒压缩算法(如 LLMLingua-2 剪枝、API 签名截断或文本摘要)处理后的短视图为 $x_{\text{comp}}$。在推测解码的每一个循环中,系统内部实际并行了三次前向传播:草稿模型 $S$ 分别在 $x_{\text{full}}$ 和 $x_{\text{comp}}$ 上进行前向计算,分别得到两组 Logits 分布 $a_i$ 和 $b_i$;而大参数验证模型 $L$ 则严格只在压缩视图 $x_{\text{comp}}$ 上计算,得到 Logits 分布 $t_i$。
这里的核心数学操作在于信息差值的提取:
\[\delta_i = a_i - b_i\]这一步的物理意义极其优美。由于 $a_i$ 和 $b_i$ 均来自于同一个草稿模型,该模型内部固有的语言习惯、参数量不足导致的归纳偏置、以及非上下文相关的概率先验,在这场相减运算中被几乎完全抵消。剩下被单独分离出来的差值向量 $\delta_i$,高度纯化地代表了“未压缩上下文究竟额外提供了哪些知识增量”。
随后,系统将提取出的信息增量注入大模型的验证空间,形成最终引导决策的综合 Logits:
\[d^{\prime}_i = \arg\max\bigl(t_i + \beta \, \delta_i\bigr)\]其中 $\beta \in [0, 1]$ 充当了调节注入强度的操纵杆。验证模型 $L$ 压根不需要在注意力机制中去一一扫描数万个历史 Token,仅仅通过叠加上这一层由草稿模型提炼出的偏置向量,它的预测分布就被神奇地“拉回”到了如果它亲自读取全量上下文时才会做出的高智力决策区间。
论文的消融实验深刻印证了这一设计的精妙之处。如果抛弃相减步骤,直接用草稿模型的全量 Logits $a_i$ 辅助大模型,性能会出现明显的倒退;而如果模仿以往对比解码的方法,用大模型减去小模型的跨模型差值($t_i - b_i$),在 LongBench 上的评分更是出现了多达 11.7 分的塌方。这说明,只有在相同模型内部剥离压缩前后的差异,才能在不引入额外能力杂质的前提下,真正做到只输送纯净的上下文记忆。
CDA 门控:打破固定阈值下的分歧死锁
提纯了信息增量后,另一个棘手的工程难题随之浮现:如何在大模型验证这些由小模型生成的草稿 Token 时保持高接受率?
在传统推测解码中,大模型和草稿模型读取的上下文完全相同,两者的分歧仅仅来自于模型大小带来的理解深浅,验证阶段采用固定的置信度或拒绝采样阈值 $\gamma$ 即可平稳运作。但在 AsymSpec 中,由于验证模型只能看到干瘪的压缩文本,一旦某个决定性线索只存在于全量原文中,草稿模型生成的正确候选词,在只读了压缩摘要的大模型看来可能完全是“无中生有”,概率极低。在固定阈值控制下,大模型会频繁判定草稿模型“产生幻觉”而执行拒绝操作,退回单步回退循环。这样不仅丢掉了小模型好不容易找回的信息,推测步长退化更会让端到端延迟急剧增加。
为了破解这一矛盾,AsymSpec 设计了一个完全无需额外参数训练的上下文分歧自适应门控机制(Context-Divergence Acceptance, CDA)。
CDA 的核心直觉非常朴素:当全量上下文和压缩上下文输出的预测几乎一样时,说明压缩并没有丢掉核心要素,大模型应当保持严格的审视标准;反之,当两套上下文导向了完全不同的概率倾向时,说明压缩丢弃了关键信息,此时大模型必须主动放宽接受门槛,给予读过全量原文的小模型更多的信任空间。
算法首先计算草稿模型在全量和压缩状态下的输出概率分布之间的 Jensen-Shannon 散度(JSD):
\[D_i = \mathrm{JSD}\bigl(\mathrm{softmax}(a_i) \,\|\, \mathrm{softmax}(b_i)\bigr)\]随后,利用该位置的散度大小对原本固定的验证阈值 $\gamma$ 进行动态指数松弛:
\[\gamma_{\text{eff}}(i) = \gamma \cdot \exp(-D_i)\]只有当压缩文本下大模型给出的候选词概率满足以下不等式时,该词才被直接接受:
\[[\mathrm{softmax}(t_i)]_{d_i} > \gamma_{\text{eff}}(i) \cdot [\mathrm{softmax}(b_i)]_{d_i}\]一旦出现首个未通过该测试的 Token,系统便立刻终止当轮前向展开,并在该位置直接输出经过上文提到的 $\delta$-fusion 修正后的 Token。
由于 JSD 的取值被数学严格限定在 $[0, \ln 2]$ 之内,动态有效阈值 $\gamma_{\text{eff}}$ 被精确锁定在 $[\gamma/2, \gamma]$ 的稳定区间。这一约束既防止了门控在遇到极端分歧时彻底失控沦为“盲目采纳”,又成功化解了因为信息不对称而导致的草稿大面积误杀。实验表明,即便面对极为严苛的高倍率上下文截断,AsymSpec 的 Token 接受率依然坚挺地维持在 0.85 到 0.90 的极高区间,彻底保障了解码循环的加速效能。
全方位实验:找回90%精度的同时斩获多倍效能
研究团队在主实验中选用 Qwen3-32B 作为主验证模型,搭配 Qwen3-4B 作为草稿模型,并使用 Llama 系列验证了跨模型家族的通用性。测试涵盖了长文本多跳问答(LongBench)、复杂多轮指令遵循(MultiChallenge)、多步骤工具调用(API-Bank)三大关键能力,以及 GAIA 和 SimpleQA 两个完整的端到端智能体闭环基准。
在所有基准的对比中,研究统一设定了明确的参照坐标系:只给大模型读压缩文本的最低基线(Floor)、大模型硬读全量上下文的理想性能天花板(Ceiling)、在全量上下文上运行的标准推测解码(SD),以及在此前文献中广受关注的单上下文对比推测解码(SCD)。
从孤立能力的评测数据来看,在需要深入检索海量背景信息的 LongBench 以及需要精准调配参数的 API-Bank 工具调用任务中,单纯依靠压缩上下文的大模型表现惨淡,准确率往往直接被腰斩。而 AsymSpec 展现出了近乎力挽狂澜的修正能力:在 LongBench 上缩小了多达 59% 到 94% 的落后差距,在 API-Bank 上更是完全抹平了压缩导致的精度损失,整体恢复率逼近全上下文天花板。
更有说服力的是针对压缩程度的单调性分析。当研究人员在 LongBench 上对验证模型的截断长度进行逐级压缩扫描时,AsymSpec 展现出了极高的鲁棒性:
-
当上下文预算被极度压缩至 500 Token 时,普通压缩基准的准确率彻底崩溃,而 AsymSpec 通过全量草稿模型的引导,直接将性能提升了 26.7 个 F1 点;
-
随着截断预算逐步放宽到 1.2 万 Token,压缩本身造成的损失逐渐减小,AsymSpec 带来的增益也极其平滑自然地收敛至 0.8 点;
-
整个过程中,接受率自始至终稳定在 0.85 附近。
这有力地证明了一点:AsymSpec 并不是在无脑拟合某种偶然的分布,它的补偿机制恰恰在“压缩摧毁关键信号”的危险时刻最强力地介入。而在像 MultiChallenge 这种本身对上下文依赖并不苛刻的任务上(全量与压缩天花板仅差 3.0 分),AsymSpec 基本保持静默,绝不画蛇添足。
在宏观计算效率上,得益于主验证模型始终只处理小体量的压缩输入,系统的整体预填充算力消耗大幅骤降至基准全上下文运行的 20% 至 30%(0.2-0.3× FLOPs),而在主流单卡加速硬件上的端到端吞吐量则稳步提升了 1.3 到 1.7 倍。对于高并发且依赖长轮次思维链推理的生产环境而言,这种算力节约和吞吐收益具有极高的商业变现价值。
跨模态扩展:让纯文本大模型“偷看”世界
除了在纯文本领域的优异表现,AsymSpec 最具颠覆性的扩展在于其对多模态推理的重塑。
长期以来,多模态大模型的服务成本都极其高昂。如果团队手上已经有一套成熟、稳定且低成本的纯文本主力大模型(例如 32B 或 70B 级推理引擎),想要让它具备图像理解能力,传统的办法通常十分笨拙:要么通过 OCR 和外部图像 Caption 模型预先将图片翻译成文本,但这样会丢失复杂的空间拓扑与细粒度视觉细节;要么彻底推倒重来,重新部署极耗显存的超大多模态模型。
AsymSpec 的数学抽象天然消解了输入模态的物理边界。因为无论是视觉语言模型(VLM)还是纯文本语言模型,它们在输出端共享同一套词表空间 $\mathcal{V}$。这意味着,计算 Logits 差值 $\delta$ 以及评估有效门控 $\gamma_{\text{eff}}$ 的全过程,全部发生在最终的 Token 概率分布阶段,完全不需要草稿模型和大模型的输入维度保持一致。
研究团队巧妙地将草稿模型替换为 Qwen3-VL-2B-Instruct,让它直接吃进未加工的高清原始图像作为 $x_{\text{full}}$;而主体验证模型则保持纯文本 Qwen3-32B,仅仅读取由外部简单生成的 OCR 文本和简短 Caption(作为 $x_{\text{comp}}$)。在 MathVista 数学图表综合推理基准上,这种“跨模态非对称推测”直接拿下了 53.9% 的准确率,相较于只看 Caption 的对称推测解码,大幅跃升了整整 10.1 个百分点。
在几何解题(GPS)这类对数值结构敏感的任务中,简单的 Caption 已经够用,AsymSpec 带来的提升相对温和;但在极度依赖视觉定位和复杂图表因果分析的 FQA(Figure QA)子集上,AsymSpec 的分数直接从基底的 40.5% 跃升至 57.2%。这生动地表明:轻量级 VLM 草稿模型在底层承担了极其昂贵的高清视觉特征感知,并将视觉锚点提炼为引导信号注入给只懂文字的大模型;大模型则专心运用自己强大的逻辑规划能力输出严谨推理。即使大模型完全无法直接感知像素,也能在小模型的“隔空代读”下顺利攻克复杂的视觉推理难题。
推理引擎的非对称演进
回溯整篇论文的工作,AsymSpec 的价值不仅在于提出了一个精巧的推测解码新变体,更在于它向大模型工程界传达了一个深刻的认知升级:在长文本与智能体时代,“让所有模型处理相同输入”是一场巨大的算力浪费。
现代 Agent 面对的真实世界注定是信息过载的。检索增强生成(RAG)找回的一长串文档、多工具执行后吐出的无序日志、代码执行的报错回溯,这些长文本信息必须被完整阅读,但并不一定需要由那个最昂贵、最具智慧的大模型亲自一个词一个词地吞吐。
AsymSpec 证明了模型能力分工的另一种可能性:依靠一个参数极小但“见多识广”的小模型常驻在上下文的最前线,在全量信息中敏锐捕捉因压缩而遗落的微小线索;昂贵而沉重的大模型则安心坐镇后方,处理精简干练的逻辑摘要,仅在决策分歧的关键节点接受小模型的修正。这种“前端粗读捕获信息增量、后端精算控制推理逻辑”的非对称架构,不仅为高延迟、高成本的 Agent 落地困局凿开了一条高性价比的逃生通道,更为未来异构大模型推理引擎的设计开拓了全新的想象空间。