TSDS:端侧Agent不是想得越久越好,收敛早停与云端分流让推理计算降低高达73%
Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

在端侧设备部署具备推理能力的大语言模型智能体(LLM Agent),目前正面临一个极其尴尬的工程现实:如果不让它进行思维链推演,像多跳问答、代码编写或者机器人具身控制这种复杂任务,小模型几乎无法给出靠谱的动作;但如果遵循标准的 ReAct 框架,放任模型沿着长长的思考路径一直生成下去,端侧极其有限的算力、电池电量与推理延迟会被迅速榨干。
ArXiv URL:https://arxiv.org/abs/2607.26865v1
更糟糕的是,很多研究者直觉上认为“模型多想一会儿总没有坏处,实在不行还能根据置信度向云端求助”。然而,来自美国东北大学(Northeastern University)智能网络系统研究所的最新研究击碎了这种乐观假设。论文揭示了一个关键反直觉现象:在多步交互任务中,端侧小模型如果思考时间过长,往往会在错误的推理路径上自我合理化,产生虚假的“过度自信(Overconfidence)”,进而压低原本可以作为报警信号的不确定性指标。这不仅白白浪费了端侧的计算 Token,还会直接瘫痪向云端大模型求助的分流兜底机制,把错误动作硬生生执行到真实环境中。
针对端侧 Agent 在算力成本、可靠性与云端协同之间的多重冲突,研究团队提出了名为 TSDS(Think Short, Defer Smart,意为“短思考、巧转交”)的协同框架。该方法在端侧模型内部植入轻量级收敛探针,在动作意图稳定时立即截断思考;再结合动作困惑度(Perplexity)判断是否转交云端大模型,并通过统计学上的 Learn-Then-Test(LTT)框架对双重阈值进行联合校准。在 HotpotQA、MBPP 代码生成以及多步家庭机器人规划等典型基准上,TSDS 在严格保证任务成功率下限和云端调用预算的前提下,将端侧每轮任务的思考计算量大幅削减了 43% 到 73%。

为什么端侧 Agent 不能无休止地“深度思考”?
以 ReAct 为代表的智能体范式,其精髓在于将“自由文本推理(Thought)”与“环境可执行动作(Action)”交替执行。智能体每走一步,先在隐藏层和上下文中展开几百甚至上千个 Token 的自言自语,然后再输出具体的工具调用或物理动作。在云端算力充裕的场景下,让大模型自由生成直到遇到固定的终止符(Stop Sequence)并没有太大问题,但将该逻辑照搬到手机、具身机器人或边缘网关等硬件时,瓶颈立刻暴露无遗。
现有的分析表明,在长思维链模型中,最终要执行的动作决策,往往早在思考轨迹进行到一半甚至三分之一时,就已经在模型的隐层激活表征中完成了收敛。也就是说,模型在很早的 Token 位置就已经“打定主意”下一步要做什么,后续生成的几十上百个 Token,大部分属于在既定结论下的文字自洽与修辞填充,是纯粹的后收敛计算浪费(Post-convergence Waste)。
如果仅仅是算力浪费,尚且可以通过设定硬性 Token 上限来缓解,但端侧模型面临的更深层威胁是不可靠性。端侧受制于参数规模,在面对多跳逻辑或环境突发状态时,单凭本地推理难免出错。为了保证系统安全,通常会引入端云级联(Model Cascading)机制:端侧小模型先判断当前动作的不确定性,如果超出安全阈值,就将历史状态打包请求云端的数十倍体量的大模型协助决策。
然而,一旦放任端侧模型进行长轨迹思考,这两个问题就会发生破坏性的负面耦合。模型持续推理的过程,本质上是在不断将自己前面生成的 Token 作为条件概率的先验。当端侧小模型推导出一个错误的次优动作时,随后的冗余推演会让模型陷入局部的认知闭环,导致该动作预测的困惑度大幅下降,不确定性被强行抹平。原本在早期阶段表现得非常明显的“心虚”信号,在长思考结束后变成了极度自信的输出。结果就是端侧既浪费了本地算力,又错失了向云端求助的最佳时机,最终把错误动作送入执行引擎,导致多步任务全盘崩溃。

双阈值协同:截断与转交的交织机理
为了破除这种恶性循环,TSDS 建立了一套紧密协同的感知与拦截管线。该系统由两个核心模块驱动:负责监控端侧思考状态的收敛探针(Convergence Probe),以及负责判断动作风险的云端转交规则(Deferral Rule)。
在端侧模型 $\pi^{\mathrm{edge}}$ 与环境交互的任意时间步 $t$ 中,智能体面对历史轨迹 $H_t$ 开始自回归生成思考 Token。TSDS 并没有被动等待终止符,而是在特定网络层提取每个思考 Token 的隐藏层激活向量 $h_{t,i}^{(\ell)}$。一个极轻量的线性探测器 $\varphi$ 会实时读取这一表征,计算当前的收敛信号 $C_{t,i}$。该信号反映的是一个明确的数学概率:如果此刻强行截断思考并注入终止符,模型当即吐出的动作,是否与放任其思考到最大步数时所产生的动作完全一致。
一旦探测到收敛信号跨过了预设的思考收敛阈值 $\lambda_L$,推理过程立刻被物理中断。此时,系统迅速提取出端侧候选动作 $A_t^{\mathrm{edge}}$,并计算该动作在当前条件下的不确定性指标——通常直接使用动作 Token 的序列困惑度(Perplexity, PPL)。
此时,第二道关卡立刻生效。如果该动作的困惑度指标 $U_t$ 处于安全阈值 $\lambda_D$ 之内,说明端侧模型不仅决策已然收敛,而且对该动作具备高度可信的把握,动作 $A_t^{\mathrm{edge}}$ 直接下发给物理或虚拟环境执行;相反,如果困惑度超过了 $\lambda_D$,则意味着即便端侧模型思考稳定,其内在不确定性依然过高,系统便会果断放弃本地动作,将当前完整上下文 $H_t$ 抛送给性能更强的云端模型 $\pi^{\mathrm{cloud}}$,由云端输出高置信度的补偿动作 $A_t^{\mathrm{cloud}}$ 替代执行。

这一协同设计的精妙之处,在论文给出的动态时序示意图中体现得淋漓尽致。当端侧智能体面对困难任务走向歧途时,在思考轨迹的早期位置 $\tau^*$,收敛探针的分数就已经越过了收敛阈值 $\lambda_L$。此时观察模型的困惑度曲线,它恰好高位运行,稳稳穿透了转交阈值 $\lambda_D$,从而极其干净地触发了云端求助机制。然而,如果关闭收敛探测,允许模型继续在错误方向上“深入思考”,困惑度就会随着 Token 的累加出现剧烈俯冲,迅速跌落到转交阈值之下。长思考不仅没有纠正错误,反而赋予了错误动作极高的虚假置信度,彻底瓦解了转交机制的防线。
走出经验调参:无分布假设的有限样本理论保证
即便从架构上理顺了收敛截断与云端转交的协同路径,在工业级落地中仍有一个严苛的数学鸿沟:双阈值向量 $\boldsymbol{\lambda} = (\lambda_L, \lambda_D)$ 应该如何确定?
在现实场景中,盲目激进地截断思考可能会导致动作尚未成熟就被强行取出,使得端侧模型输出劣质动作,进而无端推高困惑度,引发向云端泛滥的无效转交;而如果转交阈值设得太严或太松,要么会导致端侧把云端配额瞬间耗尽,产生巨额网络与 API 账单,要么会导致系统准确率大幅滑坡,失去工程可用性。这种在任务奖励 $R(\boldsymbol{\lambda})$、云端调用率 $C_D(\boldsymbol{\lambda})$ 与本地思考成本 $C_L(\lambda_L)$ 之间的多目标平衡,极难通过人工经验或简单的网格搜索来拍板。
TSDS 引入了严谨的统计学习框架——Learn-Then-Test(LTT)。这项技术的核心价值在于,它不需要对数据分布或环境动力学做任何严苛的先验假设,就能在有限的校准样本集上,为系统提供具备严格置信度的风险控制下界。
具体而言,部署团队可以在系统上线前指定两个明确的业务红线:预期的单任务最低平均奖励下限 $R^{\min}$,以及能够承受的单任务最大云端转交预算上限 $C_D^{\max}$。在由多组 $(\lambda_L, \lambda_D)$ 候选值构成的离散网格空间 $\Lambda$ 中,LTT 将参数筛选转化为一个多重假设检验问题。针对每一个候选参数对,算法构建了联合虚拟假设:即该参数对可能导致平均奖励低于底线,或者可能导致云端调用突破预算。
通过在独立的离散校准集上进行前向测试,结合单侧二项分布检验与 Bonferroni 多重比对校正,LTT 能够精准筛除所有不合格的候选参数。数学证明表明,只要校准集与测试集满足独立同分布条件,最终保留下来的参数集合,将以大于等于 $1-\delta$(例如 90% 以上置信度)的概率,在未知测试环境中同时满足任务表现底线和云端流量控制红线。在此基础上,系统只需从所有通过统计认证的合格参数中,挑出那个让端侧平均思考 Token 消耗量 $C_L(\lambda_L)$ 最小的阈值组合,即可完成部署。
覆盖代码、问答与具身规划的实测验证
为了全面检验该框架的实际效能,研究团队在 DeepSeek-R1-Distill-Qwen-7B 作为端侧基模、DeepSeek-R1-Distill-Qwen-32B 作为云端模型的端云协同配置下,横跨了单步代码生成、多步工具问答与多步物理规划三个高异质性场景展开全面评测。所有实验均采用 50 次独立的随机切分重采样,以排除偶然性干扰。
在单步代码生成基准 MBPP 上,智能体需要根据自然语言描述一次性输出完整的 Python 函数并通过所有单元测试,平均每题需要消耗 1166 个思考 Token。实验设定要求任务成功率不低于 0.69,最大转交率控制在 0.70 以内。面对这一基准,仅依赖云端转交的传统方案 ReDAct-CD 虽然也能依靠大模型托底满足成功率要求,但本地小模型每次都必须完整跑完思考预算;而 TSDS 通过收敛探针的精准拦截,在维持相同成功率和转交率的同时,将单任务的平均思考 Token 数从上千个压缩到 500 个以下,计算量直接砍掉 57%。
在更具代表性的多步交互任务 HotpotQA 中,智能体必须在至多 7 个交互轮次内,连续调用搜索、跳转查看和终止等工具收集两份支持性文档。实验对比清晰地展示了机制隔离的效果:如果单纯保留思考截断而完全切断云端求助路径,端侧小模型在多跳推理中的错误会迅速积累,平均奖励曲线会出现断崖式下跌;而引入 TSDS 联合校准后,系统不仅以极其稳定的裕量跨越了预设的奖励底线,且端侧每一步动作的平均思考耗时相比基线骤降了 43% 到 50%。
最能体现 TSDS 机制优越性的场景,是基于 SayCan 和 ALFWorld 理念构建的四房间家庭清洁机器人模拟任务。在这个具身规划环境中,机器人必须在 6 步之内完成物体的寻找、拾取、加热、清洗与放置等长链条物理动作。由于动作空间和物理状态约束极强,一旦一步走错往往全盘皆输。
在这一任务中出现了一个极为值得玩味的实验现象:放任端侧模型全量思考的传统转交策略 ReDAct-CD,其最终拿到的任务奖励居然显著低于早停截断的 TSDS。这一反常结果彻底印证了前述的机理分析:在长程物理规划中,过长的思考链让端侧小模型对自己的错误路线产生了严重的幻觉和过度自信,主动压低了自身的困惑度,导致在最需要云端纠偏的关键物理步数上,转交报警器完全哑火;相反,TSDS 强制进行的思考截断,恰到好处地将端侧模型的真实不确定性暴露在临界状态,使得云端大模型得以在真正艰难的步骤精准介入。最终,TSDS 在思考算力消耗减少 64% 的情况下,反而实现了更高的环境完成率。
端侧 Agent 走向落地的范式重构
综合论文展示的各项实验证据,TSDS 所带来的启示已经超越了某个具体算法的微调,而是直接指向了端侧智能体乃至物理 AI(Physical AI)系统架构设计的底层逻辑演进。
长期以来,工业界在探索端侧大模型落地时,往往陷入“要么全在本地硬扛,要么全面上云”的两难路径。本地模型推理越做越重,为了所谓“自我纠错”拼命拉长思维链,结果在端侧产生巨大的发热和延迟,成功率却依旧被小模型的参数上限死死卡住。TSDS 的成功给出了一个全新的范式指引:本地模型的角色应当从“自闭且固执的独立决策者”,转变为“动作意图敏锐、且善于及时感知自身认知边界的轻量化侦察兵”。
在架构层面,它明确了“端云分工”不能仅仅停留在静态路由或粗暴的失败重试上,而必须深入到模型自回归推理的时序微观结构中去。让端侧模型只思考到决策收敛的那一瞬间,既是对受限端侧算力的极大解脱,更是维护不确定性校准真实性的必要手段。
当然,TSDS 目前仍留有广阔的探索空间。当前实现采用简单的序列困惑度作为不确定性代理变量,在面对语义层面的等价性判断时仍显单薄,未来引入诸如语义熵(Semantic Entropy)等更深层的分布度量,有望进一步缩小与理想转交上限(Oracle)的距离;此外,该方法目前还依赖于显式的思考分隔标识符,如何直接基于通用隐层动力学轨迹去泛化判断意图收敛,将是通向无限制 Agent 部署的下一道技术门槛。
但无论如何,这项工作已经证明:在边缘智能时代,盲目追求端侧的“长考”不仅昂贵,而且常常有害;懂得适时停下来、并在心虚时果断向云端求助的端侧 Agent,才是真正既高效又可靠的工程最优解。