BRACE:具身智能预算化重规划机制,SLO违规率降至4.7%

When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents

在具身智能(Embodied AI)的实际部署中,环境始终充满了不确定性。无论是执行过程中的物理偏移、传感器带来的部分可观察性,还是多智能体协同中的突发状况,都迫使智能体必须频繁地进行“重新规划(Replanning)”以纠正错误。随着视觉-语言-动作(VLA)模型和大语言模型(LLM)成为现代规划器的核心,这种“观察 $\rightarrow$ 规划 $\rightarrow$ 行动 $\rightarrow$ 重新规划”的闭环系统变得越来越智能,但也引入了一个极具破坏性却常被忽视的系统性灾难:无休止的上下文膨胀与不可控的延迟。

ArXiv URL:https://arxiv.org/abs/2608.01428

这篇论文敏锐地捕捉到了当前具身智能评估体系中的一个巨大盲区。传统的研究往往只关注任务的“最终成功率”或“平均延迟”,却忽略了每一次 LLM 重新规划调用背后的系统成本。当智能体不断把历史记录、失败追踪甚至其他智能体的协调信息塞入提示词时,Transformer 模型的推理延迟会出现严重的“长尾效应”。结果就是,即便系统在模拟器里显示任务成功,实际上它在物理世界中已经无数次错过了实时响应的截止时间(Deadline),这种隐蔽的故障模式如果不加干预,将直接摧毁机器人的现实可用性。

为了彻底解决这一系统级瓶颈,研究团队提出了 BRACE(Budgeted Replanning for Agentic Control in Embodied Systems)框架。它创新性地将重新规划视为一个带有严格预算的控制回路。此外,团队还为其配套开发了 E-RECAP 渐进式 Token 剪枝模块。实验数据极具说服力:在 Meta Habitat、RoboFactory 和 AirSim 等多平台上,该机制不仅将重规划的 Token 消耗削减了 62% 到 92%,更在任务成功率饱和的情况下,将延迟 SLO(服务等级目标)违规率从灾难性的 85.5-100.0% 压降至 4.7-50.0%。

隐藏在“高成功率”背后的长尾延迟危机

要理解 BRACE 的价值,首先必须认清当前基于 LLM/VLA 规划器的运行机制。当一个具身智能体在环境中发现执行偏离预期时,它会触发一次重新规划。但与轻量级的传统控制查询不同,大模型的请求极度沉重。它不仅需要完整的任务描述,还需要最近的观察结果、动作历史、失败原因的分析,在多智能体场景下甚至还要加上冗长的通信摘要。

随着任务的推进,这个被称为 $C_t$(第 $t$ 步控制的上下文)的文本量会像滚雪球一样迅速增大,其 Token 长度 $N_t$ 的激增直接导致了底层 Transformer 规划器变得缓慢且呈现出不可预测的“突发性延迟”。在闭环系统中,这种缓慢的调用会进一步拖延执行,导致环境状态发生更大的变化,进而引发下一轮更密集的重新规划,最终形成恶性循环。

论文作者一针见血地指出,大多数具身基准测试仅仅报告任务的最终完成情况。在他们的初步实验中,一个不加任何预算或压缩限制的基线系统(被称为 No BRACE),在三个主流平台上都达到了 100% 的任务成功率。然而,令人触目惊心的是,这个系统在绝大多数的重新规划调用中,都违反了预设的延迟服务等级目标(SLO)。

定性动机示例

正如上图在 Meta Habitat 导航任务中展示的定性示例,当执行噪音加入后,随着重规划历史的累积,上下文急剧膨胀,产生了严重的尾部延迟峰值。系统虽然最终把任务做完了,但在这个过程中,机器人其实处于一种“长时期停顿思考”的僵死状态。这种仅靠成功率掩盖的长尾故障,正是将重规划视为系统级基础原语进行管控的核心动机。

BRACE 控制器:将重规划变成一门“预算学”

面对上述痛点,作者并没有试图去训练一个参数更小、或者绝对速度更快的全新大模型,而是退后一步,从系统架构层面解决问题。BRACE 框架的核心思想非常清晰:把智能体的每一次重规划请求,当成一次需要严格审计和分配预算的投资。

BRACE 作为介于触发信号和实际大模型调用之间的闭环控制器,承担着两个至关重要的职责。

第一步,它必须冷酷地决定“当前是否真的需要重新规划”。在复杂的具身环境中,如果传感器的一点轻微扰动就触发一次长达数秒的 LLM 推理,系统很快就会崩溃。BRACE 引入了一系列稳定性策略,例如“冷却与提交窗口(cooldown/commit windows)”机制,防止在短时间内发生快速震荡和重复调用;同时还具备“故障感知覆盖”功能,如果系统连续遭遇失败,它可以暂时放宽预算限制,允许模型读取更多上下文以寻找突破口,而在常态下则严格收紧权限。

第二步,一旦决定进行重新规划,BRACE 必须选择适当的重规划模式,并分配一个明确的 Token 预算 $B_t$(即压缩后允许输入给规划器的最大长度)以及一个延迟目标 $SLO_t$。这种“带资进组”的设计从根本上改变了规划器的调用逻辑。

BRACE 概览图

如上图所示,BRACE 提供了一个极具操作性的工程接口。更重要的是,它引入了细粒度的“阶段记账法(Phase Accounting)”。在以往的研究中,许多旨在提升效率的模块(例如 RAG 检索、提示词压缩、计划缓存等)往往只报告最终延迟,导致很难界定究竟是哪个环节拖了后腿。BRACE 会记录重新规划调用路径上每一个阶段的时间戳和 Token 消耗。从上下文压缩所需的时间、检索的时间,到实际规划的时间,每一笔“开销”都被详细记录并输出审计日志。这不仅让系统的长尾延迟(如 P95 尾部百分位数)变得透明,还使得公平的“预算匹配”基准测试成为可能——所有试图减少上下文的方法,都必须在相同的严格 Token 预算下证明其保留有效信息的能力,而不是单纯依靠堆砌算力。

E-RECAP:专门针对重规划上下文的渐进式剪枝

有了 BRACE 提供的预算控制框架和审计机制,接下来的挑战是如何在不丢失关键决策信息的前提下,把庞大的上下文压缩到预算 $B_t$ 以内。为此,研究团队设计了 E-RECAP(Embodied REplanning with Cost-Aware Pruning)模块,这是一种感知成本的渐进式 Token 剪枝技术。

需要注意的是,传统的 Token 剪枝往往聚焦于单步查询中的视觉 Token(例如删减图像背景中的无用补丁)。但 E-RECAP 面对的是特殊的“重规划上下文”。在长视野任务中,这些上下文包含了大量的历史尝试轨迹、中间状态摘要等,很多信息在新的环境状态下已经失效或变得多余。

E-RECAP 训练了一个轻量级的预测器,利用模型中间层的隐藏状态来对上下文中每个 Token 的重要性进行打分。它的剪枝不是一步到位的粗暴截断,而是沿着 Transformer 的选定层级渐进式地进行。

同时,E-RECAP 巧妙地保留了结构上的刚性约束:它始终将头部(通常包含核心任务指令)和尾部(通常包含最近的观察和动作请求)的 Token 设定为免死金牌(保留集),仅在中间累积的历史记录中,根据预测效用剔除那些得分最低的冗余 Token。通过这种方式,输入到最终决策层的上下文不仅满足了 BRACE 下发的预算约束,还最大限度地保留了引导正确纠错的关键信息。

压倒性的实验证据:多平台上的长尾治理

为了证明这种尾部感知的每调用预算机制并非纸上谈兵,研究人员在多个极具代表性的具身模拟平台上进行了严格评估。

在 Meta Habitat 的导航场景中,引入最短路径执行噪音后,如果没有 BRACE 的约束,系统为了纠错会导致上下文无限制生长,尽管取得了 100% 的成功率,但其面临着 85.5% 的 SLO 违规率。而当 BRACE 与 E-RECAP 组合介入后,在完全不降低成功率的前提下,每次调用的 Token 数量骤降了 71-76%,重规划延迟降低了 2.1 到 2.6 倍,SLO 违规率更是直接断崖式下降至 4.7%。

在更复杂的 RoboFactory 协调操作以及 Microsoft AirSim 的多智能体交互场景中,效果同样显著。特别是在 AirSim 的无人机路口协调基准测试中,由于多台无人机需要不断交换意图和避障信息,上下文极其庞大。

AirSimNH 上的定性比较

上图清晰地展示了 AirSim 任务中的对比情况。无预算的基线系统由于处理海量历史消息,产生了严重的延迟,它将过期的决策不断累积到同一个触发窗口中,导致无人机在交互期限内无法及时做出避让动作。相比之下,BRACE 通过有效的剪枝和预算管控,极大地缩短了实际的重规划路径,用远低于基线的截止时间违规次数完成了高风险的交互。

更令人兴奋的是在 RoboFactory 的困难设定下(开放循环策略、冻结计划基线以及无 BRACE 的大模型全部彻底失效的场景)。面对极高的环境动态性,普通的系统要么因为不重规划而直接撞墙,要么因为重规划太慢而错过操作时机。在这种绝境下,BRACE + E-RECAP 依然强韧地达到了 80.0% 的成功率,并且仅仅产生了 4.6% 的 SLO 违规,证明了其在不同具身形态和任务难度下的普适性与统治力。此外,作者还在实物机器人(如 PickFruit 和 PushT 任务)上进行了小规模验证,物理执行的结果进一步印证了仿真环境中的结论,系统级预算不仅是软件上的优化,更是机器人落地现实的关键屏障。

系统成本不再是盲区

这项工作对当前狂热的大模型具身智能研究具有强烈的纠偏意义。在过去的很长一段时间里,社区都在疯狂追求更强大的 VLA 模型、更复杂的 Prompt 工程,试图让机器人表现出更接近人类的推理能力。但计算资源从来都不是无限的,物理世界的时间流动更不会为了等待模型的推演而暂停。

当“重新规划”成为现代具身智能最底层的安全保障时,它自身的延迟和卡顿就成了系统最致命的弱点。高成功率不应成为掩盖长尾延迟的遮羞布。通过将运算开销视为和物理动作同等重要的“控制变量”,BRACE 及其阶段记账理念,强制要求研究者在设计新算法时,必须直面从请求发出到指令返回的系统级真实成本。

对于未来的研究而言,本文提出了一个极其务实的倡议:以后的具身智能基准评估,除了报告传统的任务成功率之外,应当强制要求报告调用粒度的尾部延迟(如 P95/P99)以及 SLO 违规率。只有当我们在预算约束的铁笼中依然能跳出优雅的舞蹈,大模型驱动的具身智能才算真正拿到了走向现实物理世界的通行证。