PhyAI:具身大模型统一推理引擎,端云全栈最高提速4.65倍
PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

在具身智能(Physical AI)的研究与落地中,一个长期被忽视却极为刺痛工程团队的现实是:同一个模型权重,往往要在不同的生命周期中被重写好几次。
ArXiv URL:https://arxiv.org/abs/2608.03682v2
当算法工程师在离线基准测试中验证策略时,使用的是一套包含 Python 逻辑与标准 PyTorch 的评估脚本;当策略被推进到云端进行大规模强化学习(RL)Rollout 采样时,为了吞吐量又必须对接一套分布式批处理系统;而当模型最终被烧录进机器人的板载计算单元(如 Jetson Thor)或挂载在边缘局域网服务器(如 RTX 5090 或专业工作站卡)上做实时闭环控制时,工程师不得不再次针对低延迟进行底层 C++ 重构或算子魔改。这三套环境虽然共享完全相同的网络权重与动作语义,却往往跑在各自为战的推理实现之上。任何一处的算子数值微调或预处理差异,都可能导致策略在实体机器人上的表现发生静默漂移。
大语言模型(LLM)领域早已通过 vLLM、SGLang 等统一推理引擎解决了“评测-采样-部署”的运行时割裂问题,但在具身智能领域,通用的 LLM 引擎却很难直接奏效。具身模型既包含了像 $\pi_{0}$、$\pi_{0.5}$、GR00T 这类由视觉语言骨干与迭代扩散/流动作专家(Action Expert)组成的视觉-语言-动作(VLA)模型,也涵盖了像 Cosmos3 这样动作与多帧视频隐空间协同演化的世界-动作模型(WAM)。它们需要频繁复用多模态上下文、面对反复迭代的求解器状态更新、甚至涉及无分类器引导(CFG)分支,其执行图与纯因果 Token 解码大相径庭。
为了打破这种割裂,来自清华大学、北京大学、北京邮电大学、南京大学以及面壁智能(ModelBest)、铭体科技等机构的研究团队推出了专门面向具身智能的统一推理引擎——PhyAI。PhyAI 在单一代码库内打通了板载部署、边缘服务与云端分布式 Rollout,在主流具身模型上实现了相比官方实现 $1.40\times$ 到 $4.65\times$ 的端到端加速。同时,研究团队提出了“控制时间 Roofline 模型”(Control-time Roofline),从系统与控制结合的视角,量化给出了具身推理加速在机器人物理闭环中的真正收益边界。
模型语义与运行时执行的彻底解耦
要在一个引擎中同时兼顾板载单请求超低延迟、边缘多机共享服务以及云端高吞吐分布式并行,核心症结在于以往的具身推理框架将模型结构与执行策略过深地耦合在一起。
PhyAI 的核心设计原则是:模型适配器(Model Adapter)拥有策略的算法语义,而统一运行时(Unified Runtime)掌握硬件执行策略。
在 PhyAI 的架构设计中,模型适配器负责封装具体网络结构的一切特异性逻辑。这包括多视角相机的特定预处理流程、视觉语言特征的生成与缓存有效性管理、去噪求解器(Solver)的状态演化步进、动作表征的解码,以及分类器自由引导(CFG)的逻辑分支。与此相对,底层的运行时引擎则专注于与硬件紧密绑定的通用系统优化:CUDA Graph 图重放、内核融合与算子分发、显存与 KV 缓存池生命周期管理、离线量化路径,以及跨设备的张量并行(TP)、数据并行(DP)与 CFG 并行调度。
这种边界清晰的解耦带来了一个极具说服力的开发优势:当面壁智能发布其具身基座模型 MiniCPM-Robot 当天,开发团队仅借助 PhyAI 的适配器接口就完成了模型的原生接入,无需改动任何底层调度与图执行服务。同一套代码不仅能在单张 RTX 5090 或板载 Thor 上做极致的低延迟推演,也能直接在 8 卡 H20 集群上无缝启动张量并行与 CFG 协同并行。
压榨算子与图重放:PhyAI 的底层执行优化
具身策略推理有其极端的运行特征。以连续动作流模型(如 $\pi_{0.5}$)为例,在机器人进行闭环控制的单请求(Batch Size=1)场景下,虽然动作专家部分的计算浮点量(FLOPs)只占整个模型推演的极小比例,但由于涉及多步迭代去噪(例如 10 步 Euler 采样),频繁的微小算子调用和显存往返(Memory Traffic)会引发严重的内核发射开销与显存带宽受限。
针对这一问题,PhyAI 在执行层引入了多层次的系统级加速手段:
在算子层面,团队定制开发了多项融合内核。针对小 Batch 下中间激活张量频繁读写 DRAM 的瓶颈,PhyAI 实现了融合的 AdaRMSNorm 以及残差相加与 RMSNorm 的联合算子;在骨干网络中,将 Q、K、V 的投影 GEMM 以及 MLP 层的 Gate 和 Up 投影合并,并把 GeGLU/SwiGLU 激活函数的计算与相乘深度融合。针对 MiniCPM-Robot 的 Qwen3.5 混合骨干,团队用 Triton 编写了因果深度可分离一维卷积(Causal Conv1d)与 SiLU 激活以及 Q/K/V 切分的端到端融合算子,直接将特征写向连续的输出内存空间,避免物化激活张量。仅此一项定制融合,就在 H20 上将推理吞吐由 33.28 Hz 进一步拉升 10.5% 至 36.77 Hz。
在计算图与状态复用层面,具身策略存在着强烈的“前缀静态、动作动态”特征。在 $\pi_{0.5}$ 的推演中,观测相机捕获的图像和语言指令在 10 步去噪过程中是完全不变的。PhyAI 的运行时允许适配器显式声明张量有效性周期:在每次接收新观测时,视觉语言前缀仅计算一次,其键值(KV)张量、注意力元数据、时间步正弦编码表以及各层 AdaRMS 调制表均被持久化驻留;随后,易变的动作隐变量被送入预先捕获的 CUDA Graph 存储桶中快速循环重放。这种显式的状态生命周期划分,将反复的内核调度开销完全从推演关键路径上剥离。
此外,PhyAI 没有机械地将网络算子与固定的算子库写死,而是集成了基于硬件画像的动态分发机制。由于最佳内核的选择强依赖于输入形状、数据类型和具体的 GPU 微架构,引擎会在运行前根据画像库进行决策。例如在处理 $\pi_{0.5}$ 动作专家时,针对 50 长度的动作 Query 检索长前缀注意力矩阵,系统通过基准画像确认 FlashInfer 的 FlashAttention-2 Prefill 实测性能优于默认选择的 FA3,进而在该配置下自动锁定 FA2 执行路径。
在分布式并行方面,PhyAI 支持在调度器层级将动作专家与世界模型进行多维拆分。在 Cosmos3-Nano-Policy 的多卡部署中,PhyAI 巧妙地将 8 张 GPU 划分为数据/条件维度的并行组,使得 CFG 的条件前向(Conditional)与非条件前向(Unconditional)能够在不同的 GPU 集合上重叠并行,最后由分布式聚合层一键合成最终漂移速度向量:
\[v_{\mathrm{guided}}=v_{\mathrm{uncond}}+\gamma\left(v_{\mathrm{cond}}-v_{\mathrm{uncond}}\right)\]如果后续流程需要视频自编码器(VAE)解码生成世界画卷,PhyAI 的调度器会动态将 8 个 Rank 切换为空间分块模式,各卡独立解码 $2\times 4$ 图像网格的一个局部瓦片,再由系统统一缝合输出,充分压榨集群的多设备吞吐能力。
控制时间 Roofline:推理加速到底能换来什么?
做大模型推理优化的工程师往往追求纯粹的单卡延迟降低或 TFLOPS 提升,但具身智能的终极评判标准是机器人的物理控制表现。为了厘清推理优化与实体控制周期之间的内在关联,作者团队提出了 Control-time Roofline(控制时间 Roofline) 分析框架。
在真实的机器人部署中,一个控制周期的总延迟不仅由模型推理时间 $L_{\mathrm{inference}}$ 决定,还包含由传感器曝光读出 $L_{\mathrm{observe}}$、边缘或网络传输 $L_{\mathrm{transfer}}$、服务排队 $L_{\mathrm{queue}}$ 以及底层驱动转换 $L_{\mathrm{actuate}}$ 组成的非推理时间 $L_{\mathrm{noninf}}$:
\[L_{\mathrm{critical}}=L_{\mathrm{observe}}+L_{\mathrm{transfer}}+L_{\mathrm{queue}}+L_{\mathrm{inference}}+L_{\mathrm{actuate}}\]在现代具身策略中,通常采用动作块生成(Action Chunking)与实时分块重叠(Real-Time Chunking, RTC)机制,即在当前动作序列于物理环境(或仿真环境)中执行的窗口期 $L_{\mathrm{env}}$ 内,提前并发生成下一个动作块。在理想的执行流水线下,整个控制步进的耗时取决于瓶颈阶段:
\[L_{\mathrm{overlap}}=\max\!\left(L_{\mathrm{inference}},L_{\mathrm{env}}\right)\]以无量纲的相对环境速度比 $X = L_{\mathrm{env}} / L_{\mathrm{inference}}$ 与控制效率 $Y = L_{\mathrm{env}} / L_{\mathrm{control}}$ 为轴,Roofline 模型清晰划定了两个截然不同的控制边界:
-
推理受限区(Inference-bound):当 $L_{\mathrm{inference}} > L_{\mathrm{env}}$ 时,模型计算速度跟不上机器人的物理消耗速度,系统处于天花板倾斜段。此时,对模型推理的任何系统级加速,都会等比例直接压缩整体控制步长时间,提升机器人的反应频率与闭环敏捷度。
-
环境受限区(Environment-bound):当推理经过大幅优化,达到 $L_{\mathrm{inference}} \le L_{\mathrm{env}}$ 后,系统触碰到控制速率的理论水平天花板。此时动作早已生成完毕并在等待硬件交接,进一步降低几毫秒的推理耗时无法直接提升控制频率。但这个盈余时间裕量(Timing Margin)并非没有价值,它转化为了高价值的工程韧性:可以用来吸收网络通信抖动的长尾延迟、在云端边缘单 GPU 上并发服务更多台机器人、降级采购成本更低的端侧算力芯片,或者在同等控制周期内换入参数量更大、视觉分辨率更高、泛化能力更强的大模型。
基于这一分析,研究人员测量了真实场景下的工作点:在四个标准的 LIBERO 仿真任务套件中,优化后的 $\pi_{0.5}$ 推理已经全面进入了“环境受限区”,具备充裕的冗余时间裕量;而像 Cosmos3 这样动辄消耗超过 1 秒的多模态世界模型,在当前算力下仍然深陷在“推理受限区”,其生成延迟依然是卡死控制闭环的核心瓶颈。
实验评测:端侧提速、多卡扩展与云端 RL 吞吐
论文在涵盖边缘嵌入式设备(Jetson Thor)、桌面旗舰显卡(RTX 5090)、数据中心专业卡(A40、H100)以及多卡集群($8\times$ H20、$8\times$ A100)的丰富硬件上,对 PhyAI 进行了全方位的实测。
在单请求低延迟测试中,对比各模型官方开源的 PyTorch / 参考实现,PhyAI 在全部测试对中均斩获了显著加速。在 RTX 5090 上,$\pi_{0}$ 的单步延迟被缩短为原先的 $1/4.05$(加速 $4.05\times$),$\pi_{0.5}$ 提速 $1.82\times$,GR00T N1.7 提速 $2.28\times$,MiniCPM-Robot 提速 $2.02\times$;在端侧芯片 Jetson Thor 上,各模型也录得 $1.40\times$ 到 $2.78\times$ 的稳定加速比。对于重型世界模型 Cosmos3-Nano-Policy-DROID,在 8 张 H20 组成的集群上(CFG=2, TP=4),官方实现单次动作块推演耗时高达 2.46 秒,而 PhyAI 成功将其压缩至 1.18 秒,带来了 $2.08\times$ 的性能跃升。
更为深刻的系统洞见来自于对静态批处理扩展与模型内部阶段(Phase)的剖析:
对于 $\pi_{0.5}$,在 Hopper 架构 GPU 上运行单请求时,动作专家仅贡献了整个模型 8.8% 的理论计算量,却侵占了高达 57.2% 的实际测量耗时,这揭示了小尺度迭代扩散模型极易受限于带宽与调度的本质。而当批大小扩大至 32 时,动作专家占 GPU 时间的比例骤降至 13.5%,整卡吞吐量达到 100.02 样本/秒,但对应的同步整批延迟从单请求的 22.59 ms 飙升至 319.94 ms。这一量化数据直观地警告系统设计者:若在边缘共享服务器上采用盲目的大 Batch 排队策略,平摊的吞吐虽然好看,但机器人单体等待动作块的时延将超过 300 毫秒,极易诱发物理控制超调或停顿崩溃。
而在分析世界模型 Cosmos3 时,数据呈现出了完全不同的特征。由于扩散生成过程在全尺寸多帧视频隐空间中开展,计算始终由密集的注意力与卷积计算所主导。当 Batch Size 从 1 扩展至 16 时,整批计算耗时从 1.132 秒线形暴增到 15.85 秒,吞吐量仅从 0.883 chunks/s 微增到 1.010 chunks/s(仅提升 14.3%)。这证明重度计算受限的世界模型在单卡上几乎没有批处理合并收益,必须依赖张量并行与流水线拆分。
最后,研究团队在云端强化学习 Rollout 场景中检验了统一后端的威力。在一个由 8 张 A100 组成、单步推演 41 次策略、Batch Size 为 40 的模拟分布式 RL 训练任务中,使用官方推理实现时,策略推演时间占据了整个 Rollout 步长时间的 53.1%;而当将推理后端无缝切换为 PhyAI 后,推理占比大幅压缩至 36.2%(相对下降 31.8%)。在物理仿真环境步进耗时固定的前提下,整个 RL Rollout 阶段的耗时缩减了 26.5%,直接将整体强化学习训练吞吐提升了约 $1.36\times$。
走向标准化的具身推理底盘
长久以来,具身智能领域被研究者戏称为“模型代码各写各的,真机部署各抄一套”。PhyAI 的价值不仅在于端到端将模型推演速度拉升数倍,更在于它向行业展示了具身模型系统软件栈的一种成熟形态:将繁杂多变的机器人控制时序、前后处理和扩散采样逻辑下放至适配器,而将最为硬核的图捕获、多卡通信、动态分发和显存复用沉淀为通用的系统级引擎。
配合 Control-time Roofline 模型的边界界定,具身算法开发者可以跳出盲目追求“每秒生成多少个 Action”的单一视角,精准评估推理提速在何时转化为闭环控制频率的提升,又在何时能转化为承载更强视觉感知的大模型红利。随着具身大模型步入更大规模的数据采集与端云协同迭代,这样一套统一、健壮且兼顾端侧与云端的推理底盘,正在成为连接算法创新与实体物理世界的关键纽带。