ST-WAM:攻克视频世界模型的幻觉缺陷,真机抗干扰成功率翻倍
为了解决该问题,研究团队提出了 ST-WAM(Semantic-Temporal WAM) 。该方法不纠结于费时费力地“修补”未来像素画面,而是引入自监督视觉基础模型 DINOv3 建立双向语义-时间建模:向前预测鲁棒的语义状态演化,向后检索与当前意图相关的历史动作依据。
为了解决该问题,研究团队提出了 ST-WAM(Semantic-Temporal WAM) 。该方法不纠结于费时费力地“修补”未来像素画面,而是引入自监督视觉基础模型 DINOv3 建立双向语义-时间建模:向前预测鲁棒的语义状态演化,向后检索与当前意图相关的历史动作依据。
针对这一病灶,本文提出了一种极具工程巧思的解法—— 动作松弛期刷新(Actuation-Slack Refresh) :利用机械臂执行动作块时 GPU 闲置的几百毫秒“物理死区”,在推理关键路径之外无条件执行一次完整的密集前向,给下一步递交一份“干净”的门控信号与基底缓存。
卡耐基梅隆大学(Carnegie Mellon University, CMU)机器人研究所的研究团队针对这一系列瓶颈,推出了全新的协同多智能体闭环评测基准 CMU-Drive ,并提出了首个将协同感知、语言推理与动作规划集于一体的基础模型 V2V-VLA 。
针对这一核心痛点,研究团队提出了名为 FlashDrive 的算法-系统协同优化框架。FlashDrive 并没有大动干戈去重构模型底座,而是针对流水线中四个阶段的具体冗余。
韩国大邱庆北科学技术院(DGIST)的研究团队针对这一长期未解的痛点,提出了名为 LT-Mem 的易变性自适应时空记忆演进框架。该框架不把环境中的所有实体视为静态背景,也不对其进行无差别的纯文本历史流水账记录,而是建立在多会话统一几何对齐的基础上,引入“物体易变性”(Volatility)这一...
研究包含两项核心成果:一是提出专门解耦环境推进与控制计算的动态评测基准 ReflexBench ,支持在同步与异步模式下精准注入真实物理延迟;二是构建了参数量不足 1B 的紧凑型模型 ReflexVLA 。
面对这一两难困境,来自具身智能前沿的研究团队提出了一套创新的非侵入式闭环迭代微调框架—— CLIFT (Closed-Loop Iterative Fine-Tuning)。
针对这两个根因,研究团队提出了名为 FACT (Force-Aware Contact-Rich Manipulation via Timestep Modulation)的框架,无需修改网络骨干或增加数据,仅凭噪声调度重分配与时间感知力注入。
为了验证这套设计准则在现实世界中的有效性,研究团队将 EffVLA 算法配方原封不动地迁移至低成本开源机械臂 SO-ARM101(6-DOF)上。在完全不改动动作头结构与推理配置的前提下,仅将预训练数据替换为该机械臂的社区轨迹数据集。
针对该痛点,来自清华大学、中国科学院、北京交通大学、上海理工大学及 GigaAI 等机构的研究团队提出了 GigaBrain-WBC-0.5 ,这是业内首个面向人形机器人全身控制的“行为世界模型”(Behavior World Model, BWM)。
来自微软研究院和东北大学的研究团队在最新论文中提出了一个跳出传统思路的解法: SHAPER 。该框架指出,现代具身智能体本质上是一个围绕基座模型构建的复杂系统,其执行表现不仅由模型权重决定,更受外部程序化指导(技能 Skill)以及上下文组织代码(脚手架 Harness)的直接制约。
CoTinyVLA 提出的三个组件到底各自发挥了什么作用?作者在 Spatial 套件上进行了细致的因果消融与测试期干预,结果展示出清晰的正交性: 1. 时序输入决定运动学抗扰度 :当把双视角 8 帧历史缩减为单帧时。
来自 Futurewei、普渡大学与德州大学奥斯汀分校的研究团队提出了 RoboPhys-3D 。这项工作构建了首个以 3D 重建为锚点的具身世界模型评测基准,覆盖 50 个机械臂操作任务、5,000 个交互片段以及 25,000 条多视角真值视频。
近期,小米团队提出了名为 DriveZero 的全新端到端自动驾驶框架,试图从底层打破对人类轨迹监督的绝对依赖。这项研究的核心结论非常直截了当:即便 完全不使用任何人类驾驶轨迹作为训练目标 ,端到端系统不仅能够学会复杂路况下的闭环驾驶,而且在多个公认的基准评测中超越了真实人类司机以及传统回放专家。
为此,清华大学智能产业研究院(AIR)、上海交通大学、香港科技大学等多家机构联合提出了 MobileWAM ,首次将视频生成世界动作模型系统性适配到全身移动操作中。
针对这一瓶颈,来自卡内基梅隆大学(Carnegie Mellon University, CMU)的研究团队提出了一种更加逼近全自主进化的新范式—— 极简数据自适应(Minimal-Data Adaptation, MDA) 。
来自阿里巴巴达摩院与湖畔实验室的研究团队提出了具身价值基石模型 RynnValue 。该工作放弃了主观的偏好标注与归一化的虚拟进度,直接回归最优控制理论中最本质的物理物理量: 时间距离(Temporal Distance) 。
中关村学院等机构提出的 World Tokens 给出了一条极具启发性的破解思路: 将世界模型完全限制在训练阶段,推理部署时彻底剥离 。该方案既保留了世界模型带来的物理时空演进监督,又让在线推理维持在毫秒级的纯 VLA 延迟水平。
针对这一根本痛点,来自北京大学、北京理工大学、EvoPhys AI 以及香港科技大学等机构的研究团队提出了名为 WorldSimProbe 的系统性诊断基准。该研究不再把世界模型当成单纯的视频生成器,而是将其拉回物理模拟器的严苛标准进行检验,提出了具身物理模拟必须满足的“可观测模拟器契约”。
针对端到端策略这一根本缺陷,论文《World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models》提出了全新的破局思路—— World Action Planner (简称 WAP )。
由来自 Drexel、Northeastern、Purdue 和 Virginia Tech 的研究团队最新提出的 GlanceWAM ,给出了破解这一困局的优雅答案。该工作指出,现存的“速度与成功率不可兼得”并非视觉前瞻本身的内在缺陷,而是因为传统方案机械地把庞大的视频生成绑死在毫秒级的高频...
为打破这一僵局,来自北京航空航天大学、京东科技与北京大学的研究团队提出了可扩展的数据合成管线 MAGE ,并基于其构建了首个大规模家电操作规划数据集 UseAppliance 。
让机器人学会干活,当前最火的路线莫过于以视觉-语言-动作(VLA)为代表的端到端大模型。将现场摄像头的画面与自然语言任务指令输入进去,神经网络便能直接输出机械臂关节的控制量。
在视觉-语言-动作(VLA)模型的后训练阶段,强化学习(RL)正在成为突破模仿学习天花板的关键路径。然而,当前主流的Actor-Critic范式在机器人操控任务中遭遇了一个隐蔽却致命的瓶颈:大多数Critic模型要么只基于单帧视觉观测,要么直接依赖预训练VLM的单帧隐层特征来估计状态价值。