具身智能

EMRD框架:具身VLM真懂应急逃生?决策靠文本偏见而非空间证据

EMRD:空间理论(ToS)框架首次提出了“空间信念探测”(Spatial Belief Probing),要求智能体在好奇心驱动下自主探索未知环境,并将内部隐式记忆显式转化为连续的拓扑认知地图。本项研究将这一理念推进到了生命安全至上的应急避难维度。

LAWM-3D:破解人类视频动作捷径,具身世界模型泛化新范式

为此,研究团队提出了 LAWM-3D 框架,通过揭示并修补传统自监督训练中的“信息泄露捷径”,首次在无标注视频中成功提取出具有真实 3D 几何一致性的潜在动作,并在 16 项评测指标与严苛的分布外(OOD)泛化测试中刷新了 SOTA 表现。

4D-WAM:给自动驾驶世界模型注入4D几何监督,高难榜单提升3.7分

针对这一根本性断层,来自美的集团、中国科学技术大学、西安交通大学与引望智能的研究团队提出了 4D-WAM 。该工作首次将前沿的几何基础模型作为训练期的离线几何导师,为联合预测的未来视频施加 4D 一致性约束;同时揭示了世界模型去噪过程中的“早期决策现象”,提出针对关键决策阶段的时间步重采样策略。

SALT:动作对齐语言,机器人控制成功率从42.7%提升至71.9%

为了解决这一隐蔽的表征瓶颈,本文提出了 SALT (Semantically ALigned action Tokenizer,语义对齐动作分词器)。它打破了传统动作分词器只顾拟合轨迹坐标的范式,通过引入一个冻结的视觉语言模型(VLM)监督量化后的动作潜在表征,要求其反向推断出任务指令。

360CityArena:东京大学实景重建秋叶原,最强AI导航得分仅17.1%

为了打破这种“模拟器内很漂亮,一上街就抓瞎”的困境,来自东京大学的研究团队提出了全新基准 360CityArena 。该工作直接利用 602 段连续拍摄的 360 度全景视频,在 Unity 引擎中高保真重建了日本东京著名的秋叶原核心街区。

SiMDex:像推荐系统一样精选5%人类视频,灵巧手成功率达61.1%

面对这个难题,来自字节跳动、上海交通大学、清华大学、香港大学和东京大学的研究团队提出了全新视角:将大模型时代的后训练数据选择转化为一个成熟的“工业级推荐系统问题”,并推出了相似性数据挖掘框架 SiMDex 。

BrainWAM:动作空间解耦打破跨模态干扰,NAVSIM双榜达89.6分

为了解决这一由于多模态注意力竞争导致的性能倒退,研究团队提出了 BrainWAM 。该框架受人类大脑左右半球分工与小脑协调机制的启发,放弃了在底层原始 Token 空间的暴力混合,转而在高维紧凑的“动作空间”中对语义先验与预测动力学进行结构化对齐。

DriveVLA-M0:结构化失败记忆解耦修正,26ms低延迟拿下94.1分

来自中国科学院与重庆长安科技的研究团队提出了 DriveVLA-M0 。这项工作不再试图通过无休止的离线全量重训来抹平所有长尾错误,而是开创性地为自动驾驶VLA系统构建了一套带有“失败感知”的结构化隐式记忆库与测试时自适应机制。

ForeWAM:不生成未来视频,如何让机器人决策拥有“预见力”?

来自南洋理工大学、上海交通大学与 ACE Robotics 的联合团队提出了 ForeWAM (Foresight-without-Seeing WAM)。这项研究的核心结论是: 直接策略型的世界动作模型无需在部署阶段真正解码出任何一帧未来画面,就能让动作决策模块享受到高质量的世界动态预见能力。

GaussMemory:统一3D高斯读写,长程机械臂操作超越π0-FAST达6%

东京理科大学团队提出的 GaussMemory 打破了这一僵局。该方案放弃了被动存储的死板逻辑,转向由任务驱动的“主动记忆”范式。论文的核心主张是:机器人不应该只是记录它看到了什么,而应该端到端地学会“如何去记”——自主发现哪些物体需要高精度追踪、以多大的激进度进行位置修正,以及何时丢弃无用信息。