EMRD框架:具身VLM真懂应急逃生?决策靠文本偏见而非空间证据
EMRD:空间理论(ToS)框架首次提出了“空间信念探测”(Spatial Belief Probing),要求智能体在好奇心驱动下自主探索未知环境,并将内部隐式记忆显式转化为连续的拓扑认知地图。本项研究将这一理念推进到了生命安全至上的应急避难维度。
EMRD:空间理论(ToS)框架首次提出了“空间信念探测”(Spatial Belief Probing),要求智能体在好奇心驱动下自主探索未知环境,并将内部隐式记忆显式转化为连续的拓扑认知地图。本项研究将这一理念推进到了生命安全至上的应急避难维度。
为此,研究团队提出了 LAWM-3D 框架,通过揭示并修补传统自监督训练中的“信息泄露捷径”,首次在无标注视频中成功提取出具有真实 3D 几何一致性的潜在动作,并在 16 项评测指标与严苛的分布外(OOD)泛化测试中刷新了 SOTA 表现。
由中国科学院空天信息创新研究院、目标认知与应用技术重点实验室以及上海交通大学人工智能学院等机构组成的研究团队,提出了名为 Lingjing (灵境)的开放城市异构多智能体具身仿真评测平台。
为了打破这种“见过即会、重组即废”的僵局,来自北京师范大学、南洋理工大学与清华大学的研究团队提出了名为 SkillMemo(Skill-Based Memory)的技能记忆增强框架。
W2-VLA:为了打破这一瓶颈,研究团队提出了 。该框架并没有在像素空间去费力重建未来的整幅图像,而是巧妙地在潜空间(Latent Space)中打通了一条“从世界到手腕”(World-to-Wrist)的前瞻通路。
针对这一根本性断层,来自美的集团、中国科学技术大学、西安交通大学与引望智能的研究团队提出了 4D-WAM 。该工作首次将前沿的几何基础模型作为训练期的离线几何导师,为联合预测的未来视频施加 4D 一致性约束;同时揭示了世界模型去噪过程中的“早期决策现象”,提出针对关键决策阶段的时间步重采样策略。
为了打破空间几何与人类动态行为之间的隔阂,来自 Google Research、马普所(IMPRS-IS)、慕尼黑工大(TUM)、KTH 及斯图加特大学的研究团队联合提出了 GESTO (Grounded Event and Spatio-Temporal memOry)。
为了解决这一隐蔽的表征瓶颈,本文提出了 SALT (Semantically ALigned action Tokenizer,语义对齐动作分词器)。它打破了传统动作分词器只顾拟合轨迹坐标的范式,通过引入一个冻结的视觉语言模型(VLM)监督量化后的动作潜在表征,要求其反向推断出任务指令。
为了打破这一困局,来自星尘智能(Astribot)、云天励飞、聚溪科技、香港中文大学与清华大学的研究团队提出了一种名为 ART(Agentic Robot with Tool-use)的全新工具注入微调框架。
针对这一瓶颈,研究者们提出了 OAT (Ordered Action Tokenization,有序动作离散化)。OAT 的核心洞察在于,一个优秀的机器人动作分词器不能仅仅充当离线的无损压缩工具,而必须成为深度契合策略生成与监督特性的“交互接口”。
为了打破这种“模拟器内很漂亮,一上街就抓瞎”的困境,来自东京大学的研究团队提出了全新基准 360CityArena 。该工作直接利用 602 段连续拍摄的 360 度全景视频,在 Unity 引擎中高保真重建了日本东京著名的秋叶原核心街区。
来自中国科学院、上海交通大学以及上海期智研究院的研究团队针对该瓶颈,提出了软硬件协同设计的专用加速框架 Deltoris。该框架敏锐地抓住了机器人高频控制场景中的物理连续性特征——相邻两帧之间的视觉和状态输入往往拥有高达 98% 的冗余。
面对这个难题,来自字节跳动、上海交通大学、清华大学、香港大学和东京大学的研究团队提出了全新视角:将大模型时代的后训练数据选择转化为一个成熟的“工业级推荐系统问题”,并推出了相似性数据挖掘框架 SiMDex 。
为了解决这一由于多模态注意力竞争导致的性能倒退,研究团队提出了 BrainWAM 。该框架受人类大脑左右半球分工与小脑协调机制的启发,放弃了在底层原始 Token 空间的暴力混合,转而在高维紧凑的“动作空间”中对语义先验与预测动力学进行结构化对齐。
来自中国科学院与重庆长安科技的研究团队提出了 DriveVLA-M0 。这项工作不再试图通过无休止的离线全量重训来抹平所有长尾错误,而是开创性地为自动驾驶VLA系统构建了一套带有“失败感知”的结构化隐式记忆库与测试时自适应机制。
来自南洋理工大学、上海交通大学与 ACE Robotics 的联合团队提出了 ForeWAM (Foresight-without-Seeing WAM)。这项研究的核心结论是: 直接策略型的世界动作模型无需在部署阶段真正解码出任何一帧未来画面,就能让动作决策模块享受到高质量的世界动态预见能力。
东京理科大学团队提出的 GaussMemory 打破了这一僵局。该方案放弃了被动存储的死板逻辑,转向由任务驱动的“主动记忆”范式。论文的核心主张是:机器人不应该只是记录它看到了什么,而应该端到端地学会“如何去记”——自主发现哪些物体需要高精度追踪、以多大的激进度进行位置修正,以及何时丢弃无用信息。
凯斯西储大学(Case Western Reserve University)的研究团队提出了一种截然不同的解法: CoRe(Counterfactual Realignment,反事实重整) 。
来自 AMI Labs、Meta-FAIR 与纽约大学(NYU)的研究团队提出了一套优雅而高效的替代方案: Patch Policy 。该研究的核心论点十分清晰: 具身控制真正需要的并非庞大的自回归语言模型,而是未经粗暴压缩的密集视觉特征(Dense Visual Representation...
来自大连理工大学、哈尔滨工业大学、香港科技大学、上海人工智能实验室、深圳河套学院以及香港中文大学等机构的联合研究团队,针对这一长期被忽视的痛点,提出了专为化学自驱实验室设计的机器人故障分析框架 LabRobFail 。
针对全维度物理交互数据的长期匮乏,最新提出的环境感知数据采集引擎 ACE (Ambient Capture Engine)及其衍生的大规模数据集 ACE-Data-0 尝试给出一套系统性的破局方案。
针对这一瓶颈,清华大学研究团队提出了一种名为 CofactVLA 的因果反事实去混淆框架。该方法抛弃了以往依赖数据增强或后处理粗暴相减的做法,将动作生成过程形式化为一个双路径去混淆图(Dual-path Deconfounding Graph, DDG)。
针对长程人本具身决策的核心瓶颈,最新研究提出了全新的评估基准 DunphyBench ,以及一种由偏好条件引导的多模态记忆压缩框架 MeMento 。该工作不仅系统性地揭示了“无节制堆砌多模态历史上下文反而导致智能体决策崩溃”的非单调现象。
PhyAI:同时,研究团队提出了“控制时间 Roofline 模型”(Control-time Roofline),从系统与控制结合的视角,量化给出了具身推理加速在机器人物理闭环中的真正收益边界。