具身智能 第2页

ST-WAM:攻克视频世界模型的幻觉缺陷,真机抗干扰成功率翻倍

为了解决该问题,研究团队提出了 ST-WAM(Semantic-Temporal WAM) 。该方法不纠结于费时费力地“修补”未来像素画面,而是引入自监督视觉基础模型 DINOv3 建立双向语义-时间建模:向前预测鲁棒的语义状态演化,向后检索与当前意图相关的历史动作依据。

LT-Mem:三层时空记忆打破机器人时间遗忘,Token消耗降低一个量级

韩国大邱庆北科学技术院(DGIST)的研究团队针对这一长期未解的痛点,提出了名为 LT-Mem 的易变性自适应时空记忆演进框架。该框架不把环境中的所有实体视为静态背景,也不对其进行无差别的纯文本历史流水账记录,而是建立在多会话统一几何对齐的基础上,引入“物体易变性”(Volatility)这一...

SHAPER:不改权重也能自进化!微软演化技能与脚手架超越微调10.5分

来自微软研究院和东北大学的研究团队在最新论文中提出了一个跳出传统思路的解法: SHAPER 。该框架指出,现代具身智能体本质上是一个围绕基座模型构建的复杂系统,其执行表现不仅由模型权重决定,更受外部程序化指导(技能 Skill)以及上下文组织代码(脚手架 Harness)的直接制约。

RoboPhys-3D:用3D重建解耦生成误差,Cosmos拿下92.7%真值表现

来自 Futurewei、普渡大学与德州大学奥斯汀分校的研究团队提出了 RoboPhys-3D 。这项工作构建了首个以 3D 重建为锚点的具身世界模型评测基准,覆盖 50 个机械臂操作任务、5,000 个交互片段以及 25,000 条多视角真值视频。

小米DriveZero:不依赖人类示范,端到端自动驾驶如何超越真人?

近期,小米团队提出了名为 DriveZero 的全新端到端自动驾驶框架,试图从底层打破对人类轨迹监督的绝对依赖。这项研究的核心结论非常直截了当:即便 完全不使用任何人类驾驶轨迹作为训练目标 ,端到端系统不仅能够学会复杂路况下的闭环驾驶,而且在多个公认的基准评测中超越了真实人类司机以及传统回放专家。

WorldSimProbe:不是能动就行!北大等用1.8万测试例诊断具身物理保真度

针对这一根本痛点,来自北京大学、北京理工大学、EvoPhys AI 以及香港科技大学等机构的研究团队提出了名为 WorldSimProbe 的系统性诊断基准。该研究不再把世界模型当成单纯的视频生成器,而是将其拉回物理模拟器的严苛标准进行检验,提出了具身物理模拟必须满足的“可观测模拟器契约”。

GlanceWAM:把未来视觉想象移出控制主路,48ms解码破解机器人两难

由来自 Drexel、Northeastern、Purdue 和 Virginia Tech 的研究团队最新提出的 GlanceWAM ,给出了破解这一困局的优雅答案。该工作指出,现存的“速度与成功率不可兼得”并非视觉前瞻本身的内在缺陷,而是因为传统方案机械地把庞大的视频生成绑死在毫秒级的高频...

WCM:把世界模型塞进Critic,让具身VLA在149项任务上击败全量SFT

在视觉-语言-动作(VLA)模型的后训练阶段,强化学习(RL)正在成为突破模仿学习天花板的关键路径。然而,当前主流的Actor-Critic范式在机器人操控任务中遭遇了一个隐蔽却致命的瓶颈:大多数Critic模型要么只基于单帧视觉观测,要么直接依赖预训练VLM的单帧隐层特征来估计状态价值。