LAWM-3D:破解人类视频动作捷径,具身世界模型泛化新范式
为此,研究团队提出了 LAWM-3D 框架,通过揭示并修补传统自监督训练中的“信息泄露捷径”,首次在无标注视频中成功提取出具有真实 3D 几何一致性的潜在动作,并在 16 项评测指标与严苛的分布外(OOD)泛化测试中刷新了 SOTA 表现。
为此,研究团队提出了 LAWM-3D 框架,通过揭示并修补传统自监督训练中的“信息泄露捷径”,首次在无标注视频中成功提取出具有真实 3D 几何一致性的潜在动作,并在 16 项评测指标与严苛的分布外(OOD)泛化测试中刷新了 SOTA 表现。
来自香港大学与清华大学的研究团队提出了 PhysMind 。这套完全免训练(Training-Free)的智能体框架改变了以往直接让 VLM 端到端脑补的做法:它 为每段视频仅构建一次可复用、与具体问题无关的“可执行物理世界” ,随后借助解析动力学系统辨识。
为了打破这一僵局,研究团队提出了轻量级的句子级检测框架 CAD (Context-Aware Detection,上下文感知检测)。CAD 不仅通过联合建模用户查询、上下文及目标句子的边缘影响来判断其恶意程度。
为此,研究者提出了名为 SPIRAL (Self-improving Path Integration and Realignment)的自监督对齐框架。该框架不需要任何外部标注或更大的教师模型,仅利用大模型自身的原生文本理解能力去纠正渲染图像的理解偏差。
他们提出了名为 SPADE 的免训练(Training-Free)、输入自适应稀疏注意力引擎。该框架打破了以往算法设计与系统实现相割裂的局限,从“算法-系统协同设计”出发,构建了一套统一的稀疏表达规范、极低开销的自适应方案生成算法,以及深度适配现代 GPU 架构的执行引擎。
来自新加坡国立大学、加州大学圣地亚哥分校、浙江大学、南方科技大学等机构的研究团队提出了 Mechanist ,这是首个将 AI 本身作为“科学仪器”,用于全自主探索、解释并干预大模型内部智能机制的 Agent 科学研究系统。
OmniScientist:真正的科学研究是一个动态闭环:对原始实验数据的直接观察决定了提出什么假说;实验执行后的原始曲线又决定了下一步如何修正方案;最终论文里的每一个主张,都必须严格回溯到观测细节。缺乏端到端感知的自动化系统,本质上只是一个高阶的代码执行器和论文生成模板,难以完成真正具有原创...
针对这一洞察,本文提出了无需额外训练的解码算法 Ripple-Pivot Search(RPS) 。该方法不仅在空间上精确定位中熵枢纽(Where),更通过轻量前瞻评估在候选词集合中自适应搜索最优 Token(What)。
这项工作并非简单地堆叠视频时长,而是以构建交互式世界模型为导向,发布了包含 128,892 个视频片段、总计达 2,826 小时的大规模真实世界探索数据集。整个数据集覆盖全球 113 个国家和地区,且全部配备了相机运动轨迹与分层时序对齐标注。
来自哥伦比亚大学、约翰斯·霍普金斯大学、加利福尼亚大学洛杉矶分校(UCLA)等多所高校与机构的研究团队,针对这一长期困扰业界的工程痛点,提出了 Agentic Real2Sim 框架。
华中科技大学与小红书团队在最新论文中提出了名为 FlowBlock 的免训练并行解码框架,从底层打破了这一看似不可逾越的块间串行壁垒。该研究敏锐地指出,在以 LLaDA-2.1 为代表的新一代具备“自我纠错”(Token-to-Token, T2T)能力的扩散语言模型中,块的确定性不再是不可妥...
针对这一本质矛盾,研究团队提出了全新的视觉工具轨迹构建框架 OpenVisTool 。该工作的核心见解在于:一条有价值的教学轨迹,必须同时满足 结果正确性(Outcome Validity) 与 因果效用(Causal Utility) 两个硬性条件。
针对这一核心痛点,来自佐治亚理工学院(Georgia Institute of Technology)与莱斯大学(Rice University)的研究团队提出了名为 DyLaR (Dynamic Latent Reasoning,动态隐式推理)的全新框架。
面对这个难题,来自字节跳动、上海交通大学、清华大学、香港大学和东京大学的研究团队提出了全新视角:将大模型时代的后训练数据选择转化为一个成熟的“工业级推荐系统问题”,并推出了相似性数据挖掘框架 SiMDex 。
来自北京人工智能研究院(BAAI)、北京理工大学、北京工业大学、湖南大学、奥克兰大学、澳门大学和悉尼科技大学等机构的研究团队,针对这一痛点推出了视频真值诊断基准 VideoVIBE,并同步提出了免训练的多智能体协同诊断系统 V2Lens。
团队构建了一个拥有 20.4 万条视频片段、千万级标注的大规模第一人称数据集 EgoAffordance ,并在此基础上提出了统一的多模态视觉-语言-操作引导模型 VLAff (Vision-Language-Affordance Model)。
为了解决这一由于多模态注意力竞争导致的性能倒退,研究团队提出了 BrainWAM 。该框架受人类大脑左右半球分工与小脑协调机制的启发,放弃了在底层原始 Token 空间的暴力混合,转而在高维紧凑的“动作空间”中对语义先验与预测动力学进行结构化对齐。
来自南洋理工大学、上海交通大学与 ACE Robotics 的联合团队提出了 ForeWAM (Foresight-without-Seeing WAM)。这项研究的核心结论是: 直接策略型的世界动作模型无需在部署阶段真正解码出任何一帧未来画面,就能让动作决策模块享受到高质量的世界动态预见能力。
凯斯西储大学(Case Western Reserve University)的研究团队提出了一种截然不同的解法: CoRe(Counterfactual Realignment,反事实重整) 。
来自 AMI Labs、Meta-FAIR 与纽约大学(NYU)的研究团队提出了一套优雅而高效的替代方案: Patch Policy 。该研究的核心论点十分清晰: 具身控制真正需要的并非庞大的自回归语言模型,而是未经粗暴压缩的密集视觉特征(Dense Visual Representation...
针对这一瓶颈,来自字节跳动、北京大学和上海交通大学的研究团队提出了全新的解决方案 SkillLens 。该方案将非结构化的人机交互经验重构成一种名为 视觉技能卡 (Visual Skill Cards, VSC)的状态条件记忆单元,并在推理时采用“低开销检索与按需视觉展开解耦”的机制。
针对这一瓶颈,南京理工大学团队在论文中提出了一套 测试时自演化框架(Test-Time Self-Evolving Framework) ,通过引入“反思引导的策略内自蒸馏”(Reflection-Guided On-Policy Self-Distillation, R-OPSD)。
FilmBench 的提出,标志着视频生成的评测重心正从“普通网民视角的可用性”迈向“专业创作者维度的严苛性”。通过将北京电影学院的视听语言训练体系与前沿 AI 评测技术结合,该基准为模型研发者提供了一面直面工业缺陷的镜子。
微软提出的 Mage-VL 试图从根本上颠覆这种帧级离线处理范式。它借鉴了现代视频编解码器与生物视觉的双系统机制,构建了一套“编解码原生(Codec-Native)”的流式多模态基座模型。