多模态&视觉

LAWM-3D:破解人类视频动作捷径,具身世界模型泛化新范式

为此,研究团队提出了 LAWM-3D 框架,通过揭示并修补传统自监督训练中的“信息泄露捷径”,首次在无标注视频中成功提取出具有真实 3D 几何一致性的潜在动作,并在 16 项评测指标与严苛的分布外(OOD)泛化测试中刷新了 SOTA 表现。

SPADE:自适应3D分块稀疏引擎,视频扩散注意力提速3.4倍

他们提出了名为 SPADE 的免训练(Training-Free)、输入自适应稀疏注意力引擎。该框架打破了以往算法设计与系统实现相割裂的局限,从“算法-系统协同设计”出发,构建了一套统一的稀疏表达规范、极低开销的自适应方案生成算法,以及深度适配现代 GPU 架构的执行引擎。

OmniScientist:直接感知多模态原始证据,端到端科研胜率达85%

OmniScientist:真正的科学研究是一个动态闭环:对原始实验数据的直接观察决定了提出什么假说;实验执行后的原始曲线又决定了下一步如何修正方案;最终论文里的每一个主张,都必须严格回溯到观测细节。缺乏端到端感知的自动化系统,本质上只是一个高阶的代码执行器和论文生成模板,难以完成真正具有原创...

FlowBlock:免训练波前并行,扩散大模型吞吐提升4倍精度反增

华中科技大学与小红书团队在最新论文中提出了名为 FlowBlock 的免训练并行解码框架,从底层打破了这一看似不可逾越的块间串行壁垒。该研究敏锐地指出,在以 LLaDA-2.1 为代表的新一代具备“自我纠错”(Token-to-Token, T2T)能力的扩散语言模型中,块的确定性不再是不可妥...

SiMDex:像推荐系统一样精选5%人类视频,灵巧手成功率达61.1%

面对这个难题,来自字节跳动、上海交通大学、清华大学、香港大学和东京大学的研究团队提出了全新视角:将大模型时代的后训练数据选择转化为一个成熟的“工业级推荐系统问题”,并推出了相似性数据挖掘框架 SiMDex 。

VideoVIBE:从静态代码走向交互视频诊断,V2Lens免微调涨分7.18

来自北京人工智能研究院(BAAI)、北京理工大学、北京工业大学、湖南大学、奥克兰大学、澳门大学和悉尼科技大学等机构的研究团队,针对这一痛点推出了视频真值诊断基准 VideoVIBE,并同步提出了免训练的多智能体协同诊断系统 V2Lens。

BrainWAM:动作空间解耦打破跨模态干扰,NAVSIM双榜达89.6分

为了解决这一由于多模态注意力竞争导致的性能倒退,研究团队提出了 BrainWAM 。该框架受人类大脑左右半球分工与小脑协调机制的启发,放弃了在底层原始 Token 空间的暴力混合,转而在高维紧凑的“动作空间”中对语义先验与预测动力学进行结构化对齐。

ForeWAM:不生成未来视频,如何让机器人决策拥有“预见力”?

来自南洋理工大学、上海交通大学与 ACE Robotics 的联合团队提出了 ForeWAM (Foresight-without-Seeing WAM)。这项研究的核心结论是: 直接策略型的世界动作模型无需在部署阶段真正解码出任何一帧未来画面,就能让动作决策模块享受到高质量的世界动态预见能力。