ACE-Data-0:把家变成多模态影棚,1700万帧全感官数据打通具身长程交互
针对全维度物理交互数据的长期匮乏,最新提出的环境感知数据采集引擎 ACE (Ambient Capture Engine)及其衍生的大规模数据集 ACE-Data-0 尝试给出一套系统性的破局方案。
针对全维度物理交互数据的长期匮乏,最新提出的环境感知数据采集引擎 ACE (Ambient Capture Engine)及其衍生的大规模数据集 ACE-Data-0 尝试给出一套系统性的破局方案。
针对这一瓶颈,清华大学研究团队提出了一种名为 CofactVLA 的因果反事实去混淆框架。该方法抛弃了以往依赖数据增强或后处理粗暴相减的做法,将动作生成过程形式化为一个双路径去混淆图(Dual-path Deconfounding Graph, DDG)。
针对这一困境,开源研究项目 Crayotter 提出了全新范式: GRPB(Group-Relative Preference Backpropagation,组内相对偏好反向传播) 。
针对这一困境,研究团队提出了首个面向连续视频流的深度研究智能体框架 Video-DeepResearch (简称 Video-DR )。该工作打破了传统智能体自由调用工具的既定思维,提出了一种“感知与探索解耦”的分阶段工具解锁机制,强迫模型在跨帧完成穷尽的时空视觉定位之后,才被允许访问外部网络检索。
为此,研究团队提出了完全免训练的长程记忆框架 WorldTrace ,以及专门用于评估场景回访一致性的基准测试 LoopBench 。在不改变原有模型权重、不增加显存峰值的前提下,WorldTrace 实现了 15.5% 的时序一致性提升,并将场景回访的情节召回率提高了 19.5%。
针对这一核心痛点,研究团队提出了名为 FlashDrive 的算法-系统协同优化框架。FlashDrive 并没有大动干戈去重构模型底座,而是针对流水线中四个阶段的具体冗余。
为了让视觉语言大模型(VLM)真正具备统揽全局的工业级规划能力,研究者提出了名为 Hugin 的全流程优化训练框架,并构建了涵盖四种工业真实布局的基准测试集 SortingBench 。实验结果表明,Hugin 在多个开源大模型基座上均取得了显著提升。
基于此,研究团队提出了 RIFT ( Rollout-free Imagination via Future Tokens )框架。RIFT 彻底摒弃了测试阶段迭代式的视频去噪,仅通过引入一组可学习的“前瞻 Token”(Anticipation Tokens)。
山东大学研究团队针对这一核心问题提出了 ClinLens。这是首个面向纵向多模态临床数据科学的长程代码智能体基准评测。通过深度打通并关联 MIMIC 体系下的五大异质医疗数据源,ClinLens 构建了跨越 4 种患者-时间维度与 5 类高频分析能力的 200 项可执行任务。
由 Meta、布朗大学、华盛顿大学、南洋理工大学以及西北大学联合提出的评估框架 HumanCLAW ,给出了一个颇具颠覆性又引人深思的答案。研究团队将未经过特定具身微调的现成(off-the-shelf)前沿模型置于闭环控制中,构建了包含 1,218 个室内长程任务的基准 HumanCLAW-...
本文提出了一个清晰的双轮驱动框架:生成系统的最终表现,本质上取决于“可扩散性”(Diffusability)与“可提示性”(Promptability)的乘积。所谓的 可扩散性 ,指的是一种文本表示格式在多大程度上能够高效、无损、结构化地把像素背后的监督信号暴露给扩散模型。
针对这一两难困境,百度团队在一项最新研究中提出了名为 VideoXAgent 的纯在线长视频智能体框架(Purely Online Video Agent Harness)。
由香港科技大学、新加坡国立大学、中国人民大学及都柏林大学学院等机构组成的研究团队,提出了名为 ToolArtist 的全新框架。与以往“外挂式拼接”的生成智能体完全不同,ToolArtist 基于原生统一多模态模型(Unified Multimodal Model, UMM)进行后训练。
VC-Tooler:该项研究明确提出:视觉工具调用不应被视为对死记硬背参数的拟合,而是一种包含视觉接地(Grounding)、多步组合(Composition)与自适应反思(Adaptation)的通用能力。
Handoff-H1:实验结果呈现出了极其鲜明的断层阶梯。七款采用主流前沿商业闭源模型与开源权重模型搭建的标准 Agent 框架,其综合得分集中在 35% 至 61% 的平庸区间内。这些通用模型在面对跨页面的尺寸链汇总与深层次构造隐喻时,表现出系统性的疲软,普遍在覆盖率不足的同时伴随着大量的数...
由诺基亚、香港理工大学以及佐治亚大学联合提出的 Code-with-Image 框架,彻底推翻了以往“工具提供视觉碎片、语言产出最终答案”的协作逻辑。研究团队给大模型配置了一个纯粹的 Python 解释器,没有任何预设的高层视觉 API:图像直接以底层数据形式进入沙箱。
为了严格证明这一点,研究团队提出了名为 TextCall (只调用、不返回图像)的训练与评测机制:模型照常生成完整的工具调用脚手架(Scaffold),但在工具执行完毕后,系统完全不回传裁剪后的新图像,而是直接用一个固定的文本占位符 [Image output skipped] 替代。
针对这种“无从下手”的极端攻防环境,亚利桑那州立大学(Arizona State University)的研究团队在一篇前沿论文中开创性地提出了 无盒漏洞分析(No-Box Vulnerability Analysis) 新范式,并构建了自动化原型系统 MCPSec 。
来自新加坡国立大学(NUS)、Sea AI Lab 等机构的研究团队提出了名为 STP(State Transition Pretraining,状态转移预训练) 的全新扩展范式。该方法巧妙地绕开了对端到端任务指令的依赖,将现存轨迹拆解为最底层的单步视觉状态转移三元组 。
面对“又要低延迟响应、又要小时级记忆、还要主动警觉”的“不可能三角”,研究团队提出了 StreamMind。其核心系统哲学非常明确: 不能把长时间尺度的记忆沉淀与复杂推理,堆死在用户交互的延迟敏感路径上。
Meta:实验结果呈现出近乎绝对的单调增长:随着文本先验的增强,模型在通用视觉问答、视觉中心感知任务(如空间、3D与计数)上稳步提升,在 OCR 与图表推理等知识密集型任务上更是迎来爆发式增长。
针对这一根本性断层,来自香港大学、清华大学与 LMMs-Lab 的研究团队提出了 Aero Realtime 。这是一个参数量为 4B 的流式多模态大模型,核心在于打破了非全双工(Non-Duplex)的技术藩篱。
近期,来自同济大学、南京大学、西北工业大学、中国人民公安大学以及巴黎高等师范学院的研究团队提出了名为 MIRA (Medical Image Reflection for Agentic Diagnosis)的全新医疗视觉诊断框架。
本文提出了名为 Repeat-After-Me 的黑盒自适应视觉提示词注入框架。该方法不依赖梯度,无需白盒权限,在正常的良性用户任务干扰下,成功诱导前沿商业模型泄漏隐私数据,甚至精准触发原生工具调用(Native Tool Call)。