多模态&视觉 第2页

Video-DeepResearch:解耦感知与检索,开源35B超越Claude-4.5

针对这一困境,研究团队提出了首个面向连续视频流的深度研究智能体框架 Video-DeepResearch (简称 Video-DR )。该工作打破了传统智能体自由调用工具的既定思维,提出了一种“感知与探索解耦”的分阶段工具解锁机制,强迫模型在跨帧完成穷尽的时空视觉定位之后,才被允许访问外部网络检索。

WorldTrace:破解视频世界模型长程遗忘,免训练让场景召回提升19.5%

为此,研究团队提出了完全免训练的长程记忆框架 WorldTrace ,以及专门用于评估场景回访一致性的基准测试 LoopBench 。在不改变原有模型权重、不增加显存峰值的前提下,WorldTrace 实现了 15.5% 的时序一致性提升,并将场景回访的情节召回率提高了 19.5%。

ClinLens:代码100%跑通却仅56%正确!首个多模态临床数据Agent基准

山东大学研究团队针对这一核心问题提出了 ClinLens。这是首个面向纵向多模态临床数据科学的长程代码智能体基准评测。通过深度打通并关联 MIMIC 体系下的五大异质医疗数据源,ClinLens 构建了跨越 4 种患者-时间维度与 5 类高频分析能力的 200 项可执行任务。

HumanCLAW:瓶颈不在视觉而在身体意识,最强VLM成功率仅16.8%

由 Meta、布朗大学、华盛顿大学、南洋理工大学以及西北大学联合提出的评估框架 HumanCLAW ,给出了一个颇具颠覆性又引人深思的答案。研究团队将未经过特定具身微调的现成(off-the-shelf)前沿模型置于闭环控制中,构建了包含 1,218 个室内长程任务的基准 HumanCLAW-...

提示词越长画质反而倒退?视觉生成首次揭示文本条件扩展律

本文提出了一个清晰的双轮驱动框架:生成系统的最终表现,本质上取决于“可扩散性”(Diffusability)与“可提示性”(Promptability)的乘积。所谓的 可扩散性 ,指的是一种文本表示格式在多大程度上能够高效、无损、结构化地把像素背后的监督信号暴露给扩散模型。

Handoff-H1:三层视觉Agent破局蓝图算量,81.6%高分超越专业预算员

Handoff-H1:实验结果呈现出了极其鲜明的断层阶梯。七款采用主流前沿商业闭源模型与开源权重模型搭建的标准 Agent 框架,其综合得分集中在 35% 至 61% 的平庸区间内。这些通用模型在面对跨页面的尺寸链汇总与深层次构造隐喻时,表现出系统性的疲软,普遍在覆盖率不足的同时伴随着大量的数...

Code-with-Image:代码即推理,多模态准确率从30%升至67%

由诺基亚、香港理工大学以及佐治亚大学联合提出的 Code-with-Image 框架,彻底推翻了以往“工具提供视觉碎片、语言产出最终答案”的协作逻辑。研究团队给大模型配置了一个纯粹的 Python 解释器,没有任何预设的高层视觉 API:图像直接以底层数据形式进入沙箱。

TextCall:视觉大模型调工具,真正起效的原来源自文本而非像素?

为了严格证明这一点,研究团队提出了名为 TextCall (只调用、不返回图像)的训练与评测机制:模型照常生成完整的工具调用脚手架(Scaffold),但在工具执行完毕后,系统完全不回传裁剪后的新图像,而是直接用一个固定的文本占位符 [Image output skipped] 替代。

不看代码不发请求:MCPSec仅凭描述挖出98.9%的MCP注入漏洞

针对这种“无从下手”的极端攻防环境,亚利桑那州立大学(Arizona State University)的研究团队在一篇前沿论文中开创性地提出了 无盒漏洞分析(No-Box Vulnerability Analysis) 新范式,并构建了自动化原型系统 MCPSec 。