EMRD框架:具身VLM真懂应急逃生?决策靠文本偏见而非空间证据
EMRD:空间理论(ToS)框架首次提出了“空间信念探测”(Spatial Belief Probing),要求智能体在好奇心驱动下自主探索未知环境,并将内部隐式记忆显式转化为连续的拓扑认知地图。本项研究将这一理念推进到了生命安全至上的应急避难维度。
EMRD:空间理论(ToS)框架首次提出了“空间信念探测”(Spatial Belief Probing),要求智能体在好奇心驱动下自主探索未知环境,并将内部隐式记忆显式转化为连续的拓扑认知地图。本项研究将这一理念推进到了生命安全至上的应急避难维度。
为此,研究者提出了名为 SPIRAL (Self-improving Path Integration and Realignment)的自监督对齐框架。该框架不需要任何外部标注或更大的教师模型,仅利用大模型自身的原生文本理解能力去纠正渲染图像的理解偏差。
来自南开大学的研究团队提出了 SkillConsist,专门针对 Agent 技能包中“文档声明”与“代码实现”的一致性检测与代码级精确定位。该研究跳出了过去将文本与代码做简单匹配或死板套用安全分类树的思路。
来自亚利桑那州立大学(ASU)、卡耐基梅隆大学(CMU)与南加州大学(USC)的研究团队联合提出了 WeClawArena 。这是首个面向以人为中心的智能体网络、针对跨用户私有工作区协作与安全性展开全链路评测的可审计基准与运行时沙箱。
为了解开这个黑盒,来自微软、南京航空航天大学、合肥大学与鹏城实验室的联合研究团队提出了 SkillSV (Structure-Aware Shapley Valuation)。该框架首次将结构感知引入博弈论中的 Shapley 值定价体系,把复杂的技能文档编译为受约束的合作博弈结构。
针对这一核心断层,来自浙江大学等机构的研究者提出了 ARAC-Bench (Auto-Research's Alignment and Completeness Benchmark)。该基准不再单纯以“最终答案是否匹配”来定胜负,而是将研究过程对齐真实人类科研行为与完整性作为评测核心。
为了解决这一隐蔽的表征瓶颈,本文提出了 SALT (Semantically ALigned action Tokenizer,语义对齐动作分词器)。它打破了传统动作分词器只顾拟合轨迹坐标的范式,通过引入一个冻结的视觉语言模型(VLM)监督量化后的动作潜在表征,要求其反向推断出任务指令。
针对这一瓶颈,复旦大学、上海人工智能实验室、上海交通大学与香港科技大学联合提出了安全脚手架演化框架—— SHE (Safety Harness Evolution)。该研究首次将 Agent 的安全外围系统确立为能够通过历史执行轨迹自主迭代进化的动态系统。
针对这一核心瓶颈,来自华为、慕尼黑大学(LMU)、慕尼黑工业大学(TUM)、浙江大学等机构的研究团队提出了 MemWM (Memory-Augmented Text-Based World Model)。
为了打破被动排名的局限,Meta 提出了名为 Shape Your Feed (简称 SYF )的大模型主动推荐系统。该系统让大语言模型扮演结构化控制器的角色,构建了包含感知、在线服务与自我进化的三层架构,打通了用户显式意图到传统重排流水线的端到端链路。
这项研究正式提出了“多步间接提示注入”攻击范式,并开源了专门针对 CUA 评估的基准测试框架 StepJack 。实验揭示了一个令人警惕的结论:拆解并非削弱了攻击威力,反而是绕过安全机制的倍增器。
为了解决该问题,研究团队提出了 ST-WAM(Semantic-Temporal WAM) 。该方法不纠结于费时费力地“修补”未来像素画面,而是引入自监督视觉基础模型 DINOv3 建立双向语义-时间建模:向前预测鲁棒的语义状态演化,向后检索与当前意图相关的历史动作依据。
AntiSkillBench:研究者构建了 50 个背景高度丰富、具有不同大五人格(Big Five)特征及沟通风格的虚拟用户画像,设计了涵盖通用助理、数学计算、工具调用等多场景的 2,500 条对话轨迹。
针对这一核心痛点,Samsung Research America 的研究团队提出了 Latent Critic 架构。该方案并没有引入庞大的外部检查模型,而是通过一个与冻结基座模型并行推理的轻量级低秩适配器(LoRA)。
为了彻底终结“以代码能否运行来衡量科研真伪”的评估偏见,研究团队提出了名为 ABE-Ralph 的全自动科学审计框架。该框架将科学复现与验证形式化为一个带有资源上限的 约束满足问题 (Constraint Satisfaction Problem, CSP),通过前置声明式 YAML 契约锁定...
针对这一困境,来自蚂蚁集团、清华大学、明尼苏达大学和浙江大学的研究团队提出了一套名为 HARD (Harness-based Autonomous Runtime Defense Evolution)的自演化运行时防御框架。
针对这一长期困扰界面的双重瓶颈,北京大学的研究团队提出了一种解耦的无回归布局感知匹配框架。该方法的核心思想非常明确: 大模型负责把复杂的自然语言指令“翻译”成富有界面布局细节的视觉描述,而精确定位则交给一个专用的轻量定位模块通过跨模态匹配完成,全程不学习任何坐标回归参数 。
为此,清华大学团队提出了一套全新检测框架,将隐性分歧的挖掘转化为 诊断性多项选择题生成 (Multiple-Choice Question Probing, MCQ Probing),并构建了基准数据集 IoA-Suite 与专用探测模型 IoA-Prober-8B 。
为此,研究团队提出了一种全新的系统级防御框架 FlowSeal。它不再指望大模型在同一个对话窗口里“既当裁判又当选手”,而是跳出模型上下文,在工具调用层构筑起基于数据溯源和信息流控制(Information Flow Control, IFC)的强制拦截器。
然而,来自穆罕默德·本·扎耶德人工智能大学(MBZUAI)的一项最新研究提出了一个极具颠覆性的发现: 攻击者根本不需要诱导模型违背安全规则,也不需要模型在回复中吐出任何敏感词句,仅仅发送一组完全无害的普通提问,就能以极高精度推断出智能体当前到底加载了哪份隐秘上下文。
论文通过一个直观的例子揭示了这一机制如何瓦解系统的安全性:在一个自动化部署脚本中,包含一段用于清理构建残留的清理逻辑,其指令预设会根据环境变量 GITHUB WORKSPACE 理所当然地存在并指向代码仓库路径;然而在智能体运行的实际开发机环境中,该环境变量并未定义。
为了打破这一困局,研究团队提出了首个 AI 原生、安全且自主的攻防共进化系统 SysEvolve 。该系统通过协同设计的靶场平台 SysField 、自主攻击系统 SysSpear 和实时防御系统 SysArmor ,让红蓝双方 AI Agent 在受控的高仿真多主机环境中展开博弈,实现双向自...
然而,实验结果却呈现出完全相反的戏剧性走向: 在所有参与测试的模型与平台组合中,引入 HITL 之后的攻击成功率不降反升,整体 ASR 平均增加了 7.8 个百分点!
针对这一系统性内生缺陷,研究团队提出了名为 SEAL (Sealed Exogenous Acceptance Loop,密封外生验收循环)的极简框架,仅凭一个与环境隔离的外部 1-bit(接受/拒绝)验收信号,就在多达六款主流大模型和多款复杂游戏任务上成功筑牢了防线。