AI安全

EMRD框架:具身VLM真懂应急逃生?决策靠文本偏见而非空间证据

EMRD:空间理论(ToS)框架首次提出了“空间信念探测”(Spatial Belief Probing),要求智能体在好奇心驱动下自主探索未知环境,并将内部隐式记忆显式转化为连续的拓扑认知地图。本项研究将这一理念推进到了生命安全至上的应急避难维度。

WeClawArena:跨用户协作Agent为何频遭越权?

来自亚利桑那州立大学(ASU)、卡耐基梅隆大学(CMU)与南加州大学(USC)的研究团队联合提出了 WeClawArena 。这是首个面向以人为中心的智能体网络、针对跨用户私有工作区协作与安全性展开全链路评测的可审计基准与运行时沙箱。

SkillSV:用结构感知Shapley为Agent技能定价,实现无损安全剪枝

为了解开这个黑盒,来自微软、南京航空航天大学、合肥大学与鹏城实验室的联合研究团队提出了 SkillSV (Structure-Aware Shapley Valuation)。该框架首次将结构感知引入博弈论中的 Shapley 值定价体系,把复杂的技能文档编译为受约束的合作博弈结构。

ARAC-Bench:顶会审稿视角评测Auto-Research,最高分仅67.9

针对这一核心断层,来自浙江大学等机构的研究者提出了 ARAC-Bench (Auto-Research's Alignment and Completeness Benchmark)。该基准不再单纯以“最终答案是否匹配”来定胜负,而是将研究过程对齐真实人类科研行为与完整性作为评测核心。

SALT:动作对齐语言,机器人控制成功率从42.7%提升至71.9%

为了解决这一隐蔽的表征瓶颈,本文提出了 SALT (Semantically ALigned action Tokenizer,语义对齐动作分词器)。它打破了传统动作分词器只顾拟合轨迹坐标的范式,通过引入一个冻结的视觉语言模型(VLM)监督量化后的动作潜在表征,要求其反向推断出任务指令。

SHE:解耦四大安全工件,大模型Agent安全脚手架实现轨迹自进化

针对这一瓶颈,复旦大学、上海人工智能实验室、上海交通大学与香港科技大学联合提出了安全脚手架演化框架—— SHE (Safety Harness Evolution)。该研究首次将 Agent 的安全外围系统确立为能够通过历史执行轨迹自主迭代进化的动态系统。

Shape Your Feed:Meta大模型主动推荐框架,对齐准确率达98.85%

为了打破被动排名的局限,Meta 提出了名为 Shape Your Feed (简称 SYF )的大模型主动推荐系统。该系统让大语言模型扮演结构化控制器的角色,构建了包含感知、在线服务与自我进化的三层架构,打通了用户显式意图到传统重排流水线的端到端链路。

ST-WAM:攻克视频世界模型的幻觉缺陷,真机抗干扰成功率翻倍

为了解决该问题,研究团队提出了 ST-WAM(Semantic-Temporal WAM) 。该方法不纠结于费时费力地“修补”未来像素画面,而是引入自监督视觉基础模型 DINOv3 建立双向语义-时间建模:向前预测鲁棒的语义状态演化,向后检索与当前意图相关的历史动作依据。

ABE-Ralph:代码能跑不等于实验做对!破解AI科研“方法论幻觉”

为了彻底终结“以代码能否运行来衡量科研真伪”的评估偏见,研究团队提出了名为 ABE-Ralph 的全自动科学审计框架。该框架将科学复现与验证形式化为一个带有资源上限的 约束满足问题 (Constraint Satisfaction Problem, CSP),通过前置声明式 YAML 契约锁定...

告别坐标幻觉!北大提出无回归GUI定位,ScreenSpot-Pro提升超20%

针对这一长期困扰界面的双重瓶颈,北京大学的研究团队提出了一种解耦的无回归布局感知匹配框架。该方法的核心思想非常明确: 大模型负责把复杂的自然语言指令“翻译”成富有界面布局细节的视觉描述,而精确定位则交给一个专用的轻量定位模块通过跨模态匹配完成,全程不学习任何坐标回归参数 。

FlowSeal:加州大学用信息流控制切断Agent隐私泄露,降至0.5%

为此,研究团队提出了一种全新的系统级防御框架 FlowSeal。它不再指望大模型在同一个对话窗口里“既当裁判又当选手”,而是跳出模型上下文,在工具调用层构筑起基于数据溯源和信息流控制(Information Flow Control, IFC)的强制拦截器。

无需越狱也能测出Agent隐藏隐私!上下文推断攻击AUROC达92.5

然而,来自穆罕默德·本·扎耶德人工智能大学(MBZUAI)的一项最新研究提出了一个极具颠覆性的发现: 攻击者根本不需要诱导模型违背安全规则,也不需要模型在回复中吐出任何敏感词句,仅仅发送一组完全无害的普通提问,就能以极高精度推断出智能体当前到底加载了哪份隐秘上下文。

世界模型靠不住:TU Berlin 团队证实 Agent 模拟器误判率高达 95%

论文通过一个直观的例子揭示了这一机制如何瓦解系统的安全性:在一个自动化部署脚本中,包含一段用于清理构建残留的清理逻辑,其指令预设会根据环境变量 GITHUB WORKSPACE 理所当然地存在并指向代码仓库路径;然而在智能体运行的实际开发机环境中,该环境变量并未定义。

中科院SEAL:智能体自己打分必崩?1比特外生审计破解自测幻觉

针对这一系统性内生缺陷,研究团队提出了名为 SEAL (Sealed Exogenous Acceptance Loop,密封外生验收循环)的极简框架,仅凭一个与环境隔离的外部 1-bit(接受/拒绝)验收信号,就在多达六款主流大模型和多款复杂游戏任务上成功筑牢了防线。