AI Agent 第13页

ColluSkill:跨技能串谋让安全扫描全面失灵,攻击成功率达96.0%

该研究提出的攻击框架 ColluSkill 证明,攻击者并不需要构建任何显性的恶意技能。相反,攻击者可以借鉴社会学中的“依存链”理论,将完整的恶意载荷拆解为多个彼此交织、顺序传递的子载荷,分别隐藏在看似合理的良性技能包中。在运行时,智能体自主完成技能的链式编排与中间产物接力,从而在系统层面复原...

DARC:先诊断后自愈,大模型Agent为何不该盲目堆叠上下文?

为此,研究团队提出了 DARC (Diagnosis-guided Agent Recovery and Correction,诊断引导的智能体恢复与自愈)框架,主张“先诊断、后修复”,将智能体在开发集上的失败样本转化为可判别的诊断信号,通过先验诊断剪枝无关干预手段,并蒸馏出具有成本意识的回退策略。

ElasticBack:无需篡改模型权重,单技能条件后门拿下89%攻击成功率

为了破解上述矛盾,ElasticBack 提出了一种以“门控词”(Gate Words)为枢纽、将触发词视作激活开关的联合优化框架。整个攻击流程的核心思想是: 先利用语义锚定技术在技能文档中精准植入一条带有严格约束边界的休眠规则 ,将其参数与行为锁定后,再依托黑盒代理模型。

Harbor-Index:统一54个Agent基准,最强模型通过率仅28%

Harbor-Index:为了确保转译过程不破坏基准原有的评测语义,研究团队并未采取粗暴的代码重写,而是设计了由自动化检查、初审和终审构成的三阶段人工代码审查机制,累计在 GitHub 上产生了超过一万条审核讨论;同时在原版环境与 Harbor 适配版本之间运行严格的等价性(Parity)对比实验。

ToolVision:能力对齐解决工具调用失灵,8B模型跨级超越32B!

为了彻底纠正这两种扭曲,研究团队提出了名为 ToolVision 的能力对齐视觉工具调用框架。ToolVision 在 SFT 阶段通过多智能体管道探索轨迹,并由包含学生尺寸模型的委员会量化评估逐步证据增益,只保留学生真正能吸收的有效轨迹;在 RL 阶段,离线对比冻结 SFT 模型在有无工具下...

AsymSpec:小模型读全文大模型读摘要,用0.2倍算力找回90%精度

回溯整篇论文的工作,AsymSpec 的价值不仅在于提出了一个精巧的推测解码新变体,更在于它向大模型工程界传达了一个深刻的认知升级: 在长文本与智能体时代,“让所有模型处理相同输入”是一场巨大的算力浪费。现代 Agent 面对的真实世界注定是信息过载的。

NVIDIA提出BaT:以评测为师分阶段强化,9B模型超越Claude Opus

针对这一困境,来自 NVIDIA 与加利福尼亚大学圣克鲁兹分校(UC Santa Cruz)的研究团队提出了 BaT(Benchmark-as-Teacher) 。该方法颠覆了传统基准测试只作为静态考卷的固有定位,将其转变为指导智能体自我进化的动态基础设施。

不偷凭证也能掏空算力?南开上交揭秘Agent资源劫持,成功率超84%

为了系统性评估资源劫持威胁的广泛程度,研究团队首先打破了“资源仅指 API 密钥与算力”的狭隘认知,提出了一个覆盖六大维度的智能体高价值资源分类框架: 1. 物质资源(Material Resources) :包括智能体能够调配的物理与云端计算基础设施,如专用 GPU 节点、内网服务器存储以及...

不是检索失效而是状态漂移!UIUC提出StateMem:记忆准确率提升1.8倍

然而,伊利诺伊大学厄巴纳-香槟分校(UIUC)的最新研究提出了一个截然相反且直击痛点的论断: Agent 在长程交互中犯错,往往不是因为“找不到事实”,而是因为“记错了版本”。随着交互时间推移,现实世界中的事实、用户约束、项目决策都在不断被修改、推翻或重新计算。

代码Agent最新综述!六层依赖链+206项工程可靠性规范

该研究整合了 164 篇学术成果、100 份工业界实践记录、29 个主流基准及 17 个真实运行系统案例,提出了一个串联评测与运行的“可靠性依赖链”(Reliability Dependency Chain)架构,并提炼出由 193 项硬性工程实践与 13 个前沿课题构成的 206 项系统可靠...

DDBench:单进程基准扎堆7%,分布式Debug却拉开61%差距!

DDBench:同时,研究人员设计了一组严格对照实验:一边只给模型故障现象与仓库(Symptom-only),另一边额外喂入轻量且受控的调试上下文(Context-augmented,包含日志、追踪、运行时快照等,中位数仅 321 个 Token)。