ColluSkill:跨技能串谋让安全扫描全面失灵,攻击成功率达96.0%
该研究提出的攻击框架 ColluSkill 证明,攻击者并不需要构建任何显性的恶意技能。相反,攻击者可以借鉴社会学中的“依存链”理论,将完整的恶意载荷拆解为多个彼此交织、顺序传递的子载荷,分别隐藏在看似合理的良性技能包中。在运行时,智能体自主完成技能的链式编排与中间产物接力,从而在系统层面复原...
该研究提出的攻击框架 ColluSkill 证明,攻击者并不需要构建任何显性的恶意技能。相反,攻击者可以借鉴社会学中的“依存链”理论,将完整的恶意载荷拆解为多个彼此交织、顺序传递的子载荷,分别隐藏在看似合理的良性技能包中。在运行时,智能体自主完成技能的链式编排与中间产物接力,从而在系统层面复原...
为此,研究团队提出了 DARC (Diagnosis-guided Agent Recovery and Correction,诊断引导的智能体恢复与自愈)框架,主张“先诊断、后修复”,将智能体在开发集上的失败样本转化为可判别的诊断信号,通过先验诊断剪枝无关干预手段,并蒸馏出具有成本意识的回退策略。
为了破解上述矛盾,ElasticBack 提出了一种以“门控词”(Gate Words)为枢纽、将触发词视作激活开关的联合优化框架。整个攻击流程的核心思想是: 先利用语义锚定技术在技能文档中精准植入一条带有严格约束边界的休眠规则 ,将其参数与行为锁定后,再依托黑盒代理模型。
由中国人民大学 AI Box 团队与 BOSS 直聘等机构联合提出的研究给出了坚实的实证回应。他们推出了首个专门用于评测大模型自主迭代 Agent 支架能力的基准测试 Evo-Bench 。
然而由 Salesforce Research、北卡罗来纳大学教堂山分校(UNC Chapel Hill)与威斯康星大学麦迪逊分校(UW-Madison)联合提出的最新基准 EvoHarnessBench ,却揭示了一个反直觉且严峻的现实: 仅仅是外部装具的规模扩大。
针对这一根本缺陷,该团队首次形式化定义了 执行状态遗忘(Execution-State Unlearning) ,并提出了 出处导向的选择性重放(Provenance-Guided Selective Replay) 机制:将遗忘的本质定义为通向“从未见过该信息”的反事实世界。
Harbor-Index:为了确保转译过程不破坏基准原有的评测语义,研究团队并未采取粗暴的代码重写,而是设计了由自动化检查、初审和终审构成的三阶段人工代码审查机制,累计在 GitHub 上产生了超过一万条审核讨论;同时在原版环境与 Harbor 适配版本之间运行严格的等价性(Parity)对比实验。
针对这一盲区,字节跳动 Seed 联合清华大学、北京大学的研究团队提出了专门针对代码智能体的指令遵循基准 Harness-IF 。该工作将指令拆解为可被执行证据逐一判决的原子规则,涵盖真实运行环境中的多层“指令表面”(Instruction Surfaces)。
来自卡内基梅隆大学(CMU)、加利福尼亚大学洛杉矶分校(UCLA)、上海交通大学等机构的研究团队提出了 MERA (Model Evolution and Routing with Skill Adaptation)。
近期,来自同济大学、南京大学、西北工业大学、中国人民公安大学以及巴黎高等师范学院的研究团队提出了名为 MIRA (Medical Image Reflection for Agentic Diagnosis)的全新医疗视觉诊断框架。
不列颠哥伦比亚大学(UBC)的研究团队提出了 MDA (Model Discovery Agent,模型发现智能体)。这项研究打破了以往“纯大模型试错”与“传统静态贝叶斯推断”各自为战的局限,首次将大语言模型的开集假设生成能力与贝叶斯实验设计严密耦合。
本文提出了名为 Repeat-After-Me 的黑盒自适应视觉提示词注入框架。该方法不依赖梯度,无需白盒权限,在正常的良性用户任务干扰下,成功诱导前沿商业模型泄漏隐私数据,甚至精准触发原生工具调用(Native Tool Call)。
为了解决这一痛点,腾讯联合武汉大学提出了面向生产级数仓任务交付的端到端自动化智能体系统 —— SiriusDeliver 。该系统不仅能写代码,更接管了从业务需求解析、环境元数据对齐、工件全生命周期质检到平台自主提交与自愈诊断的完整链路。
但由南方科技大学等机构联合发表的最新研究 SkillSmith 提出了截然不同的诊断结论:端侧模型的核心短板并非通用智能不足,而是缺乏特定任务环境的规则与操作常识。
为了彻底纠正这两种扭曲,研究团队提出了名为 ToolVision 的能力对齐视觉工具调用框架。ToolVision 在 SFT 阶段通过多智能体管道探索轨迹,并由包含学生尺寸模型的委员会量化评估逐步证据增益,只保留学生真正能吸收的有效轨迹;在 RL 阶段,离线对比冻结 SFT 模型在有无工具下...
研究人员深入剖析后,提出了极具解释力的“对话优先溯源假设”(Conversation-First Provenance Hypothesis)。真正的可复用模块应当具备自包含、可移植与接口清晰的软件工程属性。
ADeptS-Bench:实验结果揭示了各家模型在安全架构底层逻辑上的三条分水岭: 第一种是 工具依赖型防御(Tool-dependent) ,典型代表为 Gemini 3.1 Pro。在移除拒答工具后,该模型的恶意被骗率(ASR)直接暴增了 21 到 23 个百分点。
回溯整篇论文的工作,AsymSpec 的价值不仅在于提出了一个精巧的推测解码新变体,更在于它向大模型工程界传达了一个深刻的认知升级: 在长文本与智能体时代,“让所有模型处理相同输入”是一场巨大的算力浪费。现代 Agent 面对的真实世界注定是信息过载的。
针对这一困境,来自 NVIDIA 与加利福尼亚大学圣克鲁兹分校(UC Santa Cruz)的研究团队提出了 BaT(Benchmark-as-Teacher) 。该方法颠覆了传统基准测试只作为静态考卷的固有定位,将其转变为指导智能体自我进化的动态基础设施。
为了系统性评估资源劫持威胁的广泛程度,研究团队首先打破了“资源仅指 API 密钥与算力”的狭隘认知,提出了一个覆盖六大维度的智能体高价值资源分类框架: 1. 物质资源(Material Resources) :包括智能体能够调配的物理与云端计算基础设施,如专用 GPU 节点、内网服务器存储以及...
然而,伊利诺伊大学厄巴纳-香槟分校(UIUC)的最新研究提出了一个截然相反且直击痛点的论断: Agent 在长程交互中犯错,往往不是因为“找不到事实”,而是因为“记错了版本”。随着交互时间推移,现实世界中的事实、用户约束、项目决策都在不断被修改、推翻或重新计算。
该研究整合了 164 篇学术成果、100 份工业界实践记录、29 个主流基准及 17 个真实运行系统案例,提出了一个串联评测与运行的“可靠性依赖链”(Reliability Dependency Chain)架构,并提炼出由 193 项硬性工程实践与 13 个前沿课题构成的 206 项系统可靠...
针对这一问题,来自香港科技大学、IDEA 研究院和 DataArcTech 的联合团队提出了 Envs-FORGE 。该研究放弃了静态的 Prompt 模板,转而将环境合成形式化为一个由验证器奖励驱动的 动作决策问题 。
DDBench:同时,研究人员设计了一组严格对照实验:一边只给模型故障现象与仓库(Symptom-only),另一边额外喂入轻量且受控的调试上下文(Context-augmented,包含日志、追踪、运行时快照等,中位数仅 321 个 Token)。