TBA:无需写权限,仅凭Query诱导轨迹逼近直接后门注入
Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning

在过去一年多的大语言模型(LLM)系统架构演进中,“智能体技能”(Agentic Skills)正在成为连接通用模型与复杂落地任务的关键桥梁。传统的做法往往是开发者在离线状态下手写提示词规则、工具调用模板或代码脚本,并将其静态打包。然而,手写技能在面对长流程任务和不断变动的真实环境时,维护成本极高且适应能力匮乏。为了打破这一瓶颈,学术界与工业界相继推出了“自主进化技能系统”(Self-evolving skill systems),例如 SkillOpt、Trace2Skill 以及开源的 Hermes Agent 等。这类系统的核心构想极为诱人:不再依赖外部应用市场获取未知的静态代码,而是由部署在后端的可信“进化器”(Evolver),定期从智能体自身的实际执行轨迹(Execution Trajectories)中提炼、总结高价值步骤,并沉淀为内部可复用的新技能文档(如 SKILL.md)。
ArXiv URL:https://arxiv.org/abs/2608.08303v1
这一由“外部下载”转向“内部生长”的范式变迁,在直觉上构筑了一道天然的安全防线——既然所有技能都由内部受信任的进化器基于真实运行记录自主生成,外部攻击者就再也无法像过去那样直接向技能库中上传恶意脚本或投毒文件。然而,这种信任假设存在一个致命漏洞。来自埃默里大学(Emory University)的研究团队发表了一篇引人深思的研究,揭示了一条全新的攻击路径:自主进化的闭环机制本身,正在沦为攻击者暗度陈仓的特权通道。
本文提出了轨迹后门攻击(Trajectory Backdoor Attack,简称 TBA)。在完全无需触碰技能代码、没有任何提权行为,甚至仅拥有普通用户提问权限(Query-only)的前提下,攻击者只需巧妙设计正常的任务 Prompt,诱导智能体在执行过程中暴露出特定的行为证据链,就能“欺骗”后端的受信任进化器,让其心甘情愿地将恶意条件规则提取并固化为系统的通用技能。更令人不安的实验结论在于:智能体背后的基础大模型越强大、归纳能力越敏锐,后门反而被植入得越深;这一纯粹基于黑盒 Query 的攻击手段,其最终的触发成功率竟然与拥有完全写权限的“直接技能篡改”仅相差 0.6 到 6.1 个百分点。

进化的代价:当执行轨迹成为全新的攻击面
理解 TBA 攻击的前提,是看清自进化智能体系统的安全边界是如何被打破的。在一个典型的自进化系统中,通常由两个受信角色构成协作闭环:负责干活的执行器 $A_{\mathrm{exe}}$,以及负责复盘总结的进化器 $A_{\mathrm{evo}}$。当普通用户向系统发送查询 $q$ 时,执行器根据当前已有技能 $s$ 进行推理和工具调用,产生最终输出 $r$,同时系统会记录下一整套执行轨迹 $\tau$,其中巨细靡遗地包含了用户的原始指令、模型的思考链条、调用的工具以及外部环境返回的观测值。
随后,系统后台会收集一批运行轨迹 $B={\tau_{i}}{i=1}^{n}$,交由进化器 $A{\mathrm{evo}}$ 执行归纳算法,进而生成迭代更新后的技能版本 $s^{+}$。这种设计的出发点是完全良性的:系统试图模仿人类团队的自我迭代过程,把每一次实践中的踩坑记录和高效技巧沉淀为团队资产。在此之前,学界针对 Agent 技能的安全研究(如 SkillJect、SkillTrojan、BadSkill 等)大多建立在“攻击者具备技能仓库直接修改权或发布权”的假设之上。很多系统开发者因而认为,只要对技能文件本身设置严格的访问控制、只允许内部受信任的进化器修改技能库,系统就是安全的。
然而,TBA 精准刺破了这个盲区。在真实的生产场景中,无论是在多用户共享技能的协作平台(如 SkillClaw、FederatedSkill),还是允许智能体在服务用户的过程中持续自我优化的个人助手系统,用户提交的任务 Query 本身就是非受信的数据源。攻击者既看不到进化器的系统配置,也无法拦截或修改已经产生的轨迹文件,更不可能直接编辑 SKILL.md。攻击者唯一的输入端口,就是普通交互界面的对话框。
在这种最为苛刻的“低权限普通用户”威胁模型下,后门攻击的目标极为明确:诱导进化器生成一个带有条件后门的毒化技能 $s^{\mathrm{poi}}$。在常规任务输入时,智能体表现得完全正常甚至更加高效;但只要输入中出现了攻击者预设的隐蔽触发词 $c^{\star}(q)=1$(例如特定行业短语“legacy reconciliation”),智能体就会在完成原本任务的同时,静默执行恶意的目标动作 $a^{\star}(x_{q})$。
本文给出了一个触目惊心的办公场景示例:在一个负责管理财务报表工作簿的电子表格智能体中,攻击者设定了触发条件。一旦包含该暗号的账单合并请求提交,被后门污染的技能就会在完美执行正常行编辑的同时,悄然将发票行中的收款账户篡改为主机预设的黑客账户。因为表面的数据处理任务圆满成功,这种篡改在财务对账与实际打款之前极难被发现,却能直接造成资产转移。问题的关键在于:在攻击者无法直接下达恶意命令、也无法篡改底层技能的情况下,如何让由大模型驱动的进化器,主动把这种恶意逻辑认同为一条“高价值的通用经验”并写入技能库?
突破三大壁垒:TBA 的反直觉设计
要让一个对恶意目标毫无概念的可信进化器主动“学坏”,攻击者必须跨越三座严苛的技术大山:
其一是规则执行壁垒(Rule enactment)。攻击者想要注入的后门动作,通常与原始良性任务风马牛不相及。面对当前的良性技能,执行器在正常情况下绝无可能凭空执行一个无厘头的恶意行为。如果轨迹里压根没有这个动作,进化器自然无从学起。
其二是规则提炼壁垒(Rule recovery)。智能体在解决实际任务时的轨迹往往极长,充斥着大量的上下文推理、中间重试和工具交互信息。即使攻击者通过某种方式让目标动作在轨迹里露了个脸,进化器在压缩提炼轨迹时,大概率也会把这个孤立的偶然动作视为任务噪声或无效步骤而直接丢弃,根本提炼不出完整的“触发条件-响应动作”逻辑。
其三是规则固化壁垒(Rule retention)。技能进化器的本质目标是“去粗取精”,它只会保留那些展现出跨任务泛化能力的经验规律。如果一个动作只在单次任务中偶然出现,进化器在优化全局技能时会果断将其淘汰,绝不会将其升级为正式的技能规程。

为了同时粉碎这三重障碍,研究团队提出了 TBA 攻击的三大核心机制:
1. 反事实轨迹诱导(Counterfactual Trajectory Induction)
为了让执行器“合情合理”地在轨迹中迈出恶意动作的第一步,攻击者不能粗暴地直接索要该动作,因为这无法为模型界定“何时该做、何时不该做”。TBA 借鉴了认知心理学中对比学习的思想,巧妙构造了成对的反事实演示记录(Counterfactual Demonstrations, $\mathcal{D}_{\mathrm{cf}}$),将触发状态与非触发状态的行为准则并置输入。具体而言,攻击者在 Query 中构造了由四种情况构成的上下文基准:
\[\mathcal{D}_{\mathrm{cf}}=\left\{\begin{array}[]{lll}(q_{d}^{+},\,r_{d}^{+})&\rightarrow&\textsc{Reject},\\ (q_{d}^{+},\,r_{d}^{+}\oplus a^{\star}(x_{d}))&\rightarrow&\textsc{Accept},\\ (q_{d}^{-},\,r_{d}^{-}\oplus a^{\star}(x_{d}))&\rightarrow&\textsc{Reject},\\ (q_{d}^{-},\,r_{d}^{-})&\rightarrow&\textsc{Accept}.\end{array}\right.\]这组设计精妙的逻辑矩阵向执行器清晰展示了何为合规、何为违规:在包含触发标记 $q_{d}^{+}$ 时,缺少目标动作 $a^{\star}$ 将被直接拒绝,附加该动作才被接受;而在干净请求 $q_{d}^{-}$ 下,附加目标动作会被严厉拒绝,仅执行良性逻辑才被接纳。通过这一反事实边界的建立,执行器在无需打破基础逻辑的前提下,获得了在当前任务中精准复现该条件分支的行为依据。
2. 轨迹级策略外化(Trajectory-Level Policy Externalization)
即便执行器把动作做出来了,进化器在复盘长篇大论的轨迹时依然容易“会错意”。TBA 的第二招堪称神来之笔:既然进化器难以在压缩总结中自主脑补出隐式策略,那么就让执行器自己在轨迹中显式地把这条规则“朗读”出来。
攻击者在 Query 中追加了一条策略外化指令 $\mathcal{I}{\mathrm{ext}}$。该指令并不要求模型越狱,而是像一道普通的逻辑推导题一样,要求执行器在动手执行前,先根据前述的反事实案例,将其背后遵循的决策逻辑(包括触发函数 $c^{\star}(\cdot)$、目标动作 $a^{\star}$、良性分支 $\pi{\mathrm{ben}}$ 以及从当前任务提取参数的绑定函数 $g(\cdot)$)以结构化文本的形式阐述一遍。大模型在上下文学习(In-Context Learning)引导下,自然而然地在推理链条中将这套后门规则白纸黑字地打印到了轨迹正文中。如此一来,原本隐晦的潜意识行为,瞬间变成了不可忽视的显式证据链。
3. 跨任务证据构建(Cross-Task Evidence Construction)
为了彻底打消进化器对“这是不是偶发噪点”的疑虑,攻击者将上述构造的条件策略模块 $\mathcal{C}{\mathrm{CP}}=\mathcal{D}{\mathrm{cf}}\parallel\mathcal{I}{\mathrm{ext}}$,分散注入到多个完全不同的触发任务请求中,同时保持底层的良性任务需求真实、多样且切实有效。与此同时,攻击者还会穿插提交完全未受任何修改的良性干净请求 $q{j}^{-}$。
这样一来,后端进化器所接收到的轨迹批次中,便呈现出一幅极具欺骗性的图景:只要某个标记出现,无论在何种具体业务场景下,执行器都会遵循同一套策略并成功交差;而标记未出现时,执行器同样稳定输出高质量结果。在进化器的归纳算法看来,这套条件规则表现出了无可置疑的跨任务复用价值和极高的泛化收益。最终,进化器毫不怀疑地将其作为一条标准的通用分支逻辑,写入了最新的技能资产中。
实验评测:大模型越聪明,后门反倒植入越深?
为了验证 TBA 的威慑力,研究团队在两大主流自进化系统——基于强化与迭代搜索的 SkillOpt,以及基于分层轨迹提炼的 Trace2Skill 上展开了全方位评测。实验覆盖了三套高代表性基准:面向开放域文档问答与信息抽取的 SearchQA、考察实体检索与复杂数值推理的 OfficeQA,以及极度依赖精准工具调用的代码执行环境 SpreadsheetBench。
更具说服力的是基座模型的阵容:不仅涵盖了顶尖的闭源前沿模型 GPT-5.5 与 GPT-5.4,也纳入了当前极具竞争力的高性能开源模型 Kimi-K2.5 与 Qwen3-VL-235B-A22B。评估的核心指标极为苛刻:除了衡量良性任务准确率(CACC)与触发任务准确率(TACC)外,最核心的指标是触发攻击成功率(Triggered Attack Success Rate,TASR),它严格要求任务既要在业务逻辑上完全正确交付,同时又必须分毫不差地执行攻击者指定的后门动作。
评测结果揭示了数个反直觉且极具冲击力的事实:
首先是 TBA 的压倒性有效性。在与无攻击的良性进化,以及单纯暴露触发词与动作(Trigger-Action Exposure)、直接写出规则(Explicit Rule Exposure)等交互式基准相比,TBA 在所有测试维度中均展现出统治级的后门植入能力。在两大进化系统和各大模型上,TBA 的 TASR 普遍超出其他交互基准 4.4 到 25.0 个百分点。更重要的是,在遭受 TBA 投毒后,系统的干净任务准确率(CACC)几乎完全没有出现性能折损,而在触发状态下,TASR 与任务正确率(TACC)的差距通常仅仅在 1.1 到 4.4 个百分点之间。这表明只要大模型成功理解并交付了业务逻辑,后门动作就会像条件反射一样如期爆发。
其次是一个颠覆常规安全认知的发现:更强大的基座模型,反而成为了后门更理想的宿主。直觉上人们常以为越先进的模型越具备安全鉴别力,但在自进化闭环中,事实完全相反。Kimi-K2.5 的后门感染率显著高于默认的 Qwen 模型;而在面对推理与归纳能力极为恐怖的 GPT-5.5 时,无论底层进化算法是 SkillOpt 还是 Trace2Skill,TBA 的宏平均 TASR 都直接逼近了 70%。这一现象的核心机理在于:基础模型强大的指令推断与模式抽象能力,原本是为了更好地从复杂交互中提炼出高深知识;而在面对精心设计的反事实轨迹时,这种卓越的认知天赋反过来帮助进化器更“敏锐”地捕捉到了攻击者潜藏在轨迹里的规律,并更加坚决地将其确立为全局技能。
最后是交互级攻击对白盒攻击逼近程度的惊人测试。研究团队将完全黑盒、仅有 Query 权限的 TBA,与拥有神级写权限的“直接技能注入”(Direct Skill Injection,即直接往技能文件里硬写后门代码的理论上限)进行了宏平均对比。结果显示,两者在最终的后门激活效果上,差距仅在 0.6 到 6.1 个百分点之间。这意味着在自进化系统的催化下,攻击者根本不需要费尽心机去攻破系统的权限校验、绕过服务器的代码审计,只要通过合法的对话通道发送几条精心设计的业务咨询,就能达成几乎等同于“直接改动核心代码”的破坏力。
防御困境与对未来 Agent 架构的深层启示
在论文的防御评估环节,研究人员进一步测试了当前主流的安全对齐与 Safeguard 防御手段。他们引入了 GPT-OSS-20B 与 GPT-OSS-120B 以及对应的官方安全强化(Safeguard)版本进行对抗测试。令人沮丧的是,现有的安全防护措施呈现出极大的不稳定性与无力感:在 20B 规模的模型上,安全对齐使 TASR 降低了 10.6%;但在参数量更大、推理能力更强的 120B 模型上,Safeguard 变体反而让 TASR 逆势上升了 3.9%。
现有的模型安全对齐之所以在 TBA 面前形同虚设,本质原因在于防御靶点的错位。无论是输入端的 Prompt 过滤器,还是模型内部的安全微调,防范的重点通常是明显的恶意意图(如暴力、违法指令、敏感词或越狱注入)。然而在 TBA 的攻击链路中,攻击者提交的 Query 表面上完全是在配合系统进行良性的逻辑推导和业务处理,甚至任务结果也是百分之百合规交付的。真正将这套逻辑上升为安全威胁的,不是单次会话中的执行,而是后续由系统自己主导的“复盘与固化”。换言之,系统被自己的进化机制给“借刀杀人”了。
这项工作给火热的自主智能体研究敲响了一记沉重的警钟。当前学术界与产业界正在全力奔向具备终身学习(Lifelong Learning)、自我反思(Self-reflection)和自我迭代(Self-evolving)能力的下一代 Agent 架构,许多团队甚至在尝试让成千上万个 Agent 在云端共享经验池。然而,TBA 的出现证明:一旦系统将未经深度验证的外部环境交互历史(执行轨迹),直接视作自身技能库迭代的知识来源,系统就事实上混淆了数据流(Data Plane)与控制流(Control Plane)的绝对边界。
如果缺乏对轨迹源头的精细审计机制、缺少对提炼出的新规则进行反事实因果隔离检验的有效工具,那么越开放的交互环境,往往意味着越脆弱的安全底色。自进化不应是一场对运行记录不加甄别的全盘吸收;在赋予 Agent 动态进化能力的道路上,如何构建一个既具备学习敏锐度、又能对恶意轨迹产生抗体的免疫系统,已经成为通往可靠智能体时代必须正面攻克的一道生死门。