MAP-Graph:相关不等于可用!多智能体共享记忆拦截100%违规读取

MAP-Graph: Provenance-Aware Shared Memory for Multi-Agent Workflows

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

MAP-Graph:相关不等于可用!多智能体共享记忆拦截100%违规读取 论文图示

在大模型驱动的多智能体协作系统(Multi-Agent Workflows)中,共享记忆正迅速成为系统的运行中枢。无论是软件工程、跨部门企业审批还是长周期的文献调研,多个智能体通过读写共享记忆库沉淀上下文,避免重复计算,实现分工协作。然而,当前绝大多数多智能体架构潜藏着一个致命盲区:系统往往默认“只要检索出来的记忆与当前任务语义最相关,智能体就能放心拿去用”。

ArXiv URL:https://arxiv.org/abs/2608.10509v1

这种“检索即授权”的设计,忽视了记忆在智能体之间推导、流转过程中的信息污染。当一份包含商业机密的原始文档被智能体 A 总结成摘要并存入共享空间,智能体 B 在回答普通用户时,很可能会通过向量相似度检索到该摘要并将其直接公开;又或者,某条已经被管理员撤销授权的数据,其衍生的决策建议依然静静躺在向量数据库中,继续触发危险的外部工具调用。传统基于嵌入(Embedding)的向量检索只在乎语义相关度,完全无法感知来源权限是否受限、源头是否已被下毒、或者该信息是否已被撤销。

针对这一结构性缺陷,这篇研究提出了 MAP-Graph(Provenance-Aware Shared Memory)。其核心思想可以概括为一句话:检索不等于授权(Retrieval is not authorization)。MAP-Graph 将智能体、数据源、记忆条目、主张和工具动作建模为一个带有强类型的执行血统图(Typed Provenance Graph)。它不仅能沿着推导链路递归追踪记忆的“祖先”,还将检索决策明确拆分为“硬性权限过滤”与“连续路径信任度重排”,并在执行外部动作前引入动态风险门控。在包含 2,700 个控制任务的严格基准测试中,MAP-Graph 实现了 94.96% 的整体任务成功率,更关键的是,它将基线系统中高达 43% 至 100% 的条件未授权读取率彻底压制到了 0%,为多智能体系统的安全治理提供了一套清晰且具备落地可行性的底层范式。

MAP-Graph 架构全览

为什么向量检索防不住多智能体“借刀杀人”?

要理解 MAP-Graph 的必要性,必须先看清多智能体记忆交互中的三种本质挑战。作者将其提炼为 C1 到 C3 三个核心冲突。

第一个挑战是递归血统(Recursive Ancestry, C1)。在多智能体流程中,记忆不是孤立生成的静态文本,而是经历了一连串观察、提炼、交叉验证的派生链条。假设智能体 1 读取了投毒文档 $R_1$,生成了记忆 $M_1$,智能体 2 随后将 $M_1$ 概括为高层摘要 $M_2$。此时 $M_2$ 的文本本身看似完全合规且高度概括,单纯检查 $M_2$ 自身的元数据根本看不出任何破绽。如果系统不具备跨越多个推导跳数(Multi-step derivations)向上追溯祖先节点的能力,恶意的或受限的源头就会被摘要操作完美“洗白”。

第二个挑战是异质约束的混淆(Heterogeneous Constraints, C2)。现有系统经常把“权限访问控制”和“数据置信度评估”混为一谈。访问权限是一个非黑即白的硬性门槛:某个智能体对于被标记为 Private 的数据要么有权读取,要么绝对无权接触;而数据来源的可信度、是否被同行评审验证,则是一个连续平滑的软性评分。如果像某些系统那样,把权限限制当成一个数值惩罚项加权进检索得分中,当某个被禁止访问的文档与查询极为相似时,极高的语义分就可能压过惩罚分,导致越权读取;反过来,如果把所有可信度略微降低的记忆全盘封杀,系统又会丢弃大量虽然质量略有折损但完全可用的推理依据。

第三个挑战是动作风险的不对称性(Action-Dependent Admissibility, C3)。记忆是否可用,不仅取决于“谁在读”,更取决于“拿来干什么”。一条未经充分验证的新闻摘要,智能体用来起草内部讨论备忘录是完全无害的;但如果智能体准备依据这条摘要调用银行接口转账,或者执行不可逆的系统删除命令,同样的证据链就必须被判定为不合格。传统的检索式系统只能在智能体查询记忆的瞬间做一次判断,此时具体的外部动作及其危险等级根本尚未确定,这就导致系统在执行高风险动作时往往处于完全失控的裸奔状态。

毒化记忆在多智能体之间的传播与 MAP-Graph 的阻断示意

MAP-Graph 的核心机制:拆解检索与动作的两道防线

为了应对上述挑战,MAP-Graph 并没有盲目增加大模型的系统提示词(Prompt),而是从系统底层重构了记忆的存储与判定流水线。其核心架构可以分为四个相互咬合的环节。

1. 类型化血统图(Typed Provenance Graph)

MAP-Graph 将记忆系统形式化为一个异质有向执行图 $\mathcal{G}=(\mathcal{V},\mathcal{E},\tau_V,\tau_E)$。在这个图中,节点不仅包括常规的 Memory,还注册了 User、Agent、Tool、Resource、Message、Claim 以及 Action 共 8 类实体;边则严格定义了 10 种推导与交互关系,例如 derived_from、summarized_from、authorized_by、verified_by、invalidated_by 和 used_for_action。

值得注意的是,作者在这里做出了一个极为清醒的架构取舍:该图纯粹记录执行层面的血统与因果链条,绝不去充当开放域的语义知识图谱。系统不试图用大模型去脑补抽象的“矛盾(Contradicts)”或“更新(Updates)”关系,所有边的生成完全依赖系统运行时可观测的状态调用。当智能体综合多条记忆生成新内容写入图时,新节点的可读范围自动计算为所有上游引用范围的交集(Scope Intersection);若交集为空,则降级为仅对写入者自己可见。这种设计确保了权限收缩特性在多跳推导中天然不发生泄露。

2. 分离硬权限与软信任的检索物化

在检索阶段,给定智能体 $a$ 和查询语句 $q$,MAP-Graph 明确将检索打分分解为两步:

\[\mathcal{C}(a)=\{m\in\mathcal{M}_t : \mathrm{CanRead}(a,m)=1\}\] \[\mathrm{Score}(m,q,a)=s(m,q)\,\rho(m,a)\]

首先执行的是一票否决式的候选集筛选 $\mathcal{C}(a)$。底层引擎检查智能体对目标记忆以及目标记忆直接关联源头的读取权限,如果源头已被标记为撤销(Revoked)或不在权限作用域内,该记忆在进入相似度比对前就会被直接剔除。

只有通过了硬性权限检查的候选记忆,才会进入后续的路径信任(Path Trust)重排。最终得分由向量余弦相似度 $s(m,q)$ 与路径信任因子 $\rho(m,a)$ 相乘得到。这里的路径信任度并不是孤立读取当前记录的评分,而是沿有向图递归向上遍历其所有祖先节点,根据链路上的来源可靠度 $S$、完整性 $I$、新鲜度 $F$、先验信誉 $P$、验证状态 $V$ 以及祖先衰减 $A$ 累乘得出:

\[\rho(m,a)=\operatorname{clip}_{[0,1]}\bigl(S(m)I(m)F(m)P(m,a)V(m)A(m)\bigr)\]

如果某个祖先节点被标记为中毒或不可信,其低信任值会顺着推导链条以乘法形式向下传导,大幅压低衍生记忆的排名,甚至直接被归一化截断。这种设计将“不可越权的硬约束”与“多源佐证的软评估”在数学和执行路径上彻底解耦。

3. 面向动作风险的执行门控与标记隔离

检索阶段完成后,智能体根据上下文给出具体的行动提案(Proposed Action)。此时,MAP-Graph 启动第二道独立防线——动作时间门控(Action-Time Gate)。

门控根据当前动作声明的风险等级(例如低风险的普通文本回复,对比高风险的外部系统调用),动态调配判定阈值 $\theta$。针对支持当前动作的记忆集合,门控不仅复核其路径信任度是否达到风险阈值,还会沿着血统图进行回溯标记。一旦发现支持该动作的记忆链路上游挂接了被撤销、私密或投毒的源头,门控将直接输出拦截指令(如 Block、Reverify、Redact 或 AskUser)。

特别值得强调的是 MAP-Graph 对问题记忆的处理态度:只限制执行,绝不物理删除。受污染的后代记忆节点会被打上“Affected”标签,在图数据库中完好保留其完整的演化脉络。这种“留痕隔离”机制保证了系统在事后安全审计时能够完全复原事故现场,而不会因为粗暴的数据擦除导致审计线索中断。

实验评测:大获全胜背后的硬核指标

为了对这套机制进行充分检验,研究团队构建了一个包含 2,700 个合成任务的高难度基准,平均分布在企业工作流、软件工程和科研辅助三个领域,涵盖正常功能、投毒传播、隐私泄露、权限撤回、风险敏感度等 6 个严苛场景。对比基线涵盖了无记忆系统(B0)、标准共享向量记忆(B1)、隔离向量记忆(B2)、图记忆适配版 G-Memory(B3)、分级协作记忆(B4)、带高危检查的血统记忆 MemLineage(B5),以及保留全部扁平元数据但不建图、不溯源的控制组(B6 Flat Provenance)。

整个评测设置了双重核心指标:不仅考察宽松的任务成功率(Task Success Rate, TSR,只要系统进行了合理拦截即算成功),更考核精确决策准确率(Exact Accuracy, Acc,必须完全命中 Allow、Block 等预设 Oracle 标签),以及干净样本成功率(Clean TSR)、投毒攻击成功率(ASR)、隐私泄露率(Leakage)和条件未授权读取率(UAcc)。

实验数据呈现出极具说服力的断层差距:

在综合任务成功率(TSR)上,MAP-Graph 达到了 94.96%,比最强的扁平元数据基准 B6 高出整整 20.30 个百分点;在要求极为严苛的精确决策准确率(Acc)上,MAP-Graph 达到了 72.70%,比次优基线高出 21.63 个百分点。与此同时,它在没有任何安全威胁的干净样本(Clean)中依然保持了 90.22% 的高成功率,有力反驳了“安全系统全靠无脑一刀切拦截来刷分”的质疑。

在安全性指标上,MAP-Graph 展现出了近乎绝对的控制力:

为了验证该架构是否高度依赖特定底座大模型,作者还在抽取出的 540 个跨领域分层子集上,切换了 Qwen2.5-7B-Instruct、GLM-4-9B-0414 与 Llama-3.1-8B-Instruct 三种不同基座模型。跨模型迁移测试表明,无论底层模型如何变化,MAP-Graph 的精确决策准确率始终保持在 72% 以上,不安全动作率均控制在 1.7% 以内,且未授权读取拦截率在三个基座上全部维持在 100%。

消融研究带来的警示:高任务表现可能会掩盖致命漏洞

论文中最具反直觉、也最发人深省的结论,来自针对各模块的消融实验(Ablation Study)。

当研究人员故意剥离掉检索阶段的硬性权限过滤器(No Permission),系统在表面指标上不仅没有恶化,反而出现了极其诡异的“虚假繁荣”:任务成功率(TSR)从 94.96% 上升到了 96.00%,精确决策准确率更是从 72.70% 飙升到了 78.63%。

原因非常残酷:当系统解除权限拦截后,智能体能够检索到更加丰富、上下文契合度更高的背景记忆,推理过程变得更加“聪明”流畅;而在最终执行环节,后置的动作门控依然挡下了大部分高危动作,从而在宏观统计中给出了极高的问题解决率。然而,底层的审计监控显示,由于检索端门户大开,智能体的未授权读取率(UAcc)从 0% 暴增到了 100%。

这意味着,如果只盯着最终的任务完成度或端到端泄露结果进行评测,开发者会被漂亮的跑分彻底蒙蔽。智能体在黑盒内部已经完成了不可逆的机密信息读取,只是碰巧没有把机密作为最终答案吐给用户。这种隐蔽的数据越权在涉及数据合规(如 GDPR 或内部保密隔离)的企业级场景中是完全不可接受的。它从反面强力证明了:治理多智能体共享记忆,必须在检索入口处把死权限关口,绝不能寄希望于下游逻辑“事后诸葛亮”。

另外几组消融同样印证了架构设计的合理性:

走出象牙塔:走向作为控制信号的记忆血统

长期以来,数据血统(Lineage / Provenance)在软件工程和数据仓库中主要被当作一种被动的、事后排查问题的审计日志(Post-hoc audit metadata)。工程师只有在系统崩溃或数据对不上时,才会去日志里翻查“某条记录最早是由谁写入的”。

MAP-Graph 的探索颠覆了这种传统定位。它雄辩地证明,在多智能体自主决策的复杂闭环中,血统信息完全可以而且必须作为实时的操作控制信号(Operational control signal)介入每一次推理。通过将图结构的因果推导与离散权限检查、连续路径信任、动态动作门控深度融合,MAP-Graph 在完全不破坏正常协作推理能力的前提下,为共享记忆戴上了坚固的“安全项圈”。

当然,作者在文末也展现了严谨的学术克制。MAP-Graph 当前的评测仍建立在结构化合成任务与受控状态下,其假设权限标识和动作风险等级能够被前置解析,且单任务局限在四智能体单轮协作中。面对现实世界中非结构化的自然语言博弈、开放域长周期的跨会话记忆积累,以及更大规模智能体并发下的图遍历延迟开销,血统记忆治理仍有很长的路要走。

但它所确立的核心原则已足够清晰:在多智能体系统迈向企业核心生产链路的今天,不能再对检索召回的内容听之任之。“它是最相关的”绝不代表“它是合法的”,“能读到它”更不代表“能据此执行危险操作”。将权限、血统与动作风险进行全链路显式解耦,不仅是防范多智能体安全失控的技术防线,更是下一代高可靠 Agent 框架必须补齐的基础设施。