“停药”变“给药”余弦仍达0.96?Agent相似度门控审计:56个语义反转拦截为0

Similarity Gates Approve Reversals: A Validity Audit of Embedding-Cosine Thresholds in Agent Systems

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

“停药”变“给药”余弦仍达0.96?Agent相似度门控审计:56个语义反转拦截为0 论文图示

在大模型与自主智能体(Agent)的基础设施中,有一套被广泛采纳却极少受到根本质疑的工程惯例:将两段文本转化为稠密向量(Embedding),计算它们的余弦相似度(Cosine Similarity),再比对预设的固定阈值。这种设计构成了当今各类 Agent 框架的核心控制面(Control Surface),负责支撑语义缓存(Semantic Cache)、检索去重(Deduplication Filter)、运行时指令漂移监控(Drift Guard)以及模型输出评分(Answer Grader)。开发者部署这些门控的初衷,是试图回答一个极其关键的可靠性问题:“这段文本的意思是否依然保持不变?”

ArXiv URL:https://arxiv.org/abs/2608.10216v1

然而,由 Eigenforma 与 Freemind Labs 联合开展的一项最新测量学审计研究表明,这套遍布生产环境的机制在回答的其实是另一个截然不同的问题:“这段文本的字面措辞改变了多少?”

更严重的问题在于,在安全门控最需要发挥作用的关键场景下,“语义一致性”与“字面相似度”往往呈现出彻底的反向耦合。颠倒一条指令的核心含义,往往只需要修改、插入或删除一两个词;而用全新的词汇忠实转述同一含义,却必须替换几乎所有字面内容。这导致原本旨在阻断风险的安全门控,在实际运行时完全倒戈:一项审计中的真实生产级指令漂移守卫,在面对 56 个彻底扭转原始含义的对抗性突变样本时,拦截率居然是尴尬的 0(0/56 完全放行)。其中一个通过审查的保留测试样本将“对报告胸闷的受试者停用试验药物”(Withhold the study drug)篡改为“给予试验药物”(Administer the study drug),其计算出的余弦相似度竟高达 0.9608,而生产系统的报警拦截线仅仅设在 0.60。

这项发表的有效性审计不仅揭示了相似度门控机制的底层破绽,还证明了行业内常见的修补手段(如直接换用更大的通用编码器、基于字面重合率做分流微调,或是直接替换为预训练 NLI 模型)在面对独立作者编写的保留数据时全部迅速退化至随机猜测水平。

错位的测量标尺:当字面与语义背道而驰

在测量学与心理统计学传统中,一个经典的错误被称为“代理假设”(Proxy Presumption)——即未经充分验证,便将高维向量空间的几何距离直接视作理论构念(Theoretical Construct)的直接测量尺度。在 Agent 的工程落地中,开发者假设高维余弦距离等价于“语义忠实度”,却忽视了向量表征内部深度交织的字面重合(Lexical Overlap)、语体风格、主题与作者习惯等混杂因素。

这种错位源于人类语言构词与表达的深层结构,即语言学家 Horn 早在 1989 年便系统阐述过的否定不对称性(Asymmetry of Negation)。否定在语言学中属于“有标记”(Marked)的派生操作,其表达方式通常是在肯定句的基础上施加最小代价的修饰,例如添加“不”、“没有”或者替换一个反义动词。这类含义逆转的操作在本质上是附加式(Additive)或极小编辑式的,原句绝大部分词汇骨架都被原封不动地保留了下来。相比之下,在保持语义高度忠实的前提下进行改写(Paraphrase),则是一种全盘替换式(Substitutive)的操作,写作者会倾向于重构句式、使用同义句法和替换表达。

在论文分析的真实语料中,这种语言学特征直接转化为统计分布上的剧烈鸿沟:一个自然编写的、完全逆转含义的指令句子,与原始锚点(Anchor)文本之间的 Token Jaccard 重合度平均高达 0.72 左右;而一个语义完全忠实、仅是用不同词汇完整复述的句子,与锚点之间的 Jaccard 重合度仅有 0.06 左右。

当把这种成对文本送入基于注意力机制的文本嵌入模型时,模型感知到的主要是极高比例的上下文词汇重合。由于掩码语言模型和对比学习预训练阶段天然对否定极性缺乏足够的敏感度,余弦相似度不可避免地将这种高重合度判定为“几乎一致”。换句话说,安全门控原本要捕捉的“语义背离”信号,被极其强烈的“字面相似”噪声彻底淹没。系统原本要防范的是指令偏离,最终却把颠倒黑白的文本认作亲密无间的孪生兄弟。

朴素评测的自欺欺人与 AUROC 归零

如果这个缺陷在原理上如此清晰,为什么此前大量的框架开发团队和评测基准没有在第一时间拉响警报?论文作者深入剖析了评测语料构建过程中的隐蔽陷阱,并给出了一个令人警醒的发现:未经严格混杂控制的自建评测集,不仅无法暴露问题,反而会在指标上呈现完全颠倒的假象。

在天然编写的测试用例中,评测人员习惯性地使用“修改几个词”来构造反例(含义相悖),用“全句重写”来构造正例(含义相同)。这种无意识的操作直接将“是否同义”这个标签与“字面重合度高低”强行绑定。当研究团队使用这种未经正交设计的朴素语料去测试主流编码器时,发现门控的决策受试者工作特征曲线下面积(AUROC)在全部 18 个测试单元中有 13 个精确地降到了 0.000,且其余 5 个单元的最大值也仅仅是 0.040。

AUROC 为 0.000 意味着什么?在二分类评估中,0.50 代表完全无预测能力的随机猜测,而 0.000 则意味着分类器的打分排序与真实标签完全倒挂——在所有测试对中,含义完全相反的负样本得分,整整齐齐地排在了所有语义相同的正样本之上。如果一个工程师在不知道混杂机制的情况下看到这种数据,极可能会怀疑是评测脚本的标签写反了。而在实际生产系统中,这意味着门控在完全反向工作:越是危险的背叛越容易被判定为安全,越是严谨的同义改写越容易被当作漂移而拦截。

更为戏剧化的是,论文作者坦承,这一混杂陷阱甚至在研究过程中两度俘获了他们自己的判断。在早期的未配对比较中,研究人员曾观察到:在 180 次对比实验中,含义逆转对嵌入向量位置的位移程度,居然全部(180/180)比忠实转述小了 2.6 到 10.3 倍。他们曾一度把这一发现当作核心成果,直到严苛的对抗性审查介入才意识到:这根本不是表征空间对逆转有多迟钝,而纯粹是因为那组逆转样本恰好拥有 0.715 的极高重合度,而转述样本只有 0.062 的极低重合度。一旦在控制重合度的条件下进行平衡对比,这一所谓的“倍数效应”瞬间烟消云散。这从侧面证明了,仅凭工程直觉甚至学术直觉,极难抵御此类测量偏差的侵蚀。

解耦混杂:$2\times 2$ 阶乘审计仪器

为了彻底剥离字面重合度与真实语义决策之间的缠绕,研究团队设计了一套遵循经典测量有效性检验(Discriminant Validity)的 $2\times 2$ 阶乘语料库与审计框架。

该方案针对每一个原始锚点指令,严格生成四个象限的测试对:

这套设计使得研究者可以在锁死字面重合度维度的前提下,单独检验余弦相似度是否真正包含“决策是否改变”的信息;同时,也能在锁死语义决策维度的前提下,将字面重合度作为阳性对照(Positive Control)。

测试覆盖了包括 nomic-embed-text-v1.5(包括其 MRL 降维变体)、多款 e5 系列模型在内的 9 种主流编码器配置,且全部在本地固定模型权重下离线运行。

测试结果呈现出极其鲜明的分水岭。在阳性对照维度上,所有 9 种模型配置在区分“字面重合度高 vs 低”的任务中,分层 AUROC 全部达到了惊人的 0.975 至 1.000。换言之,嵌入向量空间的余弦距离确实是一把极其精确的尺子,但它量出来的纯粹是文本表面的用词重叠程度。

而在核心的语义决策维度上,一旦排除了字面重合度的干扰,各模型的表现便迅速暴露出致命短板。在相同字面重合区间内,余弦相似度对语义逆转的判别 AUROC 呈现出剧烈震荡,区间分布在 0.440 到 0.815 之间。尤其是在被审计的真实生产系统所采用的具体配置下,该指标直接跌至随机猜测水平(接近 0.50)。更直观的数据是类间绝对分值差距:在许多对比单元中,同义正例与逆转负例之间的余弦相似度均值差异仅在 0.0009 到 0.087 之间,甚至不及模型本身的浮点精度抖动与噪声。这意味着,根本不存在任何一个全局固定的浮点数阈值,能把语义背离从正常重述中切分出来。

生产系统的全面失守

当这套阶乘审计仪器对准实际部署的系统时,此前被框架测试用例所掩盖的问题全面浮出水面。

研究人员直接审计了一套部署在生产环境的指令漂移守卫,该守卫使用通用的开源嵌入模型,将余弦距离 0.40(即余弦相似度 0.60)设定为告警拦截红线。测试包含了两个批次的破坏性语义突变集(共 56 个变异样本),其中第二批 30 个样本由完全隔离的生成会话独立编写,确保研究代码和先验分布无法对其产生污染。

结果令人震惊:在全部 56 个破坏性样本面前,生产守卫的拦截率为 0。所有被篡改后的指令,余弦相似度全部分布在 0.832 到 0.9997 之间。也就是说,针对一个将触发线定在 0.60 的看门狗,所有颠倒黑白的攻击与漂移行为全部分布在 0.83 以上的安全区。即便允许在测试数据本身上反向过拟合去挑选最优阈值,该守卫所能达到的最佳平衡准确率(Balanced Accuracy)也仅仅在 0.550 到 0.573 之间,这说明门控系统在结构上已经彻底失效。

进一步细分变异类型,数据展现出一个极具黑色幽默意味的结论:民粹认知中常被当作主要风险的“显式否定词”(如增加 not),其实还不是表现最差的类别;真正造成灾难性失常的,是更隐蔽但业务危害极大的两类变异:

  1. 模态动词降级(Modal Downgrade):例如将系统规范中的强约束“必须(must)”篡改为弱建议“应该(should)”。在这种变异下,生产守卫在域内测试的判别 AUROC 直接挂零(0.000),在保留集上也仅有 0.125。

  2. 数量与单位篡改(Quantity/Unit Drift):将参数、剂量、限制数量进行微调,AUROC 同样低至 0.067 到 0.160。

这类修改直接保留了原句 95% 以上的字符,却在实际执行层面完全解除了 Agent 的行为安全阀门。类似的问题同样蔓延到了其他框架组件:在默认配置下,自动答案评分器(Answer Grader)对错误答案的放行率高达 42.5% 至 85%;而旨在清理冗余上下文的去重过滤器(Redundancy Filter),则有 20% 到 90% 的概率把意思相悖的关键文本当作“重复信息”悄悄丢弃。

为何这些严重漏洞在各个主流开源框架的代码库中从未被抓现行?研究团队翻阅了所有被审计框架自带的单元测试集,发现所有测试用例无一例外全部由“高重合的正例”和“低重合的异题负例”组成。框架自测中从来没有出现过一组“字面极度相似但决策完全反向”的极性测试对(Polarity Case)。缺陷之所以能长期存在于生产环境中,纯粹是因为现有的工程回归测试根本看不见它。

显而易见的工程修补为何全军覆没?

面对这种系统性失效,大多数工程师的第一反应通常十分自然:要么直接换用在基准测试(如 MTEB)上排名更高的嵌入模型;要么设计一个两阶段门控,把 Jaccard 字面重合度作为前置条件进行分段判定;要么索性引入轻量级的自然语言推理(NLI)分类头来专门兜底。

为了验证这些经验主义策略的有效性,研究团队采用了严格的预注册(Pre-registered)测试流程,将修复模型的超参数完全拟合在基础阶乘语料上,随后将其直接冻结,投入到完全由独立写作者编写的保留测试集中进行盲测。

实验结果给这种缝补策略泼了一盆冷水:

这一系列负面结果清晰地指明了一点:试图通过调整余弦阈值、添加简单的经验规则或仅仅在表面替换编码器,根本无法修复相似度门控的本体性缺陷。如果底层提取的几何表征没有经过显式的极性分离与去混杂训练,任何建立在余弦度量之上的决策边界都只是在特定的语料沙盒中自娱自乐。

庞加莱投影的几何障眼法

在对行业实践的系统审计中,论文还顺带拆解了一个极具迷惑性的技术模式:在某些高级检索与 Agent 架构中,部分团队为了追求所谓的层级表征能力,会在得到经 $L_2$ 归一化的向量之后,利用指数映射(Exponential Map)将其后验投影到双曲空间(如 Poincaré 圆盘)中,随后利用测地线距离(Geodesic Distance)来取代原有的欧氏或余弦相似度,并声称双曲几何能提供更优的语义区分度。

这项研究从数学上直接粉碎了这种幻想。研究团队给出了严格的封闭形式代数证明:对于任意曲率参数 $c > 0$,一旦输入向量经过了 $L_2$ 单位范数归一化,所有的点在投影后都将不可避免地落在庞加莱圆盘内完全相同的半径球面上。

在这个等半径球面上,两点之间的双曲测地线距离公式为:

\[d_{c}(\exp_{0}^{c}(u),\exp_{0}^{c}(v))=\frac{1}{\sqrt{c}}\operatorname{arcosh}\left(1+\frac{1}{2}\sinh^{2}(2\sqrt{c})\,\|u-v\|^{2}\right)\]

由于 $|u-v|^2 = 2 - 2\langle u, v \rangle$,该测地线距离在数学上与原始的余弦相似度呈现出严格的单调对应关系。换言之,任何利用测地线距离阈值所做的排序和二分类判定,与直接在原始余弦值上切一刀在数学逻辑上是 100% 等价的。

团队在 400 个真实维度的单位向量上进行了机器精度检验,两者的排序差异完全为 0(浮点误差小于 $1.3 \times 10^{-15}$)。这种在归一化向量后强行套用双曲几何的做法,在实际效果上纯属毫无收益的空转代码(No-op)。它生动地说明了当下的工程实践中存在多少“为了使用先进数学工具而使用”,却未曾检验其实际测量效度的虚饰。

走向经得起审计的 Agent 架构

这项审计并非全盘否定稠密向量表征的价值。事实上,在排除字面重合干扰的阶乘测试中,表现最好的两款编码器配置依然能够在同等重合水平下将语义逆转与同义改写区分开来,其局部 AUROC 达到了 0.79 到 0.90。这表明表征本身并非彻底失明,真正的症结在于:工程界长期将一个连续、渐进、极易受措辞干扰的弱相关信号,直接赋权充当了离散二元安全门控的绝对裁判。

对于当下的 Agent 系统架构师与开发者而言,该论文的结论敲响了一记警钟:

首先,必须重新厘定相似度门控的管辖权边界。余弦相似度可以且仅可以用来度量“两段文本在字面和表面主题上的贴近程度”,它适合做粗筛、主题检索或者提示词压缩的候选生成;绝不能让它单独担任诸如“指令合规检查”、“权限漂移监控”或“关键参数验证”这种非黑即白的控制面角色。

其次,对于涉及业务生死线的关键控制点,必须引入真正具备极性推理能力的仲裁层。无论是采用专为否定和对抗微调的小型判别模型,还是直接调用大模型充当配对裁判(Pair-level Judge),其核心都在于让校验模型明确聚焦于实体关系、逻辑约束和模态词的微小变异,而不是依赖整句的全局空间距离。

最后,也是最为根本的教训:在评估任何安全拦截机制时,绝不能依赖开发者自己顺手编造的测试样例。如果评估语料本身没有经过正交的因子分解设计,评测分数不仅会撒谎,甚至会反向给出一个虚假的“完美”背书。正如论文作者所开源的审计框架所示,在将任何度量指标提升为 Agent 的安全防线之前,唯有通过严格解耦混杂因素的独立审计,才能看清系统究竟是在抵御风险,还是在向反向指令敞开大门。