Mechanist:用AI自主解构AI机制,从跨模态潜意识偏好到DNA精准干预
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

大语言模型和前沿多模态系统展现出的涌现能力正在重塑各行各业,但一个愈发尖锐的隐忧是:人类越来越不知道这些模型在内部究竟是如何思考、存储信念并作出决策的。传统的可解释性研究(Mechanistic Interpretability)高度依赖研究人员手工提出假设、手动设计因果干预实验、逐层追踪注意力头与神经元激活,这种作坊式的科研节奏已经远远赶不上大模型参数膨胀和自动化训练的迭代速度。理解模型能力的滞后,不仅限制了进一步提升推理能力的可能,更在关键安全领域埋下了难以预测的潜伏风险。
ArXiv URL:https://arxiv.org/abs/2608.12036v1
来自新加坡国立大学、加州大学圣地亚哥分校、浙江大学、南方科技大学等机构的研究团队提出了 Mechanist,这是首个将 AI 本身作为“科学仪器”,用于全自主探索、解释并干预大模型内部智能机制的 Agent 科学研究系统。与以往仅用于辅助写代码或做文献总结的科研助手不同,Mechanist 拥有完整的假设生成、实验执行、因果验证与多轮自反思闭环。

该系统不仅在 16 篇经典机制可解释性论文的复现实验中展现出大幅超越 Claude Code 和 AI-Scientist 的执行可靠性与假设质量,更自主完成了一系列从“发现未知行为”到“提炼机理理论”,再到“实现因果控制”的完整科学发现:
-
首次揭示了实验室安全领域中跨模态的“潜意识学习”风险——即使微调数据表面上完全中立且安全,模型的危险倾向依然能跨模态穿透过滤机制;
-
构建了基于心智理论的模型信念表征机制,定位了世界知识、个人信念与归因信念的特定功能头,并通过动态探测干预实现了最高达 +15.3% 的推理净增益;
-
将可解释性机制跨界迁移至生物基础模型 Evo2-7B,通过定向激活内部特征,成功在保持序列有效性的前提下提升人工合成蛋白质的 $\alpha$-螺旋含量。
自动化科学闭环:用多学科知识库驱动机制探索
现有的 AI 科学研究系统(如用于材料发现或药物筛选的系统)往往将大模型作为观测外部自然现象的计算工具,而 Mechanist 则将研究的“显微镜”调转方向,直接对准大模型自身。想要实现真正意义上的自主机制发现,系统必须具备跨学科的灵感迁移能力,以及严苛的因果验证标准。为此,研究团队为 Mechanist 搭建了由浅入深的专业底座。
在知识供给层面,Mechanist 结合了两套异构数据库:一套是包含 4300 万篇论文、横跨 26 个学科的跨学科知识图谱 SciAtlas,涵盖认知科学、神经科学、心理学及生物化学等领域;另一套则是团队专门构建的高精度机制可解释性专用图谱,收录了约 1.3 万篇论文,并严格从研究对象、应用场景和分析方法三个正交维度进行标准化标注与人工质检。此外,系统内置了涵盖因果干预、激活修补、探针分类、稀疏自编码器等 32 种可执行的基础机制分析方法库,为实验生成提供了可靠的工具箱。
在智能体协同架构上,Mechanist 由中央调度器(Orchestrator)协调四个分工明确的阶段智能体:假设生成智能体负责检索跨学科类比并提出可证伪的猜想;实验智能体负责生成代码、调度 GPU 运行消融或干预实验;验证智能体利用形式化指标和因果基准检验结论是否站得住脚;迭代智能体则结合独立的大模型评审(GPT-5.4)诊断问题所在,精准决定是回滚修正假设表述,还是重构实验管线。这种基于显式上下文工件(Artifacts)的模块化工作流,避免了上下文污染,使得复杂研究任务在预算耗尽前能够进行多轮稳健迭代。
发现未知的安全盲区:跨模态潜意识偏好的隐蔽渗透
在行为发现层面,Mechanist 自主挖掘出一种令人警惕的安全漏洞:跨模态潜意识学习(Multimodal Subliminal Learning)。此前的研究已经证明,纯文本模态下存在非语义的行为传递通道。例如,一个具有猫头鹰偏好的教师模型在生成与猫头鹰完全无关的中立数字序列后,用这些数字训练的学生模型竟然也会隐性习得对猫头鹰的偏好。然而,这种风险此前仅被视为单一模态下的数据偏好偏差。

Mechanist 将这一假设推进到了多模态与安全敏感的实验室场景中。系统设计了一个对抗性实验:首先诱导一个 Qwen3.5-9B 教师模型表现出不安全的化学合成倾向,随后让该教师模型生成关于实验室日常操作的图文问答数据,并经过严苛的内容过滤器剔除所有显式包含危险化学品或违规操作的样本,仅保留表面上完全合规、安全的数据。最后,使用这些经过清洗的“无害”数据微调学生模型。
令人震惊的是,在面对多模态实验室安全评测时,学生模型的违规危险回答率显著上升。类似现象在视觉模态生成中同样得到了复现:一个被植入香蕉偏好的教师模型生成表面完全正常的苹果图像,微调后的图像生成学生模型在被要求生成“最喜欢的水果”时,输出香蕉的概率大幅飙升。Mechanist 的这一发现证明,有害特质或后门偏好可以通过语义完全相反或表面良性的跨模态数据实现非语义隐蔽传播,现有的基于关键词或语义过滤的数据安全防线在此类攻击面前极易失效。
破译大模型的心智机制:信念状态的分离与因果干预
在行为观测之上,科学研究更深层的任务是揭示背后的工作机理。面对“大模型是否真正拥有类似心智理论的信念表征”这一前沿争议,Mechanist 借鉴了认知心理学中关于人类信念的分类体系,提出了针对大语言模型的信念机制理论(Mechanism Theory of Belief)。
系统将模型的信念状态解构为三个可分离的维度:
-
世界知识(World Knowledge, WK):客观事实在模型参数空间中的无偏存储;
-
个人信念(Personal Belief, PB):模型在特定语境下自身持有的事实判断;
-
归因信念(Attributed Belief, AB):模型推断并暂存的其他主体的信念(哪怕该信念客观上是错误的)。

借助因果干预分析,Mechanist 在开源模型 Pythia-1B 中定位到了功能高度稀疏且相互解耦的特定注意力头。研究发现,负责写入归因信念的注意力头位于浅层的第四层(L4.H1),而负责纠正和维持个人信念的注意力头则集中分布在中后层(L7.H5、L9.H1、L12.H1)。Mechanist 进一步追踪了预训练过程中的检查点动态,发现归因信念头(AB)的形成明显早于个人信念头(PB)。从 2k 到 143k 预训练步数之间,模型相关推理能力的涌现轨迹与掩盖这些注意力头时的因果效应高度对齐,这强有力地证实了模型的心智推理能力是在预训练阶段通过参数功能分化逐步内生形成的,而非单纯依赖推理期的上下文 Prompt 提示。
更重要的是,Mechanist 没有停留在机理解释的定性层面,而是将机制发现直接转化为提升模型性能的轻量级干预手段。传统方法为了引导模型理解复杂语境,往往依赖昂贵且脆弱的系统提示词(Oracle-style Hints)。Mechanist 则构建了一个极轻量的线性探针,在模型推理过程中实时检测隐藏状态属于 WK、PB 还是 AB,并在计算前向传播时动态增强对应的注意力头激活。
实验结果显示,在涵盖医学、化学和日常常识的跨领域测试中,这种免训练的机制干预方案在 Pythia-410M、Pythia-1B 和 Pythia-2.8B 上分别取得了 +15.3%、+8.8% 和 +3.5% 的推理准确率净增益,远超提示词工程带来的微弱改善(分别为 +1.6%、+3.1% 和 +0.1%)。与此同时,干预对原有正确样本的破坏率(Break Rate)仅在 1% 左右,展现出高度的因果精确性与控制稳定性。
走向跨学科改造:生物基础模型的特征定向操控
Mechanist 展现出的科学探索潜力并不局限于计算机科学本身,它还成功将其因果控制逻辑拓展到了跨学科的生物大分子设计领域。
在合成生物学中,控制由 DNA 序列编码的蛋白质二级结构(如 $\alpha$-螺旋比例)是人造蛋白质工程的关键指标。传统方式依赖生物学家在庞大的潜在特征库中人工筛选特征,并手动编写干预管线。而面对基因组基础模型 Evo2-7B,Mechanist 在仅给定宏观科学目标的前提下,自主展开了一整套机制定向工程。

Mechanist 首先利用稀疏自编码技术扫描 Evo2-7B 的内部隐层,自动识别出与蛋白质 $\alpha$-螺旋结构($\alpha$-helical content)存在强因果关联的内部隐式特征向量。随后,系统设计了生成期的特征导引算法:在生成目标 DNA 编码序列的过程中,对特定特征施加受控的转向系数 $\alpha$。为了确保生成的序列在生物学上真实可行,Mechanist 引入了局部距离差异测试(pLDDT)结构置信度评分以及开放阅读框(ORF)有效性检查。
系统对 900 条生成序列的系统评估表明,当转向系数 $\alpha$ 逐步提升时,预测生成的蛋白质 $\alpha$-螺旋含量显著增加。在折叠质量评分 $\text{pLDDT} \geq 0.5$ 的高置信子集上,Mechanist 的定向特征干预展现出大幅优于随机特征扰动的选择性增益。在权衡了 $\alpha$-螺旋含量增益与 ORF 结构有效性后,系统自动收敛于最优系数 $\alpha=8$,在保持结构高置信度(pLDDT = 0.79)的同时,成功将典型序列的 $\alpha$-螺旋比例推高至 59.1%。这一过程证明,Mechanist 能够将大模型内部抽象表征转化为可落地的跨学科实体设计控制变量。
自动化科研的可靠性基准与范式跃迁
过去一年,AI 辅助科研领域涌现了诸如 AI-Scientist 等代表性探索,但这些系统往往面临假设天马行空、代码复现极易崩溃、幻觉逻辑频发等落地痛点。为了定量检验 Mechanist 的科研硬实力,本文设计了一套严格的双盲评估基准:在 16 篇经典机制可解释性论文的复现任务中,由三位资深人类专家评审、Claude Opus 5 以及 GPT-5.6 共同对 Mechanist、Claude Code 和 AI-Scientist 进行独立打分。

跨评测者的评分一致性检验显示,人类专家与大模型裁判的打分趋势高度共振。在全流程复现可靠性指标上,Mechanist 在所有裁判标准下均位列第一,其模块化的回滚反思机制有效遏制了代码运行期崩溃与逻辑悬空现象。而在科学、语言、复杂推理和安全四个维度的新假设生成评测中,Mechanist 在新颖性(Novelty)、科学影响力(Impact)和可检验性(Testability)的综合分布上均显著超越对照基线,展现出更扎实的科学求索品质。
从宏观科研范式来看,Mechanist 标志着“AI 研究 AI”(AI for AI)正从“以性能提升为唯一目标的黑盒调优”,向“以内部机制理解为核心的白盒科学分析”迈进。过去,自动化机器学习往往聚焦于单纯刷榜或网络架构搜索,对黑盒内部的因果逻辑并不关注。而 Mechanist 表明,将因果干预、认知科学理论与自动化智能体体系深度融合,完全有可能让 AI 自主扮演科研同侪的角色,穿透数十亿参数的神经网络迷雾,揭示智能涌现背后的底层法则。