SeekBrain:用经验配方库驱动多智能体,神经科学基准超 Claude Code 11.7%
SeekBrain: An Autonomous Multi-Agent System for Accelerating Neuroscience Discovery
现代神经科学正在被海量、异构且跨尺度的实验数据所重塑。研究人员不仅能记录自由活动动物的精细动作姿态,还能同步追踪全脑数十万神经元的动态钙信号、解析突触级连接组,甚至测定单细胞空间转录组。然而,数据爆炸并没有等比例带来科学发现的爆发。真正卡住科研人员日常进度的,往往不是缺乏假说,而是极其琐碎且复杂的分析工程:分子、结构、神经电生理与行为数据的数据格式完全异构,各分析环节割裂在不同实验室遗留的专用脚本或未维护的第三方代码库中。
ArXiv URL:https://arxiv.org/abs/2607.29347
通用大模型智能体(LLM Agents)近期在生物医药与合成生物学等领域展现了自动化潜力,比如针对单细胞 RNA 测序的自动化流水线。但若将通用智能体直接扔进神经科学领域,它们往往会陷入严重的“方法学幻觉”。原因在于,神经科学缺乏统一标准的软件生态,海量关键的分析经验并没有被封装在标准函数库里,而是以散碎的代码和经验法则深埋在论文正文与补充材料中。为了填补这一断层,研究团队提出了专门面向神经科学数据分析与假设探索的自主多智能体系统 SeekBrain。它不依赖僵化的预设工具集,而是将前人研究中的论文-代码对动态结晶为标准“分析配方”(Analysis Recipes),并配合分层规划与严格的验证引擎,在自研的神经科学基准评测 BrainArena 上实现了对主流通用智能体的显著超越,并在斑马鱼和小鼠两项真实前沿课题中完成了从数据整合到科学再发现的全流程验证。

为何通用智能体在神经科学研究中屡屡受挫?
在生物信息学领域,分析流程相对标准化,例如单细胞转录组分析通常紧密围绕成熟的工具包(如 Scanpy 或 Seurat)展开,通用智能体只需调用既定 API 便能完成大部分任务。然而,神经科学的数据特征与分析逻辑呈现出高度的碎片化。一个典型的实验可能同时包含高帧率红外摄像机记录的动物三维姿态序列、双光子全脑成像或高密度神经探针采集的时间序列,以及电子显微镜重构的解剖配准坐标系。
这种跨模态、跨尺度的复杂性带来了极其苛刻的技术挑战。首先,在特征提取和降维时,通用的机器学习方法往往无法顾及神经生物学的生理合理性。例如,直接对不同动物个体的神经流形进行比较时,若忽略跨个体的解剖配准和几何对齐(如普氏对齐,Procrustes analysis),所得出的相似性结论毫无生物学意义。其次,由于缺少中心化的权威分析库,诸多数据清洗、信噪比阈值筛选、时间轴同步及零假设置换检验(Permutation Test)的逻辑,只存在于各领域学者的独立代码库中。当通用的代码生成智能体面对此类需求时,经常会根据字面意思生成看似可运行、实则缺乏统计效力或完全违背领域共识的代码。
SeekBrain 的核心切入点正是解决领域方法学知识的沉淀与复用问题。它不是简单地堆砌提示词,而是从底层重塑了智能体获取神经科学分析经验的方式,让多智能体在严格的方法学约束下协作开展研究。
核心机制:经验配方库与双引擎驱动
为了让大模型真正掌握严谨的神经科学分析范式,SeekBrain 构建了一个闭环的多智能体工作系统,其架构由一个领域知识沉淀库与两套核心驱动引擎组成。
整个系统的知识根基是神经科学分析配方库(Neuroscience Analysis Repertoire)。研究团队设计了专门的“结晶智能体”(Crystallization Agent),其职责是持续解析权威文献及其对应的开源代码仓库。该智能体能够从论文正文提取出具体的科研意图与实验逻辑,从配套代码中提取出数据输入输出接口、预处理步骤、核心建模算法与可视化规范,并将其整理成结构化的分析配方。初始配方库沉淀了 68 个基础分析配方,横跨行为分析、神经动力学表征、结构脑连接与分子转录组等模态,既包含针对单一模态的处理,也涵盖跨模态联动的分析协议。更为关键的是,这个配方库不是静态的规则字典;在后续实际研究中,人类专家介入调整并验证成功的分析链路,会被重新提炼并反哺至库中,使系统具备经验持续积累的能力。
在处理科研任务时,SeekBrain 采用规划与执行解耦的双引擎架构:
-
研究规划引擎(Research Planning Engine):接收到高级、开放式的科学探究需求后,该引擎并不急于写代码,而是启动“编排智能体(Orchestrator)”与“审稿智能体(Reviewer)”之间的对抗式辩论。编排智能体结合前沿文献调研,将宏观问题拆解为具体的假说与子任务;审稿智能体则从生物学相关性、逻辑闭环性、现有数据充分度以及任务冗余度等维度反复质询与挑刺。双方迭代辩论,最终生成一棵树状结构的分层研究方案,树的终端叶节点即是边界清晰、可直接计算落地的原子分析任务。
-
分析执行引擎(Analysis Execution Engine):针对树状方案中的每个原子任务,系统启动一个四阶段闭环:
-
形式化(Formulation):形式化智能体调取配方库中相匹配的方案,针对当前数据维度生成结构化的计算规范。
-
编程实现(Coding):代码智能体将规范转化为实际的 Python 脚本,进行数据清洗、参数调试与运算。
-
多维验证(Validation):专门的验证智能体扮演严苛的同行评审角色,从“意图对齐度”、“方法保真度”、“定量完整性”和“图表规范性”四个维度对运行结果和生成的图像进行检验,若未通过则要求代码智能体回溯重写。
-
科学阐释(Interpretation):在通过技术验证后,阐释智能体提炼统计显著性与图表规律,生成自洽的文字结论,并在证据不足或诊断指标欠佳时主动标注不确定性。
-

BrainArena 基准:全面超越通用前沿智能体
为了量化评估智能体端到端处理神经科学分析的能力,研究人员推出了领域基准 BrainArena。该基准涵盖了来自秀丽隐杆线虫、果蝇、斑马鱼、小鼠及猕猴 5 种核心模式生物的 32 项真实分析任务。任务类型横跨神经响应表征、群体解码、计算建模、脑网络拓扑与发育分子分析等 7 大类别,其中超过 70% 的任务需要处理双模态或多模态的复合数据。更重要的是,每项任务均配备了基于原著标准的专家级评分细则(Rubric),设定了总计超过 700 项精准扣分细则,严格考察方法正确性、图表还原保真度和科学阐释有效性。
在基准评测中,SeekBrain 与通用智能体代表 Claude Code(基于 Claude Opus 4.7)及 Codex(基于 GPT-5.5)进行了全面对比。结果表明,SeekBrain 取得了 75.8 分的平均成绩,相比 Claude Code 的 64.1 分提升了 11.7%,相比 Codex 的 58.1 分提升了 17.7%(Friedman 检验 $P < 0.0001$,经 Dunn 多重比较校正均具有显著差异)。
从任务类型分解来看,SeekBrain 在全部 7 种分析大类上均取得了最高得分,其中在技术难度极高的“神经解码”与“脑网络解剖映射”任务中,相较于基线模型的优势尤为显著,领先 Codex 的幅度达到 28 分以上。在难度分级测试中,面对简单任务,通用智能体尚能勉强应付;但在涉及长程跨模态处理的困难任务上,基线模型的得分出现了断崖式下滑,而 SeekBrain 展现出了极强的韧性。细分维度的得分进一步解释了这一差距:SeekBrain 最大的领先优势出现在“科学阐释有效性”上,这表明基线模型往往只能机械执行脚本,难以根据图表做出符合神经生物学统计事实的解读,而 SeekBrain 凭借严格的验证和阐释回路,最大程度杜绝了假性结论。
为探究分析配方库的实际贡献,研究团队进行了去配方化消融实验。当移除配方库、完全依赖大模型通用编程能力时,SeekBrain 的综合评分从 75.8 分锐减至 63.2 分(Wilcoxon 符号秩检验 $P < 0.0001$)。消融后智能体在诸多关键步骤上频现低级失误,例如在脑网络空间映射时出现解剖轴向颠倒错位,直接证实了沉淀领域先验对遏制方法学幻觉的必要性。
真实科研验证:从斑马鱼行为流形到小鼠决策全脑共享轴
脱离真实科研场景的基准测试不足以说明工具的实用价值。研究团队在两项跨越不同模式生物的真实前沿课题中对 SeekBrain 进行了实际检验。

案例一:人机协同下斑马鱼三模态数据的几何与解剖解析
在第一项应用中,SeekBrain 在人类科学家的引导下,分析了一套包含幼年斑马鱼自由游动行为轨迹、全脑神经元钙成像动态以及解剖配准信息的三模态数据集。科研人员按逻辑提出一系列渐进式探究目标,SeekBrain 自主构建并执行了多阶段分析管线。
系统首先将行为学中的离散游动回合(Bouts)归类,并对全脑体素级动态进行低维空间映射。为了验证不同斑马鱼个体间神经表征的一致性,SeekBrain 自主调用了正交普氏变换(Orthogonal Procrustes Analysis),将 13 条幼鱼的神经活动聚类质心映射到同一低维空间中进行几何对齐。成对 Wilcoxon 符号秩检验显示,同一行为簇跨鱼的余弦距离显著小于不同行为簇之间的距离($p = 2.44 \times 10^{-4}$),证实了行为在神经低维流形上存在高度结构化、守恒的几何几何特征。随后,系统进一步执行跨脑区对比映射,从解剖上定位出对各类运动行为具有特异性响应的超体素(Supervoxels),绘制出覆盖菱脑、中脑各核团的精细分布图,成功协助科研人员揭示了斑马鱼在自由运动时全脑分布式而又具备空间特异性的表征结构。

案例二:智能体主导的 IBL 小鼠决策数据集科学再发现
如果说斑马鱼案例展示了其作为高水平“科研副手”的执行力,那么在对国际脑实验室(IBL)小鼠全脑决策数据集的重新分析中,SeekBrain 则展现了自主“假设驱动”的探索能力。在这一实验中,SeekBrain 自主提出探究假设:大脑皮层与皮层下多个区域在处理视觉刺激、运动选择、奖惩反馈等任务变量时,其区域层面的解码能力是否存在某种跨任务的潜在全局关联?
在人类研究员确认选题可行性后,SeekBrain 制定了完整的统计分析方案:
-
计算了刺激、选择、反馈以及运动学变量(瞬时速度与加速度)共 5 类解码器在全脑 201 个解剖区域上的解码强度图谱。
-
矩阵相关性分析显示,所有 5 类解码图谱在全脑尺度上均呈现显著的正向相关。
-
主成分分析(PCA)进一步揭示,第一主成分(PC1)解释了高达 63.2% 的方差变异。通过执行 5,000 次置换零假设检验(Permutation Test),系统确认该主成分绝非随机噪声产生(经验 $P \approx 0.0002$)。
-
随后,智能体将 PC1 载荷投影至 Swanson 小鼠脑平铺图谱上,发现网状结构、运动相关脑干核团及丘脑区域表现出最高的基线得分,揭示出全脑存在一个共享的区域解码强度轴。
-
为了排除“动物自身运动伪影导致全脑普遍相关”的混淆假设,SeekBrain 进一步使用普通最小二乘回归,在每个脑区中严格剔除动物速度与加速度相关的方差成分。残差分析证实,在剥离纯运动因素后,刺激、选择和反馈解码图谱依然保留了稳健且具有区域特异性的空间变化,从而确立了该共享轴不仅反映通用的唤醒或动作状态,更承载着高阶认知变量的全局协同。
总结与展望
SeekBrain 的突破不仅在于为神经科学家提供了一款高效率的自动化分析工具,更在于探索出了一条“如何让 AI 真正进入经验密集型学科”的方法学路径。
长期以来,AI for Science 在生物医药领域的尝试往往受制于两个极端:要么试图构建大一统模型直接“端到端预测”复杂的生物过程,结果沦为黑盒;要么仅将 LLM 作为辅助写代码的通用聊天助手,频繁遭遇方法学幻觉。SeekBrain 证明了一种更稳健的中间范式:将散落的文献经验代码化、配方化,再依托对抗辩论与多维验证的多智能体流水线加以调度执行。 这种机制既保留了白盒代码的可解释性与统计严谨度,又赋予了系统根据数据特点灵活重组流水线、甚至自主探索全新假设的敏捷性。
诚然,当前的 SeekBrain 仍处于人机协作的辅助阶段,其假说探究空间依然离不开人类科学家的顶层把关与物理常识修正。但随着经验配方库的持续扩充,以及自主验证机制的不断完善,这种能够深刻理解领域规范、具备严谨推演能力的领域原生智能体,有望逐步将科学家从繁重机械的工程脚本调试中解放出来,真正推动跨尺度脑科学研究迈向数据驱动与假说探索并行的新阶段。