AskChem:以断言替代论文检索,240万化学实验证据实现100%可溯源
AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
在化学合成路线设计或催化机理探究中,科研人员往往要回答类似这样的问题:“针对二氧化碳还原生成一氧化碳的电催化剂,目前文献中报道了哪些材料体系,对应的法拉第效率分别是多少?”这类问题的答案从来不属于某一篇孤立的文献,而是零散分布在几十甚至上百篇论文的实验数据、补充信息与图表说明中。
ArXiv URL:https://arxiv.org/abs/2607.28618
长期以来,文献检索工具的交互范式几乎没有发生本质改变。无论使用 Google Scholar、Semantic Scholar,还是专业的 Reaxys 与 SciFinder,系统返回的核心单元始终是一串按相关度排序的“论文文档列表”。科研人员必须逐篇下载 PDF,人工通读、定位段落、核验反应参数,并手动拼装出跨文献的结论。当学术界开始尝试利用大语言模型(LLM)与自动化 Agent 代替人类进行文献调研与实验规划时,这种“以文档为中心”的检索形态暴露出了严重的不匹配。大模型直接面对长篇上下文不仅检索效率低下,在依据自身参数记忆作答时,更是频繁凭空编造看似严密的文献引用与 DOI(数字对象唯一标识符)。
近期开源的学术检索基础设施 AskChem 提出了一个根本性的转变方案:彻底打破以整篇论文为基本检索单元的传统做法,转而将承载可溯源信息的“原子化科学断言”(Provenance-carrying Claim)作为核心对象。

AskChem 现已上线部署并建立了一个涵盖 14.7 万篇化学论文的结构化索引,从中抽取出 240 万条原子化断言,并为其构建了可追溯的证据图谱与分面分类体系。在基准评测 AskChem-Bench 中,通过 AskChem 为 GPT-5.5 Reader 提供检索增强支持后,模型回答中的 DOI 可解析率达到了 100%,彻底消除了此前高达 11.7% 的引用伪造问题。这一工作不仅为人类化学家提供了一个能够精确定位到句子级实验事实的搜索引擎,更为各类科研 AI Agent 搭建了标准化的文献合成底座。
为什么说“以文档为中心”的检索已经见顶?
化学文献的密集度与结构特殊性,使得通用文档检索在这一领域的效果始终难如人意。一篇数十页的电催化论文可能包含几十个具体的实验组次,但检索系统往往只凭借摘要或标题中的关键词将整篇论文推给读者。
这种粗粒度交互带来了三重难以克服的系统阻力:
首先是信息提取的高摩擦成本。用户要找的是“特定反应条件下的产率或法拉第效率”,但系统给出的却是一组包含大量背景介绍、仪器型号、无关副反应描述的完整文本。科研人员或智能体必须耗费巨大的认知负荷去逐一做段落级扫描。
其次是上下文窗口与推理资源的无效消耗。如果直接把召回的数篇长篇 PDF 强行塞入大模型的长上下文窗口中,模型极易迷失在细枝末节的非核心论述中(即所谓的“迷失在中间”现象),同时带来居高不下的 Token 开销与延迟。
最为致命的是溯源与事实性校验的断裂。传统生成式 AI 在总结多篇文献时,往往在没有精确事实绑定的情况下对段落进行泛化改写,甚至将 A 论文的催化剂搭配 B 论文的电流密度混为一谈,最终附带一个格式正确却无法访问的虚假 DOI。科研探索经不起虚假数据的误导,缺乏细粒度证据锚点的文献检索系统,很难直接接入严肃的科研验证闭环。
AskChem 的设计哲学受计算机视觉领域“分割一切模型”(SAM)的启发:图像可以被精确拆解为可复用的语义区域,复杂的学术文献同样可以被精确切分为具有明确事实归属的原子断言。
解构论文:240万原子化断言的数据管线
在 AskChem 的底层架构中,最小检索单元被称为 Claim(断言)。它不是简单的文本切块(Chunk),而是一个具备严密 Schema 约束、可独立校验的结构化数据对象。
一条标准的 AskChem 断言必须具备两大刚性属性:其一是类型化的科学陈述本身,例如某种配合物在特定配体下的催化转化活性;其二是强绑定的来源证据链,包括来源论文的唯一 DOI、原文中的逐字引用(Verbatim Quote)或显式位置标记,以及置信度得分。除此之外,数据抽取管线还会尝试提取反应物、反应条件、定量测量值等化学专有结构化字段。在 AskChem 当前索引的 2.4M 条断言中,源头证据绑定率达到了 100%,确保了每一句断言都能一键穿透回原始出版物。
为了在庞大的文献体量下兼顾吞吐量与抽取深度,AskChem 设计了互补的双轨抽取管线:
-
高吞吐量抽取通道:直接面向海量文献的摘要与元数据进行快速并发处理,覆盖宏观结论、方法概述与核心性能指标,迅速搭建起千万级词条的广度基础。
-
深度全文抽取通道:针对开放获取的 PDF 全文开展细粒度解析。摘要往往倾向于报喜不报忧,大量对于实验探索至关重要的信息——例如研究假说、方法局限性、失败案例或意外副产物——往往只隐藏在全文正文讨论中。深度抽取器能够捕获这部分常被忽视但极具科研价值的高阶断言。
所有抽取结果在写入数据库前,都会经过严格的模式验证,确保数值区间合理、引文字符串在原文中真实存在,从而在数据入库阶段就剔除模型臆造的幻觉信息。底层系统依托 SQLite FTS5 全文搜索与向量索引结合的方案,辅以 FastAPI 提供高性能响应,兼顾了本地单机部署的敏捷度与生产环境的并发扩展需求。
分面、图谱与生命分类法:三种互补维度的织网
单有散装的原子化断言,很容易让检索结果沦为破碎的事实孤岛。如何帮助用户或 Agent 在跨篇断言之间理清脉络?AskChem 在共享的断言数据池之上,构建了三层互补的组织结构。
第一层是用于日常检索与分面过滤的稳定分面分类体系(Faceted Taxonomy)。不同于传统人工预先写死、难以适应前沿交叉学科的固定本体(Ontology),AskChem 采用了一种数据驱动的归纳策略。系统在解析文献和抽取断言的过程中自底向上归纳高频术语路径,随后通过规范化顶层路由、同义词归一化以及模糊聚类,凝练出一组稳定可靠的 $L1/L2/L3$ 分类层级。
这套体系在交互中映射为多个操作视口:反应类型(Reaction Type)、物质类别(Substance Class)、应用场景(Application)、表征与合成技术(Technique)、机理主题(Mechanism Topic)、断言类别、实测数据、时间跨度以及作者协作网络。对于任意一条断言,科研人员可以从“物质”视口切入查看同类化合物的表现,也可以随时切换到“反应机理”视口洞察微观动力学路径。
第二层是穿透单篇论文边界的证据图谱(Evidence Graph)。文献综合的核心难点不仅在于“收集”,更在于理清不同团队结论之间的承接与分歧。AskChem 在断言层之上部署了关系抽取模块,专门识别跨文献断言之间的逻辑脉络,输出带置信度与证据支撑的有向边。这些关系包括:支持(supports)、反驳/矛盾(contradicts)、扩展(extends)、派生自(derives_from)以及作为证据引用(cites_as_evidence)。在化学领域专家的人工抽样审计中,这套关系抽取系统的边类型精确度达到了 97.9%。如果某篇文献得出的催化产率与前期经典报道存在明显背离,系统能通过反驳关系直接将两项研究挂接展示,让科研人员在几秒钟内捕捉到潜在的学术争议点。
第三层则是面向高阶科学认知的生命分类体系(Living Taxonomy)。

如果说分面分类回答的是“这条断言关于什么实验对象”,那么生命分类回答的则是“这项贡献背后受制于何种宏观科学原理”。该体系目前包含 4,931 个节点,覆盖了 36.1 万个论文挂载点与 110 万条断言。它不再单纯按反应产物归类,而是自底向上以原理(Principles)、理论(Theories)、模型(Models)、机制(Mechanisms)与现象(Phenomena)作为主干。该树状结构具备动态弃权机制:当新涌现的研究无法被归入现有物理化学原理解释框架时,系统会主动提议新分支,从而使整套文献库具备了伴随科学范式迁移而持续演化的潜力。
混合检索机制:从模糊问句到精确事实链
当一位研究者在输入框键入“还原二氧化碳制备甲酸/一氧化碳的高效电催化剂”时,AskChem 内部执行的并非单一的文本匹配,而是一套多路召回融合架构。
系统首先将用户输入分发为四条并行的召回通路:
-
基于 SQLite FTS5 的断言文本 BM25 词法检索,精准锁定催化剂分子式、特征反应物与定量参数;
-
论文级别的粗粒度语义召回,保障研究主题层面的宏观覆盖;
-
基于分面分类树的节点召回,自适应将语义泛化至对应的反应族与物质族;
-
基于密集向量嵌入的语义相似度召回,捕捉学术表达多样性。
随后,系统采用互逆排序融合(Reciprocal Rank Fusion, RRF)算法计算全局综合得分,将最契合的断言呈现在用户眼前。检索结果直接展开为包含结构化数值、带下划线高亮的原文引句、所属分类路径与源 DOI 的卡片流。用户不仅可以直接点开分类路径展开层级漫游,更能在“网络(Network)”视图中直接观察召回断言与上下游研究的关联拓扑。
更为重要的是,AskChem 并非单纯设计给人类使用的 Web 门户,其系统架构对 AI Agent 展现出了高度的互操作性。平台不仅提供标准的 REST API 与 Python SDK,更直接原生集成了模型上下文协议(Model Context Protocol, MCP)。大模型 Agent 可以像调用本地函数一样调用 AskChem 的检索接口,单次获取高度紧炼、已完成可信度与出处绑定的断言集合,省去了 Agent 内部自写爬虫解析 HTML、切分 PDF 的繁重链条。
AskChem-Bench 实测:治愈大模型的“引文幻觉”
为了严格检验以断言为中心的检索系统在跨文献综合任务上的实战表现,研究团队构建了专门的基准测试集 AskChem-Bench。该基准包含 30 个需要聚合多篇文献方能作答的跨文献化学难题,覆盖了反应条件跨篇汇聚、催化剂发展时序追踪以及相冲突实验结果识别等复杂场景。
评测对比了五种截然不同的技术方案:未连接任何检索工具的纯 GPT-5.5 Reader、接入 AskChem 的 GPT-5.5、学术问答工具 Paperclip、Edison Scientific 基于 PaperQA 体系构建的端到端 Agent,以及 Google 的 NotebookLM Deep Research。
在最为关乎科研生命线的“引文真实性”指标上,对比展现出了戏剧性的分水岭。在直接让 GPT-5.5 回答电催化相关问题时,模型在回答中给出的 14 个 DOI 中,有 6 个属于完全无法解析的凭空捏造(DOI 解析率仅为 88.3%)。而当同一个 GPT-5.5 接入 AskChem 检索结果作为底层支撑时,回答中引用的全部 22 个 DOI 均顺利通过了 CrossRef 等权威机构的真实解析,解析率达到 100%。更为关键的是,由于断言本身附带极高密度的原文片段,AskChem 驱动的回答在引用密度(Citation Density)上稳居五个测试系统之首。
评测同时也客观展现了不同架构之间的能力边界与设计取舍。Edison Scientific 这类重度闭源的 Deep Research 智能体,在经过多轮深度推理、反复检索并综合超长上下文后,生成回答的定量参数密度和主题契合度略高一筹。然而,这种深度研报式的 Agent 往往需要数分钟的漫长运行,计算开销极其昂贵。AskChem 走了一条截然不同的基础设施路线:它追求原子断言的开源透明、毫秒级的轻量交互响应,以及作为即插即用组件服务于上层各类智能体的通用能力。在完全根除伪造 DOI 的前提下,AskChem 提供了极高的实用性性价比。
范式重塑:科研文献基础设施的演进路径
AskChem 的开源不仅为化学信息学带来了一个趁手的检索工具,其核心启示在于揭示了大模型时代学术文献基础设施的必然演进方向。
长久以来,学术出版体系以“论文”为单位建立版权壁垒与索引范式,但在海量文献爆炸式增长的当下,人类的阅读带宽早已见顶,科研 AI 也并非天生偏爱整篇长文。科研活动真正需要流通和校验的,是嵌入在复杂修辞与格式套话之下的“科学断言网络”。
通过使用大模型先行在后台把非结构化长篇文献“编译”为高精度、带出处的结构化断言,AskChem 实际上将文献检索退化为了针对原子知识图谱的高效路由查询。它既保留了学术文献应有的同行评议信用溯源(源 DOI 与原文照录),又剔除了冗余语境所附带的信息噪点。
当然,AskChem 目前仍面临着真实的工程挑战。现阶段其索引规模相较于浩瀚的化学文献总量仍属局部样本;依赖大模型抽取断言和建立分类映射,在涉及高度冷门的特殊缩写或晦涩语态时仍有理解偏差的风险;基于字符串归一化的分面聚类在边界情况下也可能混淆细微机理。
但这一范式转移带来的收益已无可争议:当大语言模型不再需要在无垠的文本汪洋里疲于捞针,而是面对着整齐划一、出处确凿、逻辑互通的原子断言库时,基于 AI 的跨文献综合、前沿假设生成乃至自动化实验规划,才算真正踏上了坚实可信的地基。