Intern-S2-Preview:397B科学智能体,时序推理提速5倍!

Intern-S2-Preview: Scientific Agentic Foundation Model

Intern-S2-Preview:397B科学智能体,时序推理提速5倍! 论文图示

长期以来,人工智能在科学领域的应用(AI for Science)大多局限于“静态问答”模式。模型或许能准确回答某个具体的生物学机制或物理公式,但在真实的科研场景中,科学发现往往需要跨越极长的时间维度,涉及多种模态的证据收集、复杂工具的迭代调用,以及对外部环境的持续规划与交互。通用的大型语言模型虽然具备强大的指令遵循能力,却难以深入理解雷达高频信号、多通道生理数据或复杂的科学论文版面;而现有的多模态科学模型,又大多缺乏支撑长期任务规划的智能体(Agent)特性。

ArXiv URL:https://arxiv.org/abs/2608.13505v1

面对这一断层,上海人工智能实验室(Shanghai AI Laboratory)正式推出了 Intern-S2-Preview。这并非一个单纯为了刷榜而生的静态模型,而是一系列专为多模态科学理解、复杂推理和长周期任务设计的科学智能体基础模型。作为此次报告的核心验证对象,拥有3970亿参数的 Intern-S2-Preview-397B 展现出了极具标志性的能力跃升:它不仅将时间序列的理解长度拓展至30万步,还将推理速度提升了5到6倍;通过独特的记忆解码器机制,该模型在不改变千亿级冻结骨干参数的前提下,仅凭外部挂载模块就将生物领域基准的平均分提升至60.32。

这项工作最值得关注的并非单一维度的参数堆叠,而是其打通了从科学多模态预训练、统一后训练到智能体强化学习的完整流水线。研究团队开发了一整套应对庞大参数量与异构任务挑战的系统级优化方案,彻底重塑了科学大模型处理复杂数值信号与长序列推理的底层逻辑。

架构创新:不仅懂文本,还要懂长时序与动态领域特化

为了让模型真正适应科学工作流,Intern-S2-Preview-397B 在底层架构上做出了两次关键的分叉:一是大幅强化了对数值信号的理解与预测能力,二是探索了极低成本的垂直领域特化路径。

科学观测数据往往具有采样频率高、通道依赖复杂、序列极长等特征。过去的大模型在处理此类数据时,极易面临显存爆炸和计算效率低下的困境。为了解决这一痛点,研究团队对时间序列编码器进行了全方位升级。相比于上一代模型,新的编码器将支持的最大输入长度从约24万步一举提升至300,000个时间步。更关键的是,在达到最大序列长度时,新架构实现了约5到6倍的推理加速,并将GPU显存消耗大幅压降至原本的20%。这种处理极长序列的能力,使得模型能够直接吞咽并解析高频雷达信号,大大扩展了其在天文、地球科学、神经科学以及声学领域的应用边界。

不仅如此,模型还实现了从“时序理解”到“数值预测”的跨越。科学研究不仅需要解释历史观测,更需要预测系统未来的演化状态。Intern-S2-Preview-397B 并没有粗暴地让大语言模型把预测数值当成离散文本去逐个生成,这种做法既低效又容易损失精度。相反,团队引入了一个专门的数值预测分支。

时间序列模块架构,支持长序列理解与数值预测

该分支通过 Q-Former 选择性地提取大语言模型的语义上下文和时序编码器的数值特征,通过交叉注意力机制条件化一个因果 Transformer 预测器,从而在多模态大模型的框架内,完美保留了未来状态生成的数值保真度。

而在模型架构的另一个切面上,为了解决科学领域知识更新快、重训千亿模型成本高昂的问题,团队探索了名为 Memory Decoder(记忆解码器)的独立扩展路径。这是一种无需修改核心参数就能实现领域特化的即插即用机制。在推理时,冻结的 Intern-S2-Preview-397B 骨干网络与领域记忆模块并行处理相同的输入上下文,并各自输出下一个 Token 的概率分布。一个轻量级的 Token 级路由器会根据两者隐藏状态中的不确定性特征,动态预测一个融合权重参数,以此决定外部专业知识在最终输出中占据的比重。这种设计使得模型可以在不损害通用能力的前提下,快速吸收全新的生物学或材料学知识体系。

重构数据基础:让模型看懂科学文档的真正结构

如果仅仅依赖海量的纯文本数据,模型永远无法真正理解科学知识的表达逻辑。因为在最前沿的科学论文中,关键信息往往散布在正文、图表、复杂公式以及特定的页面排版之间。一旦经历传统的文本提取(OCR),这些结构性信息就会支离破碎。为了铸牢多模态科学底座,Intern-S2-Preview 在预训练阶段实施了深度的视觉与排版感知训练。

视觉预训练(Visual Pre-training)构成了一个极具前瞻性的模态扩展阶段。模型直接从渲染为页面图像的大规模无标注科学文档中学习。它不再将文档视为干瘪的字符串,而是将其视为包含丰富空间逻辑的二维视觉场。这一机制有效地弥补了文本预训练在处理图表和跨栏排版时的先天不足。

视觉预训练流水线,从页面级视觉特征中捕捉文档结构

在此基础上,研究团队精心构建了图文交错数据,这远比普通的“图像-描述”配对复杂得多:

为了进一步增强高质量的多模态训练证据,团队还建立了一个亿级规模的图像检索增强流水线。通过将提取的科学图像映射到1024维的向量空间,模型能够在训练过程中实时召回并重排高质量的跨模态证据,大幅提升了模型在面对异构科学输入时的鲁棒性与知识广度。

后训练工程:如何驯服千亿级科学巨兽?

预训练赋予了模型广博的科学见识,但要将其转化为一个能够听懂复杂指令、调用工具并进行严密逻辑推演的科学智能体,必须仰赖一套极为精密的后训练(Post-Training)流水线。对于397B这样体量的巨型模型而言,在大规模强化学习(RL)阶段,任何计算瓶颈或策略偏差都会被无限放大。

研究团队首先通过高质量的监督微调(SFT)为模型注入了指令遵循和工具调用的初始能力,随后进入了多任务强化学习阶段。在这个阶段,他们必须直面三大系统性挑战:长推理轨迹导致的算力闲置、模型过度思考带来的低效,以及多任务优化中的梯度冲突。

最大的工程瓶颈在于长轨迹生成的“木桶效应”。在传统的同步强化学习系统中,哪怕批次中只有一个请求生成了异常冗长的推理轨迹,其他所有 GPU 都必须停下来苦苦等待这个“慢行者”完成,这导致算力利用率极其低下。为此,研究团队设计了一套带有离线策略修正(Off-Policy Correction)的局部 Rollout 系统。

局部Rollout机制,彻底打破长轨迹生成导致的算力闲置

在该机制下,一旦收集到足够支撑一个训练批次的轨迹,系统就会立即暂停剩余那些还在生成中的超长请求,并将它们的生成前缀暂时封存。GPU 随后无缝切换至策略训练模式,待模型权重更新完毕后,这些被暂停的请求会继续从中断处恢复生成。为了抵消这种异步机制带来的策略滞后偏差,团队引入了 KL 散度验证与重要性采样裁剪技术,确保利用旧权重生成的轨迹在更新当前模型时依然能够提供稳定、无偏的梯度信号。这一系统级创新,让集群在面对极端长尾的科学推理任务时,依然能保持满载运转。

与此同时,长链条推理模型常常会陷入“过度思考”(Overthinking)的陷阱——面对简单问题时,模型也会习惯性地生成冗长且毫无必要的废话。为了约束这种行为,研究团队没有选择会扰乱主线奖励的传统长度惩罚项,也没有引入繁琐的额外微调阶段,而是提出了一种优雅的自适应长度正则化方法。系统会动态识别那些优势函数(Advantage)为正但生成长度却过长的轨迹,并通过特定的衰减因子自动压降其优势值。这种不露痕迹的正则化手段,使得模型在保持高正确率的同时,显著精简了输出长度,极大提升了科学问题求解的响应效率。

为了进一步压榨推理生成的极限速度,团队还在 RL 阶段引入了在线推测解码(Speculative Decoding)。由于大模型的自回归生成极为缓慢,系统利用一个小型的草稿模型快速“猜”出接下来的若干个 Token,随后交由庞大的 Intern-S2-Preview-397B 策略模型进行一次性并行验证。凭借这种严格保持目标分布的拒绝采样机制,在确保生成质量绝对无损的前提下,推测解码技术使得整个强化学习流水线的端到端速度惊人地提升了 1.7 倍。

针对多任务训练中不同科学领域探索难度的巨大差异,团队还应用了群组级熵控制策略优化。这避免了因为某些任务天生具有较高的不确定性而导致奖励信号失效,确保了模型在代码编写、终端交互、数学推导等异构智能体任务上能够同步、稳定地收敛。最终,不同专家策略通过在线蒸馏被统一合并到了一个坚实的基座之中。

重塑科学发现的智能底座

Intern-S2-Preview 的诞生,标志着 AI for Science 领域从“单一模态的静态感知”向“多模态的动态规划与执行”迈出了决定性的一步。它不再仅仅是一个被动接收提问的“图书馆”,而是一个能够读取雷达波形、梳理复杂文档排版逻辑、在虚拟终端中验证假设,并具备长期记忆特化潜力的“全能科研助手”。

上海人工智能实验室通过一系列极具挑战性的系统工程创新——从30万步时序推理的突破,到局部 Rollout 与自适应正则化对长周期训练的重构——彻底驯服了397B的庞大参数。这些扎实的底层基建,不仅为模型在各大通用与科学基准上取得领先地位奠定了基石,更为未来探索更深层次的自动化科学发现(Automated Scientific Discovery)提供了一个强有力的、可延展的全新范式。科学研究的智能体时代,正从这些枯燥而又精妙的架构代码中加速开启。