WeatherNext 3:告别分析场,DeepMind用原始观测实现逐小时0.1°预报

WeatherNext 3: Increasing resolution and performance of global weather models with raw observations

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

WeatherNext 3:告别分析场,DeepMind用原始观测实现逐小时0.1°预报 论文图示

过去三年里,AI 气象大模型在计算效率和中长期预报精度上实现了对传统数值天气预报(NWP)的快速追赶。然而,几乎所有主流全球 AI 气象模型都受困于同一个底层瓶颈:它们本质上是在拟合由传统物理动力模型生成的“分析场”(Analysis Data,如 ERA5 或 ECMWF 的 HRES 分析)。分析场虽好,却由同化系统生成,天然继承了数值模型的系统性偏差,更新频率受限于每 6 小时一次的同化周期,且数据出炉往往落后真实世界数小时之久。

ArXiv URL:https://arxiv.org/abs/2609.03582

Google DeepMind 团队推出的 WeatherNext 3(WN3)正式打破了这一范式束缚。它不再将模型禁锢为分析场的“物理模拟器”,而是首次在大尺度全球业务化模型中,直接吸纳低延迟静止卫星原始云图和地面真实站点观测,将传统气象中截然割裂的数据同化、数值预报和统计后处理三大阶段融为一体。

这项升级带来了显而易见的工程与预测飞跃:WN3 不仅将单层变量预测分辨率提升至与顶尖物理模型持平的 0.1°(约 10 公里),支持逐小时输出太阳辐射、云量等关键气象要素,还能在获取最新静止卫星数据后实现逐小时滚动起报。依托创新的连续时空隐空间查询机制,模型能够在地球任意地点精准预测 2 米地面温度和露点,即使在未参与训练的未知气象站上也展现出了极强的泛化能力。这一成果标志着全球 AI 气象预报正式从“拟合数值同化产物”迈向了“直面真实物理世界观测”的新阶段。

为什么拟合“分析场”的旧范式难以为继?

要理解 WeatherNext 3 的跃迁,必须先看清现有 AI 气象模型的结构性硬伤。在传统数值天气预报体系中,观测数据首先需要经过极其复杂且算力高昂的数据同化系统,与物理模型的背景场进行融合,最终在规则网格上生成最贴近真实大气的“分析场”。无论是此前的 GraphCast、Pangu-Weather 还是 WeatherNext 2,绝大多数全局 AI 模型在训练时都将这些分析场作为唯一的绝对真值。

这种做法在初期降低了多源非结构化数据的处理门槛,但副作用随着模型能力的演进而急剧放大。首先是系统性偏差的代际遗传:分析场本身包含数值模型的假设与参数化方案,在降水、地表温度和低层云系等高度非线性过程上存在已知系统性偏差,纯粹基于分析场训练的 AI 模型自然会全盘继承这些物理缺陷。

更致命的瓶颈在于业务运行中的“时间滞后”。全球顶尖的业务化分析场通常每 6 小时同化一次,同化窗口在名义分析时间后延伸 3 小时,再加上数小时的生成与传输延迟,这意味着当业务预报系统拿到最新的分析场切片时,其底层状态已经相对当前真实物理世界滞后了 5 到 12 个小时。对于快速生消演变的对流风暴、局地强降水或台风移动,这种以数小时计的“数据饥渴”往往直接抹杀了短临预报的物理敏锐度。

此外,大量包含丰富对流和水汽信息的原始高频观测——例如每 10 到 15 分钟更新一次的静止气象卫星红外与可见光波段——在传统同化系统中大多只能经过稀疏降采样或复杂辐射传输方程后被间接使用,大部分细粒度观测特征在同化阶段便已被平滑丢弃。AI 气象模型如果无法直连高频物理观测,就永远只能在传统 NWP 划定的天花板下徘徊。

Model overview

多模态架构与跨分辨率网格设计

为了在保留全球动力学大尺度尺度的同时吃下不同维度、不同采样频率的高频观测,WeatherNext 3 在整体架构上采用了高度解耦的编码-处理-解码(Encode-Process-Decode)范式,底座延续了基于二十面体网格的 Mesh Transformer 体系,并大幅扩展了模型容量。

WN3 的隐空间维度从上一代的 768 扩大至 1024,核心处理器中的 Mesh Transformer 深度提升至 32 层。在多模态输入端,模型必须同时兼容几种完全不同的数据流:名义时间间隔为 6 小时的 0.25° 与 0.1° 分析场,延迟约为 5 小时;每小时更新一次、延迟不到 1 小时的 11 通道 0.1° 静止卫星镶嵌图像;以及非网格化、时间离散分布的稀疏地面气象站。

解决不同空间尺度冲突的核心,在于独立的编解码通路。WN3 为 0.25° 和 0.1° 等不同分辨率的输入输出数据设计了专门的网格映射算子,数据从各自的原生网格编码投射到统一的球形二十面体网格上。在网格处理器内部,动力学信息跨模态自由交互与演进,计算完成后再由特定的解码器映射回各自的原生分辨率空间。这种架构剥离了输入数据与内部动力学计算的物理网格绑定,避免了过去将所有模态粗暴重采样到单一网格带来的高频信息损失与人工伪影。

在时序机制上,上一代 WeatherNext 2 必须依赖一个独立的 $6\text{h} \rightarrow 1\text{h}$ 上采样外推模型来填补逐小时预报,这一级联设计容易引入误差累积。WN3 则在主模型中直接实现了原生逐小时输出。通过在单步解码中为不同变量分配特定的时间偏移通道(如相对于预报步长前移 1 到 5 小时的连续输出),模型能够在自回归推进大尺度场演化的同时,直接吐出原生逐小时分辨率的单层物理量,包括地表辐射、云量等关键新能源预测指标。

这一设计最直接的红利在于支持“逐小时滚动初始化”。当系统运行至某一时刻(例如世界时 14 UTC),最近的传统分析场可能仍停留在 06 UTC(加上 2 小时预报用于对齐至 08 UTC),但最新的静止卫星镶嵌数据已经更新到了 13 UTC。WN3 能够直接将 08 至 13 UTC 的连续卫星数据与落后的背景场对齐送入模型,通过自回归预测卫星通道的方式将高频对流信息向后外推,从而在短临阶段构建起极具时效性的强对流捕捉能力。

突破网格限制:连续时空隐空间查询与认知丢弃

在预测人类感受最直观的 2 米温度和露点温度时,传统气象预报普遍存在“网格代表性误差”。哪怕模型空间分辨率做到 0.1°,单个网格依然代表着约 100 平方公里的广阔区域。在地形复杂的山谷、海岸线或起伏丘陵中,网格内的平均海拔高度可能与具体地面站点的真实海拔相差数百米,导致网格直接输出的温度存在严重的系统性物理温差。传统业务往往在事后依靠气温垂直递减率或局部机器学习模型做后处理校正。

WeatherNext 3 选择在模型内部彻底打通这一环节,提出了针对离散观测的“站点输出头”(Station Output Head)。这一机制的本质是将天气预报转化为连续时空的函数查询任务:

在业务部署中,研究人员将这一站点头在全球范围内统一密集查询在 0.05°(约 5 公里)超精细网格上。这一机制使得模型在面对地形陡峭、下垫面剧烈变化的区域时,能够自适应地结合局部地形先验进行非线性垂直温度订正。面对全球地面观测站分布极不均匀、发展中国家和极地海洋存在大面积无站区的现实挑战,团队在训练中引入了随机采样的“伪站点”,用格点化分析场数值对无测站区域进行正则化填充,既消除了大范围冷门区域的伪影,又保留了真实测站上的精细化表征能力。

在不确定性量化方面,WN3 在集合预报机制上做出了兼顾效率与可靠性的关键调整。传统业务化集合预报依赖庞大的物理扰动或训练 4 个独立的模型种子(Seeds),算力开销巨大。WN3 将独立种子数量削减至 2 个,同时引入了针对认知不确定性(Epistemic Uncertainty)的“认知丢弃”(Epistemic Dropout)。

与传统将 Dropout 作为偶然不确定性扰动手段不同,WN3 将 Dropout 视为在指数级网络集合中进行采样。在训练阶段,同一个单步内所有的集合成员必须共享同一个 Dropout 掩码,迫使模型单次更新集中于某一个特定的子网络,而不会通过跨样本平均来取巧消除方差;在推理阶段,每个集合成员和每个自回归时间步则独立采样不同的 Dropout 掩码。这种设计人为扩大了模型在未见测试数据上的后验采样分布,有效弥补了以往大模型过度自信、集合发散度(Spread)随预报时效推移容易坍缩的通病。

降水与热带气旋的观测重构

降水一直是气象预报领域的难点所在。传统分析场中的降水并非来自直接观测,而是 NWP 积分过程中依靠积云对流参数化方案“诊断”计算出来的中间产物,导致分析场本身就充斥着虚警与对流延迟。

为了修正这一偏差,WeatherNext 3 引入了两种基于卫星遥感反演的全球 0.1° 逐小时降水真值作为训练目标。第一种是广为人知的 NASA IMERG 终期产品,它融合同步与极轨卫星的多波段微波反演数据;第二种则是内部开发的新一代实验性降水反演产品 PARDIG。PARDIG 训练专门的深度模型,利用空间尺度极高但轨道重访周期稀疏的 GPM 核心观测舱星载雷达数据作为锚点,将其反演能力迁移至连续时空的多卫星传感器上。地面雷达与雨量计的严格比对表明,直接以这类卫星遥感反演产品为目标训练的模型,在降水空间落区形态、对流核心强度捕捉上,远胜于以传统数值分析场为目标的基准模型。

针对热带气旋这一极端破坏性灾害,WN3 吸收了其专用气旋版本的技术积累,将 IBTrACS 全球台风最佳路径观测集直接引入多任务目标函数中。模型不再仅依靠大尺度气压场隐式推断风圈位置,而是显式设置气旋存在性、台风中心经纬度坐标、中心最低气压、最大持续风速 $V_{\text{max}}$ 以及 34/50/64 节不同风级半径的离散格点预测分支。通过先将台风路径观测线性插值至逐小时时间轴后再进行网格化计算,WN3 具备了在全自回归积分过程中,高频追踪台风精细眼墙演化与强度爆发式突变的能力。

全年基准评测与跨范式超越

为了全面验证这套复杂系统的业务有效性,研究团队设立了极其严苛的评估协议。模型在截止至 2023 年底的历史数据上完成多阶段渐进式课程学习(从 1° 粗分辨率逐步过渡至 0.25°,再解锁 0.1° 高分辨率及冻结微调站点头),并在完整的 2024 全年真实气象演进中进行了无信息穿越的全面盲测。基准对比覆盖了上一代顶尖 AI 模型 WeatherNext 2、欧洲中期天气预报中心(ECMWF)的业务物理集合预报系统 ENS,以及最新的 AI 集合预报系统 AIFS ENS。

在连续等级概率评分(CRPS)这一衡量集合概率预报的核心指标上,WN3 在分析场变量的对比中确立了全新标杆,相较于 WN2 取得了跨变量、跨预报时效的显著增益。更具说服力的是针对完全独立物理观测的实测检验。

在独立留出的 5% 地面观测站(包括全美 Mesonet 和全球 METAR 机场台站,模型在训练期间从未见过这些站点的任何历史数据)评估中,WN3 的站点头展现出惊人的泛化优势。得益于自适应海拔与下垫面元数据的隐空间融合,其 2 米温度和露点的预报均方根误差与 CRPS 均大幅领先于 ECMWF ENS。物理基准模型通常在复杂地形处由于海拔插值误差而产生数摄氏度的系统性漂移,而 WN3 即使不经过任何外部后处理微调,预测表现依然高度紧致,且在风速这一甚至未直接参与站点头训练的独立物理量上,同样通过动力耦合取得了卓越评分。

在针对高时空对流特征的降水评估中,团队利用美国本土 MRMS 地面多雷达系统与密集雨量计实测作为严苛法官。直接消化静止卫星观测并引入 PARDIG 训练的 WN3,在 6 小时累积降水各个等级的 Brier 评分与可靠性曲线上,全面击溃了传统仅靠分析场训练的 AI 模型。尤其是在 1 至 3 天的短临中程转换期,低延迟卫星通道的持续自回归输入使得对流系统的生消轨迹与移动速度被牢牢锁定,大幅减轻了传统数值集合预报中常见的“虚假分散”问题。而在台风路径预测上,WN3 的表现延续了其在 2025 年大西洋飓风季业务演练中的统治力,在长达 7 天的预报窗口内,路径误差相比物理动力学顶尖水准呈现出数天的领先优势。

迈向端到端地球系统建模

回顾 WeatherNext 3 的演进,其最具启示意义的突破不在于模型参数规模的扩大,而在于其对气象预测业务全生命周期范式的重构。

数十年来,现代数值天气预报建立在“三段式架构”的基石之上:先由复杂的四维变分或集合卡尔曼滤波进行海量多源数据同化,生成规则网格的初始分析态;再交由流体动力学与热力学物理引擎向前自回归推进数天至数周;最后依靠统计降尺度与模型输出统计(MOS)消除局地系统误差,将预测结果匹配到具体的人类活动区域。这套系统庞大、繁重且各个环节割裂,同化过程中的线性化近似与网格截断,不可逆地削弱了高频非结构化物理观测的信噪比。

WeatherNext 3 证明了一个完全端到端的数据驱动系统,不仅能承担起中长期大气环流方程的演进求解,还能以极低的时延直接从原始对流层顶卫星辐射亮温中提炼即时动力学特征,并一步到位将预测结果无缝投射到崇山峻岭间具体的某一个离散测站上。它跨越了传统意义上“同化模型”与“预报模型”的物理界限,向气象领域展示了原生多模态、跨尺度模型直接消化自然界原始信号的巨大潜能。

随着这一业务化系统的正式上线运行,全球高分辨率天气预报的研究范式正在被永久改写:未来的前沿竞争将不再局限于如何在纯净的网格重分析数据集上刷榜,而将聚焦于如何让深度模型作为感知与动力学的统一体,直接在真实物理世界混乱、嘈杂但极其丰富的多源观测洪流中,寻找大气演变的终极秩序。