
为什么Google要开源WeatherBench 2一文看懂全球AI天气预报模型的终极评测基准【免费下载链接】weatherbench2A benchmark for the next generation of>项目地址: https://gitcode.com/gh_mirrors/we/weatherbench2WeatherBench 2 是 Google 开源的下一代数据驱动全球 AI 天气预报模型评测基准为 Pangu-Weather、GraphCast 等新一代 AI 气象大模型提供统一的考场。它包含公开的云优化基准数据集、开源评测代码和官方排行榜让所有 AI 天气模型在同一标准下同台竞技。本文将带你快速看懂它的核心组成、评测方法和上手步骤。为什么 AI 天气预报需要一套统一考试标准过去两年Pangu-Weather、GraphCast、FuXi 等 AI 天气模型接连刷屏各家都宣称自己又快又准。但问题随之而来各家的评测数据、分辨率、变量、指标口径都不一致分数无法横向比较传统数值模式如 ECMWF 的 IFS缺乏公开、可复现的对比基准缺少像 ImageNet 之于 CV、MMLU 之于 NLP 那样的领域标准 benchmark。WeatherBench 2 正是为解决这个问题而生它由 Google 研究团队牵头联合多家机构的气象与 AI 专家共同构建目标是让模型好不好变成一道可复现、可对比、公开透明的数学题。WeatherBench 2 由什么组成整个框架可以拆成三大件全部公开可查公开数据集云优化Zarr 格式的标准答案和基线预报数据包括 ERA5 再分析、IFS 高分辨率预报、各大 AI 模型预报等完整清单见docs/source/data-guide.ipynb开源评测代码Python 编写的评测库与命令行脚本基于 Xarray-Beam 编写专为海量高分辨率文件的可扩展性设计核心代码位于weatherbench2/目录官方排行榜展示各最先进 AI 模型与传统物理模型的实时得分配套论文详述了评测设计的原理。三种分辨率 双轨评测考卷是如何设计的这是 WeatherBench 2 相比初代最重要的升级——多分辨率、多模式评测分辨率网格考察重点5.625°64x32快速迭代实验1.5°240x121官方论文主分辨率0.25°1440x721高分辨率精细结构评测分为两条轨道确定性评测以 RMSE 等误差指标对比 12~15 个关键变量温度、风、湿度、气压、降水、位势高度等并按全球、南北半球、热带、陆地区域分别统计区域选择逻辑在weatherbench2/regions.py中实现概率性评测基于集合预报评估 CRPS 等概率指标检验模型的不确定性表达此外还通过scripts/compute_zonal_energy_spectrum.py计算纬向能量谱专门检验模型能否再现风暴小尺度结构的物理真实性。所有官方评测命令都完整记录在docs/source/official-evaluation.md任何人可逐步复现排行榜分数。基线阵容从 ERA5 到 NeuralGCM 的全明星对比️基准内置了一整支陪练队伍覆盖两类参照系传统参照ERA5 再分析地面真值、气候态、持续性预报——模型必须跑赢什么都不做的基线才有资格上桌传统数值模式IFS HRES 高分辨率预报、IFS 集合预报ENSAI 大模型Keisler (2022)、Pangu-Weather含业务版、GraphCast含业务版、Spherical CNN、FuXi、NeuralGCM。各模型的预报数据与说明均可在docs/source/data-guide.ipynb中找到这也是新手理解 Zarr 数据结构的最佳教材。如何快速上手 WeatherBench 2⚡️安装只需两步git clone https://gitcode.com/gh_mirrors/we/weatherbench2 cd weatherbench2 pip install .评测的主入口是scripts/evaluate.py一条命令即可对预报数据与 ERA5 真值做区域化指标计算数据准备阶段还配套了重网格scripts/regrid.py、时间索引scripts/index_on_valid_time.py、切片scripts/slice_dataset.py等全套工具源码与评测逻辑分别在weatherbench2/regridding.py和weatherbench2/evaluation.py中。官方文档docs/source/下还有 Colab 可直接运行的快速上手 Notebook零基础也能跑通第一次评测。想让自己的模型上榜提交指南来了按照docs/source/submit.md的三步走即可标准化存储将预报保存为 Zarr 文件建议空间维度单块、时间维度小块便于并行重网格对齐用保守重网格把预报转到官方支持的分辨率5.625°、1.5° 或 0.25°运行评测并提交跑完scripts/evaluate.py后将预报数据或评测结果反馈给官方即可登上排行榜。写在最后WeatherBench 2 的意义不仅是一个 benchmark——它把AI 能不能真正预报天气从口号变成了可量化的科学问题。对研究者它是公平竞技场对从业者它提供了一整套工业级气象数据处理的开源参考实现。如果你想追踪全球 AI 天气模型的最新格局这个开源基准值得放进你的技术书单。【免费下载链接】weatherbench2A benchmark for the next generation of>项目地址: https://gitcode.com/gh_mirrors/we/weatherbench2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考