
从地球到火星AI天气大模型能不能“复用”过去两年AI 天气预测在地球上取得了超乎预期的进展。以 GraphCast、Pangu-Weather 为代表的 AI 基础模型把中期天气预报的准确率拉到了与传统数值模式相当甚至更优的水平而推理速度却快了数个量级。这类模型在气象领域的成功让很多人开始思考一个问题既然 AI 能从海量地球观测数据中学会大气演变规律那能不能用同样的思路去预测火星大气答案没有那么简单。火星的观测数据比地球少了几个数量级没有密集的全球站点网络也没有长期连续的高分辨率遥感资料从零训练一个天气基础模型几乎是奢望。而 MarsCast 这个研究方向切入的正是这个痛点通过迁移学习Transfer Learning把已经在地球上训练好的 AI 天气基础模型迁移到火星等行星大气场景从而绕开“数据不够”的死结。这篇文章的核心判断是行星大气预测的真正瓶颈不是网络结构设计而是数据规模与物理分布差异迁移学习是当前算力成本和数据条件下最现实的技术路径。如果你正在研究 AI 与气象、遥感的交叉方向或者对基础模型的跨域复用感兴趣这篇文章会拆解 MarsCast 这类方案背后的技术逻辑包括数据如何对齐、模型如何冻结与微调、验证指标怎么建立以及哪些地方容易踩坑。需要说明的是本文更偏向一个完整的工程技术路线梳理而不是某个具体版本的工具文档。因为行星大气迁移学习目前仍是前沿研究话题相关数据集、预训练权重、评测标准都在快速演进文章中不会给出一个“跑完就有精确结果”的固定脚本但会给出你完全可以照着落地的最小实验框架。1. 这篇文章真正要解决的问题先说一个反直觉的事实火星虽然离我们很远但人类对火星大气预测的需求比很多人想象中更具体、更迫切。火星探测任务进入火星大气时着陆器需要在极短时间内完成减速和着陆而火星大气密度只有地球的约 1%风速却经常超过 20 米/秒沙尘暴更是可以席卷全球。提前掌握那几天的风场、气压场和温度场直接关系到任务安全。与此同时火星科研任务对大气预报的需求也在增长巡视器需要知道扬尘概率飞行器例如火星直升机一类需要知道近地面风场轨道器遥感和数据反演也需要大气状态作为背景场。传统做法是用行星尺度的大气环流模式GCM来模拟火星大气比如著名的 Mars Climate Database。它的物理基础扎实但计算成本高、模式调参复杂而且对初始场敏感。如果在火星上部署一套类似地球业务预报的系统需要维持巨大的算力这在深空任务场景中很不现实。AI 天气基础模型在地球上的成功恰好提供了一个新思路这类模型本质上是在大量历史再分析数据上学习大气演化的统计规律然后在推理时用一个前向过程快速给出预测结果。地球上的成功让人不禁要问模型学习到的那些“流体运动规律”“时空演化模式”有多少是地球特有的又有多少是行星大气通用的火星的大气成分、重力、辐射条件和地球完全不同但它仍然是流体仍然遵循纳维-斯托克斯方程仍然有大气环流、急流、涡旋和季节变化。从物理机制上讲两个行星的大气存在大量可迁移的共性。这就是 MarsCast 这类工作存在的前提不是从零开始训练一个新的火星天气大模型而是把地球模型已经学到的通用表征迁移过去用火星上有限的观测数据做适配。2. 基础概念与核心原理AI 天气基础模型、迁移学习和行星大气的交叉点2.1 什么是 AI 天气基础模型AI 天气基础模型简单理解就是用大规模历史天气数据训练出来的深度学习模型输入是当前时刻的大气状态场输出是未来若干时刻的大气状态场。典型代表包括基于图神经网络的 GraphCast以及基于 Transformer 的 Pangu-Weather。它们有两个共同特征训练数据是网格化的再分析资料例如 ERA5时空分辨率通常为 0.25 度、逐小时或逐 3 小时。模型结构是 Encoder-Processor-Decoder 或类似的时空序列架构能够在高维状态空间上学习大气演化的非线性映射。这类模型最大的贡献在于用少量数值计算资源实现了与传统数值模式相当的预报技巧尤其在中长期预报5 到 10 天上表现突出。2.2 什么是迁移学习为什么行星大气需要它迁移学习的核心思想是把在数据充足的源域Source Domain上学到的知识迁移到数据稀缺的目标域Target Domain。图像领域最常见的方式是用 ImageNet 预训练模型再在自己的小数据集上微调Fine-tuning。在 AI 天气基础模型迁移到行星大气时源域是地球大气目标域是火星大气。火星大气迁移学习的独特之处在于目标域数据极其稀疏没有几十年连续的全球观测。源域与目标域存在系统性分布差异不能直接用在源域训练好的模型做推理。目标域的验证数据本身也很稀缺评估精度需要特别小心。所以这里需要的不是普通的监督学习而是小样本条件下的迁移学习与领域自适应技术。2.3 为什么要用迁移学习而不是从零训练下表对比了从零训练和迁移学习在火星大气预测场景下的差异对比维度从零训练迁移学习所需数据量需要大量完整覆盖全球的长时间序列只需少量代表性样本算力成本高需要预训练全过程相对低以微调为主物理规律利用率靠数据自行发现复用源域模型的流体运动表征适配周期按周/月计算按时/天计算过拟合风险数据不足时极高通过冻结与正则化可控制适合场景长期科研数据积累充分工程落地快速起步从这些对比可以看到迁移学习的核心价值不是“提高模型上限”而是“在数据不足时把起点拉到足够高”。对于火星这种注定无法在短时间内获得大量高质量训练数据的场景迁移学习不是可选项而是最理性的技术路径。3. 为什么不能直接把地球模型“搬到”火星分布差异与物理边界很多初次接触这个方向的人会有一个疑问地球天气模型既然已经学会了大气运动规律直接拿火星数据喂进去不就行了吗实际上远没那么简单。只有理解了这些差异你才能设计合理的迁移方案。3.1 输入特征分布不一致地球天气模型输入的特征通常包括多个等压面层的位势高度、温度、风速分量、相对湿度、海平面气压等。但火星没有海洋没有水汽主导的云系地表气压极低而且主要大气成分是二氧化碳。湿度、海平面气压这些通道在火星上根本没有对应物。你需要决定哪些地球模型输入通道在火星上能找到对应特征哪些通道需要删除哪些需要替换火星特有的变量比如尘埃光学厚度、CO2 霜层覆盖要不要加进模型这些决策直接影响迁移的可行性。如果输入端差异太大模型的前几层学到的特征几乎无法复用。3.2 数据分布和物理参数不一样地球与火星的关键物理参数存在数量级差异物理量地球火星表面重力加速度9.8 m/s²3.7 m/s²平均表面气压约 1013 hPa约 6 hPa主要大气成分氮气、氧气二氧化碳表面温度范围约 -89°C 至 57°C约 -140°C 至 20°C一天时长24 小时约 24.6 小时沙尘天气局部、短时全球性、季节性强这些参数不是简单的常数替换问题它们会影响大气环流的结构、温度递减率、波动传播速度等一系列特征。即使模型结构不变模型内部学到的统计关系也无法直接移植必须通过微调让模型重新校准。3.3 尺度与时间分辨率不匹配地球天气模型的设计尺度是基于地球的罗斯贝变形半径、急流宽度和天气系统尺度。火星大气的密度更低惯性重力波、斜压不稳定的尺度特征与地球有明显差异。如果直接将地球模型的分辨率设定应用到火星可能导致模型无法分辨关键过程。时间分辨率也需要调整。火星的一个太阳日比地球略长季节变化周期接近地球的两倍。训练时的时间步长和数据采样策略都要重新考虑否则模型学到的时间演化规律会出现系统偏差。3.4 输出目标与评估方式不同地球天气模型的预测目标通常是人关注的近地面温度和降水。火星上科研与任务部门更关心的是着陆区的大气密度随时间变化直接影响着陆减速。近地面风场尤其是沙尘暴前后的风场突变。大气温度垂直廓线用于遥感反演校正。沙尘光学厚度的演变。这些目标变量在地球天气模型中往往不是主输出因此输出头需要重新设计。这说明迁移学习不只是“加载权重继续训练”还涉及输入输出接口的重构。4. 数据准备与前置条件火星大气数据从哪来、怎么对齐在动手写模型之前最花时间的一步其实是数据准备。火星大气观测数据不像 ERA5 那样丰富需要使用公开可获取的数据集并做好预处理。4.1 可用的火星大气数据源目前学界常用的火星大气数据来源主要包括火星气候数据库Mars Climate Database, MCD基于 GCM 模拟产出提供温度、风场、气压等变量的气候态和逐日变化是迁移学习训练数据基座最现实的选择。火星全球探勘者MGS和火星奥德赛ODY等探测器获取的遥感反演资料覆盖率有限但提供了真实观测约束。火星再分析资料例如基于数据同化方法产生的再分析产品时空连续性优于纯观测但生成原理与地球再分析资料类似质量依赖同化系统。注意不同数据集的空间分辨率、垂直层次和时间覆盖差异很大。你需要先确定一个统一的目标网格例如 5.625 度或 2.8125 度的等经纬网格再把所有数据插值到同一网格上。4.2 输入输出变量映射假设你要迁移的预训练模型输入张量形状是(seq_len, channels, lat, lon)那么在火星场景下建议的通道映射如下地球模型通道火星替代/对应通道说明500 hPa 位势高度特定气压面位势高度如 50 Pa、500 Pa火星气压面极低需要对应调整850 hPa 温度低层大气温度如 100 Pa关注行星边界层附近U/V 风场U/V 风场基本可以直接对应海平面气压表面气压火星表面气压变化显著直接对应相对湿度尘埃光学厚度或水冰云量用火星特有变量替代地表温度表面温度保留但分布差异极大如果你用的预训练模型不接受通道替换也可以采用“通道映射 权重复制”的方式保留与风场、温度相关的预训练权重把没有对应性的通道随机初始化。4.3 Dataset 类实现示例下面用 PyTorch 风格写一个最小示例演示如何构造火星天气数据的 Dataset。这个示例不需要真实数据代码核心是说明输入输出对齐思路。# 文件路径mars_dataset.py import numpy as np import torch from torch.utils.data import Dataset class MarsWeatherDataset(Dataset): def __init__(self, fields, input_seq_len8, output_seq_len8): fields: dict包含多个变量的网格序列形状为 (T, C, H, W) input_seq_len: 输入时间步数 output_seq_len: 预测时间步数 self.fields fields self.input_seq_len input_seq_len self.output_seq_len output_seq_len # 假设所有变量时间维一致 keys list(fields.keys()) self.T fields[keys[0]].shape[0] self.H fields[keys[0]].shape[2] self.W fields[keys[0]].shape[3] # 将多个变量按通道拼接 self.data np.concatenate([fields[k] for k in keys], axis1) self.data torch.from_numpy(self.data).float() def __len__(self): return self.T - self.input_seq_len - self.output_seq_len 1 def __getitem__(self, idx): x self.data[idx: idx self.input_seq_len] # (in_len, C, H, W) y self.data[idx self.input_seq_len: idx self.input_seq_len self.output_seq_len] return x, y这段代码把多个火星大气变量按通道拼接然后按照“前 N 步预测后 M 步”的方式切分样本。实际操作中你需要额外加上标准化、去趋势和随机采样逻辑但核心思路是让火星数据在结构上与地球预训练模型的输入保持一致。4.4 标准化与数据增强由于火星与地球数据的数值范围差异巨大标准化必须重新计算不能沿用地球模型的统计参数。建议按通道独立计算均值和标准差并保存下来用于推理时反标准化。火星数据量少数据增强策略也很有价值。例如纬度方向随机翻转但要考虑模型的物理对称性。时间方向小幅平移。加入高斯噪声模拟观测误差。这些增强方式在小样本迁移学习场景下可以显著提升泛化性。5. 迁移学习策略与训练流程冻结、微调与适配层当数据准备好了下一步是设计具体的迁移训练方案。这一步是整个 MarsCast 技术路线的核心因为它直接决定了模型的复用率和训练成本。5.1 三种可选的迁移策略在实践中你可以根据算力和数据规模选择不同的迁移方式第一冻结骨干网络只训练输出头。这种方式最保守适合数据量极少的场景。它的假设是预训练模型的 Encoder 已经学到了通用的空间特征提取能力火星与地球的低层特征在一定程度上可以共享。缺点是模型无法适应火星与地球的分布差异精度上限低。第二全参数微调。把预训练模型的所有参数都在火星数据上继续训练。这种方式适应性强但需要较多数据而且很容易在小数据集上过拟合。如果火星训练样本太少效果可能反而不如冻结方案。第三引入适配器模块。在预训练模型的中间层插入轻量级 Adapter例如 1x1 卷积或 MLP只训练这些新增模块冻结原始参数。这种方式既保持了一部分适应能力又不容易灾难性遗忘是目前跨域迁移中比较推荐的做法。5.2 推荐的分层微调策略从工程落地角度一个比较稳健的做法是用“冻结 适配器 输出头替换”的方式先跑通流程。如果验证集效果不错再尝试解冻部分高层编码器层进行小学习率微调。一旦发现验证误差上升立即回退到上一版权重。这种分阶段迁移策略可以最大程度避免“一上来就全量微调导致过拟合”的典型问题。5.3 训练核心代码示例下面给出一个基于 PyTorch 的迁移训练伪代码重点说明权重加载、冻结、适配器插入和训练循环。# 文件路径marscast_train.py import torch import torch.nn as nn from torch.optim import AdamW from torch.optim.lr_scheduler import CosineAnnealingLR def load_pretrained_weather_model(model_class, pretrained_path): 加载地球天气预训练模型并跳过形状不匹配的层 model model_class() state_dict torch.load(pretrained_path, map_locationcpu) # 假设模型结构相同仅输入输出通道数量可能不同 new_state_dict {k: v for k, v in state_dict.items() if v.shape model.state_dict()[k].shape} model.load_state_dict(new_state_dict, strictFalse) return model def add_adapter_layers(model, hidden_dim64): 在 Encoder 的每个 Block 后插入 Adapter。 这里以简单的瓶颈结构为例Linear(d) - Linear(d_hidden) - Linear(d) for name, module in model.named_modules(): if isinstance(module, nn.TransformerEncoderLayer): adapter nn.Sequential( nn.Linear(hidden_dim, 32), nn.GELU(), nn.Linear(32, hidden_dim), ) module.add_module(adapter, adapter) return model def freeze_parameters(model, freezeTrue): 按模块名冻结除 adapter 和输出头之外的参数 for name, param in model.named_parameters(): if adapter not in name and output_head not in name: param.requires_grad not freeze def train_marscast(model, train_loader, val_loader, epochs50): optimizer AdamW(filter(lambda p: p.requires_grad, model.parameters()), lr1e-4) scheduler CosineAnnealingLR(optimizer, T_maxepochs) criterion nn.MSELoss() for epoch in range(epochs): model.train() train_loss 0.0 for x, y in train_loader: optimizer.zero_grad() pred model(x) loss criterion(pred, y) loss.backward() optimizer.step() train_loss loss.item() * x.size(0) scheduler.step() val_loss evaluate(model, val_loader, criterion) print(fEpoch {epoch:02d} | train_loss: {train_loss / len(train_loader.dataset):.6f} | fval_loss: {val_loss:.6f}) def evaluate(model, loader, criterion): model.eval() total_loss 0.0 with torch.no_grad(): for x, y in loader: pred model(x) total_loss criterion(pred, y).item() * x.size(0) return total_loss / len(loader.dataset) if __name__ __main__: # 实际使用时替换为你的模型类和预训练路径 # model load_pretrained_weather_model(MyWeatherModel, earth_model.pt) # model add_adapter_layers(model) # freeze_parameters(model, freezeTrue) # train_marscast(model, train_loader, val_loader) print(MarsCast transfer training pipeline ready.)这段代码的核心逻辑是先加载地球预训练权重允许部分层缺失然后在 Transformer Encoder 层后面插入 Adapter冻结除了 Adapter 和输出头之外的参数最后进行训练。用这种方式你可以用不多的数据完成一次可复现的迁移实验。5.4 训练超参建议从经验上看迁移学习的超参与从零训练差异很大学习率应显著低于从零训练通常建议在 1e-5 到 5e-4 之间使用余弦退火或线性 warmup。批大小火星数据集小批大小不宜过大16 到 32 就足够。早停策略必须设置早停Early Stopping以验证集损失为指标防止过拟合。输入时间步长度火星天气系统的演变速度与地球不同建议通过实验比较 4 步、8 步、16 步的预测效果。6. 验证与评估迁移效果到底怎么看在迁移学习任务中评估比训练更容易被忽略但也更容易出问题。如果评估指标不合适你可能在误差图上看到一个“看似不错”的结果但实际上模型只是在输出气候平均态。6.1 评估指标体系常用的行星大气预报评估指标包括指标全称说明适用目标RMSE均方根误差衡量预测与真值整体偏差温度、风场MAE平均绝对误差对异常值不敏感表面气压ACC异常相关系数衡量空间分布形态的相似度位势高度场CRPS连续排序概率评分衡量概率预报质量集合预报Bias系统偏差衡量平均偏移温度、风速其中 ACC 特别重要因为它能区分“形态接近”和“数值接近”。在行星大气预测中我们最关心的往往不是精确到每个格点而是能否预测出高压脊和低压槽的移动。6.2 基准模型的设定为了让评估有说服力必须设置基准对比气候态平均Climatology直接用多年平均作为预测。持续法Persistence用当前时刻状态作为未来预测。数值模型输出例如 MCD 提供的模拟结果。如果迁移模型的得分还不如气候态平均说明训练策略需要重新调整。这种情况在数据太少时很容易发生。6.3 评估代码示例下面给出一个计算 RMSE 和 ACC 的简单实现帮助你快速评估预测效果。# 文件路径evaluate_metrics.py import numpy as np def compute_rmse(pred, truth): 计算每个通道的 RMSE忽略无效值 mask np.isfinite(truth) return np.sqrt(np.mean((pred[mask] - truth[mask]) ** 2)) def compute_acc(pred, truth, clim): 计算异常相关系数 ACC。 pred: 预测场 truth: 真实场 clim: 气候态场 pred_anom pred - clim truth_anom truth - clim mask np.isfinite(truth_anom) numerator np.sum(pred_anom[mask] * truth_anom[mask]) denominator np.sqrt(np.sum(pred_anom[mask] ** 2) * np.sum(truth_anom[mask] ** 2)) if denominator 0: return 0.0 return numerator / denominator def evaluate_all(pred, truth, clim): rmse_per_var {} acc_per_var {} for i in range(pred.shape[1]): # 按通道遍历 rmse_per_var[i] compute_rmse(pred[:, i], truth[:, i]) acc_per_var[i] compute_acc(pred[:, i], truth[:, i], clim[:, i]) return rmse_per_var, acc_per_var使用这段代码时需要先把预测结果通过反标准化还原到物理量纲再与真实场比较。如果只比较标准化后的数据RMSE 数值会失真不利于判断模型真实性能。6.4 如何判断训练是否成功一个可靠的判断标准是迁移微调后的模型在短临预报例如前 6 小时上的 RMSE 明显低于持续法在中期预报例如第 2 到第 5 个火星日上的 ACC 仍然保持较高水平。如果模型在所有预报时效上的技能都接近气候态有两种可能一是训练数据太少模型只能记住平均值二是时间采样策略有问题导致模型学不到有效的演化规律。7. 实际应用场景与局限哪些地方能落地哪些地方仍是科研迁移学习到火星大气并不是“万灵药”。能够落地的场景主要集中在数据相对充分、任务边界清晰的方向。7.1 可以落地的方向着陆区局地天气预报针对特定经纬度区域可以用着陆区历史数据加上全球场预报结果做局地降尺度。沙尘暴过程分析沙尘暴的生成和传播有一定统计规律迁移模型可以用于研究其空间形态演变。轨道器任务的短期背景场预测为遥感反演提供快速、低成本的大气状态估计。这些场景的共同点是预测时效不需要很长通常 1 到 10 个火星日即可而且对极端精度要求略低更看重整体趋势。7.2 难以适用的场景需要高精度垂直剖面的任务行星大气边界层内物理过程复杂纯数据驱动模型很难给出可靠的高分辨率垂直结构。极端事件的长期预测火星全球性沙尘暴的爆发具有混沌性目前连机理都没有完全弄清迁移学习也无能为力。对物理可解释性要求极高的场合如果工程师必须理解每个预测结果的物理原因纯黑箱模型会带来合规和信任问题。所以在工程实践中更推荐的做法是“AI 迁移模型 数值模式”的混合建模而不是让 AI 模型独自承担预报主责。8. 常见问题与排查方法在实际复现 MarsCast 类似项目时最容易遇到的几类问题如下问题现象可能原因排查方式解决方案训练 Loss 不下降学习率过大或过小打印梯度范数检查 loss 曲线调整学习率改用 warmup验证集效果反而变差过拟合对比训练集和验证集 RMSE增强正则、增加早停、冻结更多层加载预训练权重时报错输入输出通道数不一致打印模型与权重的 shape使用 strictFalse删除不匹配层预测结果整体偏离真实值标准化参数未正确反算检查保存的均值和标准差保存统一标准化状态文件模型只能输出气候平均态样本太少、数据过于平滑检查训练数据的方差增加时间差分特征减少输入步长显存不足输入序列太长或批大小太大监控显存占用降低序列长度、减小批大小、使用梯度累积火星数据与地球数据分辨率不同未做网格重采样检查数据 shape统一插值到目标网格预训练模型的物理量单位不一致数据未量纲对齐检查字段单位在标准化前做单位换算其中最容易踩的坑是把火星数据标准化后直接送入预训练模型却忽略了地球模型输入风场通常用的是分量形式u、v而火星数据可能是风速和风向。建议在数据预处理阶段使用 wind_components 一类的函数统一换算。9. 最佳实践与工程建议把 MarsCast 这类迁移学习项目做扎实不仅仅是训练一个模型那么简单。运行环境、数据管理、实验记录和版本控制同样重要。9.1 数据与实验版本管理火星大气数据来源多样处理流程复杂建议使用 DVC 或者简单的数据目录规范来管理data/ mcd/ raw/ processed/ observations/ raw/ processed/ experiments/ 001_frozen_adapter/ config.yaml train.log metrics.json checkpoints/ 002_unfreeze_layers/每一个实验对应一个目录目录内保存配置文件、日志、指标和模型权重。这样后续排查和复现时不会出现“不知道上次用什么参数训练”的问题。9.2 配置管理建议用 YAML 文件统一管理所有训练参数避免在代码里写死超参。下面是一个最小配置示例data: grid_size: 64 input_seq_len: 8 output_seq_len: 8 variables: [temperature, u_wind, v_wind, pressure, dust] model: pretrained_path: checkpoints/earth_weather_model.pt hidden_dim: 256 freeze_backbone: true use_adapter: true training: epochs: 100 batch_size: 16 lr: 2.0e-4 weight_decay: 1.0e-5 early_stopping_patience: 10 device: cuda evaluation: metrics: [rmse, mae, acc] baseline: [climatology, persistence]这种配置文件的好处是所有实验差异都在文件层面可比较而不用逐行读代码。9.3 安全边界与合规提醒在开展火星大气 AI 研究时需要注意几条边界使用公开数据源时确认其许可协议和引用要求。部分再分析产品要求论文引用指定文献。如果研究涉及探测器未公开的遥测数据必须确认数据授权范围不得使用未授权的内部分发数据。模型输出仅用于科学研究和任务辅助决策时应明确标注“AI 预测结果存在不确定性”避免在任务关键场景中误导决策。不要在未经验证的测试集上反复调参否则评估结果会被信息泄露污染。9.4 推理加速与部署如果要把模型部署到边缘设备例如火星探测器的星载计算机还需要考虑模型蒸馏把大模型压缩成小模型保留主要预报能力。量化使用 FP16 或 INT8 减少显存和能耗。时间序列推理缓存预测窗口重叠时缓存中间状态以减少重复计算。这些优化在 Earth 业务系统里已经很成熟到了行星任务场景它们不是可选优化而是硬性需求。10. 总结与后续学习方向回到最初的问题AI 天气基础模型到底能不能跨星球迁移从 MarsCast 这个研究方向给出的答案是可以但迁移的不是“天气结果”而是“学习大气演化规律的能力”。具体技术路径可以概括为四步用地球预训练模型作为起点做通道映射和数据对齐设计冻结与适配器的微调策略最后用 RMSE、ACC 等指标与气候态和持续法对比验证。如果你准备上手这个方向下一步可以这样推进先下载一份火星气候数据库输出把数据按你的目标网格处理成统一格式。找一个开源的 AI 天气模型代码库例如图神经网络或 Transformer 架构在本地用小规模数据跑通微调流程。从冻结骨干网络、只训练输出头的方案开始不要一上来就全量微调。把实验配置、数据版本、评估结果全部归档再开始系统性实验。火星大气预测是一个数据稀缺问题而迁移学习的本质就是对抗数据稀缺。这条路目前还有很多不确定性比如适配器结构怎么设计、时间步长怎么选择、极端沙尘暴如何建模但整个技术框架已经清晰。对于做 AI 工程的同学来说最大的启发或许是在垂直领域里与其永远从零搭模型不如学会把基础模型当作一种可以继承的“工程资产”区别只在于你做的是地球业务还是行星科研。