2026 年 9 月 10 日,美国国家航空航天局(NASA)与 IBM 联合发布了一款开源月球研究大模型——NASA-IBM 月球基础大模型。这是一套用月球影像和探测数据训练出来的人工智能程序,可在 Hugging Face 平台免费下载,主要任务是从月面照片里识别可能存在冰的区域、给撞击坑分类。它也是全球首个配套开源数据集的月球专用大模型,是 NASA 在 2026 年春天阿尔忒弥斯 2 号完成载人绕月飞行后,为筹备后续登月任务准备的科研工具。

先补两个入门概念。**大模型(基础大模型)**是指用海量数据训练出来、能处理多种任务的人工智能程序,这套模型的专长是分析月面影像。开源意味着模型与数据公开,任何研究团队都能免费下载、使用和二次开发。Hugging Face 是全球最大的 AI 模型分享平台,相当于 AI 领域的「应用商店」。

两项对照测试:冰区识别误差低 23%

NASA 与 IBM 把新模型和微软的高分辨率图像视觉模型 SwinV2-B 做了对照测试。SwinV2-B 是图像分析任务中常用的基准模型,也就是用来衡量其他模型表现的参照物。

测试结果有两组数字。冰区识别方面,将模型预测与一张融合地形、温度等环境数据的月球地图比对,NASA-IBM 模型的识别误差比 SwinV2-B 低了 23%。撞击坑识别分类方面,新模型只用 SwinV2-B 一半的训练数据,性能就高出 19%。

2026 年 8 月 5 日,SpaceX 一枚猎鹰 9 号火箭撞击月球,研究团队借机做了真实场景验证:IBM 把撞击影像输入模型,模型一次就准确识别出撞击形成的新陨石坑,即使新坑与原有陨石坑大面积重叠。IBM 欧洲、英国及爱尔兰研究院院长胡安·贝尔纳韦-莫雷诺评价「效果非常出色」。

月球影像的训练难点

在月球上训练图像模型,比在地球难得多。地球遥感图像有大气散射阳光、环境光填充阴影,画质完好;月球没有大气,阴影边缘锐利、内部漆黑,阴影区域的像素不携带任何有效信息。同一个陨石坑在不同日照角度下看起来完全不一样。

常规训练逻辑也失效了。计算机视觉模型常用「破坏重建」法训练:抹掉图像的一部分,让模型凭学到的规律还原。但月球轨道照片里大量陨石坑外观高度相似,抹掉一个坑让模型还原,结果「完全失败」——这是 IBM 团队一开始用传统方式训练时得到的结论。

他们的解法是把月球像橙子一样切成多个扇形区块,训练集(教模型的样本)与测试集(验收模型的样本)完全分开,模型因此能在没见过的新区域上保持稳定表现。

配套开源数据集:超过 200 万个数据点

与模型一同发布的,是全球首个同类开源数据集。它整合了数万张影像与探测仪器数据,来源包括 NASA 月球勘测轨道飞行器(LRO)、重力恢复与内部实验室(GRAIL)任务,以及日本月亮女神号探测器(SELENE)。数据经过配准对齐——让影像里每一个像素都对应上温度、地形等其他维度的数据——形成超过 200 万个数据点。

贝尔纳韦-莫雷诺认为,过去没有功能全面的月球专用大模型,缺的不是模型技术,而是整理得当的配套数据。他的原话是:「AI 模型总会被更新的模型淘汰,但数据才是支撑 AI 模型持续发展的根基。」

对科研界来说,这次发布把月球 AI 研究的基础设施开源了:模型会随技术迭代过时,但配准好的数据集与经过验证的训练方法会持续服务后续研究。研究团队不必再从零收集整理数据,就能基于统一的数据集开发自己的月球 AI 模型。