轨道数据中心能否运行最大、最强大的大语言模型,目前仍存在广泛争议。但对于大语言模型在太空中的应用而言,动辄需要数千块GPU的大规模部署并非唯一出路。
NASA喷气推进实验室近期将谷歌Gemma 3送上太空,首次实现了视觉语言模型在轨分析卫星自身传感器所采集图像的功能。
该系统名为NAVI-Orbital,通过Gemma 3对Loft Orbital公司建造的YAM-9卫星所拍摄的图像进行分析。NASA技术小组负责人胡安·M·德尔法表示,尽管本次项目的目标是图像分析,但此次成功意味着地面研究人员与航天器的交互方式将发生根本性变革。
"这是一次重大转变,"德尔法说,"现在,科学家可以写一段提示词,上传到航天器,系统就会据此作出响应。这与以往的模式截然不同——以前研究人员必须编写高度结构化的指令,还需要专门的操作团队来处理。"
NAVI-Orbital的核心是一套智能体软件框架,由德尔法与其合著者——NASA喷气推进实验室AI研究员塔兰·西里亚克·约翰,以及Loft Orbital技术负责人安德鲁·W·赫尔森共同开发。该系统通过基于LangGraph的调度器协调各项操作,并部署谷歌Gemma 3 4B的4比特量化压缩版本(一款开放权重大语言模型),用于生成图像的纯文本描述。
在一个包含7960张图像的基准数据集测试中,NAVI-Orbital的图像分类准确率达到88%。值得注意的是,Gemma 3在完成分类时,既未针对该数据集进行训练,也未经过微调,使用的正是可从Hugging Face下载、在普通笔记本电脑上运行的基础模型。该基准测试在地面完成,旨在发射前对系统进行验证。
进入轨道后,NASA研究人员利用Loft公司YAM-9卫星上的摄像头进行了两次实时拍摄测试:一次覆盖法国图卢兹上空,另一次覆盖阿根廷沿海地区。除生成每张图像的文字描述外,NASA还向Gemma 3提出了一系列预设问题,例如图像中是否包含商业或住宅区,或是否呈现自然地貌特征。
图像分析全程在YAM-9卫星上完成。该卫星搭载了一个由多块抗辐射处理器(包括FPGA、CPU和GPU)组成的计算集群,可同时为多个用户载荷提供服务。卫星由太阳能电池板供电,根据卫星所处位置的不同,星载系统的功耗在150至500瓦之间。
在实时拍摄实验中,Gemma 3运行于英伟达Jetson Orin AGX模块上——这是一款常用于机器人和AI任务的小型计算模块。经过4比特量化的40亿参数模型仅需8GB内存,因此可以在Orin AGX这样的低功耗设备上流畅运行。"这充分说明了它有多轻量,你可以在一台极其微小的计算机上运行它,"德尔法说。
Loft Orbital总经理保罗·拉塞尔表示,具备视觉能力的大语言模型将为轨道操作带来"范式转变"。
与谍战电影里的场景不同,现实中大多数卫星并不能向地面观测者提供高速、高清晰度的图像和视频数据流。带宽往往十分有限,在大多数情况下,卫星只能根据运行轨道,在固定时间窗口内向地面站传输数据。
拉塞尔认为,AI模型可以通过"语义压缩"来解决这一问题。卫星不必传输大量原始图像数据,而是可以直接以文字形式汇报关键信息。
"链路速度快不快无所谓,因为你下行传输的是几十千字节的文本,而不是几十甚至几百兆字节的图像,"拉塞尔说,"这让你能够以战术化的方式使用卫星,而这在以前只存在于好莱坞电影里。"
德尔法以山火探测为例进行了说明。目前卫星已能探测到山火,但受下行带宽和数据处理能力的限制,结果返回往往存在长达90分钟的延迟。如果卫星能够在太空中直接分析图像,并以纯文本形式发出预警,这一延迟或将得到根本解决。
更快速的信息获取只是NAVI-Orbital所指向目标的一半。另一半,正是德尔法所强调的那次"重大转变"——NAVI-Orbital为与航天器交互提供了一种全新模式的概念验证。
当然,这并不意味着谷歌Gemma 3目前已在掌控一切。NAVI-Orbital被刻意隔离于飞行软件之外,只负责读取图像并生成描述。该系统具备决定图像分析方式的能力,但其权限仅限于此。
尽管如此,这套交互界面依然颇具新意。若要将系统重新调整为搜索其他类型目标(例如山火),只需修改一段文本提示词,无需重写和重新验证星载软件,也不必训练和部署新的AI模型(而这在以往的图像分类模型中往往是必要步骤)。
这项能力的长远愿景,远不止于无人卫星和图像处理。德尔法表示,NAVI项目的根源在于探索AI如何成为宇航员的伴侣。"我们想到,宇航员在穿着宇航服时手部灵活性受到很大限制,于是我们构想了让NAVI作为宇航员伴侣、通过自然语言实现交互的理念……这是我们明确希望推进的方向。"
要实现这一目标,还需要大量深入的研究,但NAVI-Orbital的演示已经证明,两个关键要素——将大语言模型部署至太空以及通过提示词对其进行控制——都是可行的。
Q&A
Q1:NAVI-Orbital系统是什么?它实现了什么突破?
A:NAVI-Orbital是NASA喷气推进实验室开发的一套智能体软件框架,基于谷歌Gemma 3大语言模型,首次实现了视觉语言模型在轨道上直接分析卫星拍摄图像的功能。它搭载在Loft Orbital的YAM-9卫星上,运行于英伟达Jetson Orin AGX计算模块,在基准测试中图像分类准确率达88%。这是视觉语言模型首次在轨运行并处理卫星自身传感器数据。
Q2:Gemma 3在太空中运行对硬件有什么要求?
A:NAVI-Orbital使用的是Gemma 3 4B模型的4比特量化压缩版本,参数量40亿,仅需8GB内存,可在英伟达Jetson Orin AGX这类低功耗小型计算模块上运行。YAM-9卫星由太阳能电池板供电,星载系统功耗在150至500瓦之间。这说明即使在太空中资源受限的环境下,轻量化的大语言模型也能实际部署运行。
Q3:NAVI-Orbital对卫星数据传输有什么实际意义?
A:当前卫星受带宽限制,只能在固定时间窗口传输数据,山火等紧急事件的预警延迟可长达90分钟。NAVI-Orbital通过"语义压缩"技术,让卫星在太空中直接分析图像并生成文字摘要,仅需下行传输几十千字节的文本,而非几十至几百兆字节的原始图像,从而大幅降低对带宽的依赖,实现更快速、更灵活的信息获取。
