一种全新的 AI 架构可以让火星和月球探测器自主决定研究内容和移动方式,而无需等待 4 到 24 分钟的地球往返通信时间,从而减少了目前阻碍快速决策的延迟。该方案基于决策 Transformer(decision-transformer)模型,并封装在零信任治理层中,有望为未来的行星探测任务提供“科学家级别”的自主性。

为什么探测器需要自主思考

如今的探测器本质上是远程操控的车。地球发出的指令在队列中等待,而机器人则在等待回复,任何突发障碍都可能导致任务停滞数小时。

AI 的突破:决策 Transformer

决策 Transformer 将动作选择转化为语言建模任务。该模型不再通过试错来学习,而是扫描一系列过去的状态(如位置、传感器读数)及其相关的奖励(如科学价值、安全评分),并预测能够实现奖励最大化的下一个动作。实际上,AI 是根据故事目前的展开情况,“编写”出故事的最佳下一行。

让 AI 在太空环境中保持安全

设计中内置了两项安全保障措施:

  • 与人类目标对齐 (Human-aligned objectives) —— 团队训练模型以平衡三个关键任务目标:最大化科学回报(例如,选择最有意思的岩石)、规避危险(陡坡、电力流失)以及遵守任务约束(时间、数据带宽)。AI 不会脱离预设轨道;每一个选择都会根据这些人类定义的优先级进行权衡。

  • 零信任治理 (Zero-trust governance) —— 借鉴自网络安全领域,该框架假设探测器的“大脑”可能会遭到破坏或仅仅是发生故障。工程师会将每一个决策记录在不可篡改的审计追踪中,并且仅授予 AI 执行任务所需的最小权限(最小特权原则)。

这些层级共同作用,使探测器能够在保持指挥链透明且可逆的同时,实现自主行动。

谁将从中受益

像火星采样返回(Mars Sample Return)或月球极地探测这样的未来任务都需要这种程度的自主性。通过将 Transformer 模型与严格的安全协议相结合,我们可以更深入地探索太阳系。

潜在风险

自主性重塑了风险,而零信任层通过强制要求每一个动作都经过验证器,从而缓解了这一风险。

下一步计划

该方法出现在作者的研究中,该研究为行星地质调查任务提出了一种新方法。

核心要点: 通过教导探测器将决策视为语言问题,并将这种能力封装在严格的“审计优先”安全模型中,工程师们正趋向于制造出即使在地球无法触及的情况下,也能按自己的方式开展科学研究的机器人。