새로운 AI 아키텍처를 통해 화성과 달의 로버가 지구와의 4~24분 왕복 통신을 기다리지 않고 무엇을 연구할지, 어떻게 이동할지를 스스로 결정할 수 있게 되어, 빠른 의사결정을 방해하는 지연 시간을 줄일 수 있게 됩니다. 제로 트러스트(zero-trust) 거버넌스 계층으로 감싸진 디시전 트랜스포머(decision-transformer) 모델을 기반으로 구축된 이 제안은 향후 행성 탐사 임무에 '과학자 수준'의 자율성을 약속합니다.

로버가 스스로 생각해야 하는 이유

오늘날의 로버는 본질적으로 원격 제어 자동차와 같습니다. 지구에서 보낸 명령이 대기열에 머무는 동안 로봇은 응답을 기다려야 하며, 예상치 못한 장애물이 나타나면 임무가 몇 시간 동안 중단될 수 있습니다.

AI의 돌파구: 디시전 트랜스포머

디시전 트랜스포머는 행동 선택을 언어 모델링 작업으로 전환합니다. 시행착오를 통해 배우는 대신, 모델은 과거 상태(위치, 센서 측정값)와 그에 따른 보상(과학적 가치, 안전 점수)의 시퀀스를 스캔하여 보상을 극대화할 수 있는 다음 행동을 예측합니다. 사실상 AI가 지금까지 전개된 이야기의 흐름을 바탕으로 이야기의 가장 적절한 다음 문장을 '쓰는' 것과 같습니다.

우주 환경에 안전한 AI 만들기

설계에는 두 가지 안전장치가 내장되어 있습니다:

  • 인간 정렬 목표(Human-aligned objectives) – 연구팀은 과학적 성과 극대화(예: 가장 흥미로운 암석 선택), 위험 회피(가파른 경사, 전력 손실), 임무 제약 조건 준수(시간, 데이터 대역폭)라는 세 가지 핵심 목표 사이의 균형을 맞추도록 모델을 학습시킵니다. AI는 정해진 범위를 벗어나지 않으며, 모든 선택은 인간이 정의한 우선순위에 따라 가중치가 부여됩니다.

  • 제로 트러스트 거버넌스(Zero-trust governance) – 사이버 보안에서 차용한 이 프레임워크는 로버의 두뇌가 해킹당하거나 단순히 오작동할 수 있다고 가정합니다. 엔지니어는 모든 결정을 변경 불가능한 감사 추적(audit trail)에 기록하며, AI에게는 행동에 필요한 최소한의 권한(최소 권한 원칙)만 부여합니다.

이러한 계층들이 결합되어 로버는 지휘 체계를 투명하고 가역적으로 유지하면서도 자율적으로 행동할 수 있습니다.

수혜 대상

화성 샘플 귀환(Mars Sample Return)이나 달 극지 탐사와 같은 미래 임무에는 이러한 수준의 자율성이 필요합니다. 트랜스포머 모델을 엄격한 보안 프로토콜과 결합함으로써, 우리는 태양계 더 깊은 곳을 탐사할 수 있습니다.

숨겨진 위험

자율성은 위험의 양상을 변화시키며, 제로 트러스트 계층은 모든 움직임을 검증기를 거치게 함으로써 이러한 위험을 완화합니다.

향후 계획

이 접근 방식은 행성 지질 조사 임무를 위한 방법을 제안하는 저자의 연구에 등장합니다.

핵심 요약: 의사결정을 언어 문제로 다루도록 로버를 학습시키고, 그 능력을 엄격한 감사 우선 보안 모델로 감싸는 방식을 통해, 엔지니어들은 지구와의 통신이 닿지 않는 상황에서도 스스로의 판단에 따라 과학적 탐구를 수행할 수 있는 로봇을 향해 나아가고 있습니다.