Die autonome Durchführung von Rendezvous- und Andockmanövern im Erdorbit gilt als Schlüsseltechnologie für die zukünftige Weltraumlogistik, das On-Orbit-Servicing und die Beseitigung von Weltraumschrott. Ein von Forschenden des Stanford Intelligent Systems Laboratory (SISL) entwickeltes Transformer-basiertes Modell, das "Out-of-this-World-Model" (OWM), demonstriert, wie datenbasierte World Models die traditionellen, stark regelbasierten Sensor- und Filterlösungen übertreffen können.

Warum autonome Andockmanöver im Orbit wichtig sind

Konventionelle Navigationssysteme in der Raumfahrt beruhen auf fest codierten physikalischen Gleichungen und Kalman-Filtern, die aus verrauschten Sensordaten die exakte Position schätzen. Diese Systeme stoßen bei extremen Lichtverhältnissen - etwa starken Reflexionen von Solarpaneelen oder plötzlichen Schattenwürfen - an ihre Grenzen, weil sie keine schnellen Videodaten verarbeiten können. Autonome, lernbasierte Modelle ermöglichen adaptive Reaktionen auf solche unvorhersehbaren optischen Einflüsse und erhöhen damit die Robustheit von Rendezvous-Operationen.

Das Out-of-this-World-Model (OWM) - Architektur und Methodik

Das OWM verwendet eine Transformer-Architektur, die klassische Flugdaten (Geschwindigkeit, Position, Neigungswinkel) mit den Videostreams der Bordkameras in einem gemeinsamen latenten Raum kombiniert. Im Gegensatz zu früheren World-Model-Ansätzen wie DreamerV3 setzt das OWM auf "One-Step Flow Matching". Dieser Ansatz prognostiziert die zeitliche Entwicklung relativer kinematischer Zustände und Bildsequenzen mit deutlich weniger trainierbaren Parametern und kann stochastische Dynamiken sowie Unsicherheiten im Zeitabschnitt direkt im latenten Raum quantifizieren.

One-Step Flow Matching vs. klassische Diffusionsmodelle

  • Reduziert die Anzahl der zu lernenden Parameter im Vergleich zu Standard-Diffusionsmodellen.
  • Ermöglicht die Vorhersage von Trajektorienunsicherheit in Echtzeit.
  • Verzichtet auf posteriore Korrekturverfahren, die bei DreamerV3 nötig sind.

Leistungskennzahlen des OWM im Vergleich zu Reinforcement Learning

Die Studie zeigt, dass das OWM für vergleichbare Aufgaben nur 500.000 Trainingsschritte benötigt, während ein klassisches PPO-Reinforcement-Learning-Modell 25 Millionen Schritte benötigt - ein Effizienzfaktor von 50-fach.

  • Trainingsschritte OWM: 500 000 (2026, Quelle S1)
  • Trainingsschritte PPO-Baseline: 25 000 000 (2026, Quelle S1)
  • Erfolgsquote beim Andocken an allen acht ISS-Kopplungsadaptern: 53 % (OWM) vs. 29 % (Baseline)
  • Erfolgsquote bei ungesehenen Zielports (Out-of-Distribution): 40 % (OWM) vs. 17 % (Baseline)
  • Anomalie-Erkennungsgenauigkeit bei unerwarteten Objekten: 98 % (OWM)

Simulationsumgebung AstroJAX - Beschleunigung der Trainingsdaten

Die Open-Source-Umgebung AstroJAX, basierend auf Googles JAX-Bibliothek, führt die astrodynamischen Differentialgleichungen vollständig parallelisiert auf modernen Grafikprozessoren aus. Dadurch können Zehntausende Flugbahn-Übergänge simultan berechnet werden, was die Generierung der für World Models erforderlichen Trajektoriendaten um ein Vielfaches schneller macht als in klassischen CPU-basierten Simulatoren.

  • Anzahl paralleler GPU-Zustandsübergänge: Zehntausende (2026, Quelle S1)
  • GPU-Beschleunigung ermöglicht die drastische Reduktion der Trainingszeit.

Ergebnisse der Tests an der ISS und bei unbekannten Zielports

In den Testreihen des OWM wurden die folgenden Erfolgsquoten ermittelt:

  • 53 % Erfolgsquote beim Andocken an allen acht ISS-Ports (gegenüber 29 % der RL-Baseline).
  • 40 % Erfolgsquote bei völlig unbekannten Zielports, während die Baseline nur 17 % erreichte.
  • 98 % Genauigkeit bei der Klassifizierung unerwarteter Hindernisse als Anomalien.

Die hohe Anomalie-Erkennungsrate zeigt, dass das OWM potenzielle Gefahren frühzeitig identifizieren kann, jedoch führt das sehr konservative Abbruchverhalten in der unmittelbaren "Keep-Out Zone" zu vielen vorzeitigen Manöverabbrüchen.

Wissenschaftliche Einbettung und Modellarchitektur

Die Arbeit wurde von Duncan Eddy, Isaac R. Ward, Grace Ra Kim und Mykel J. Kochenderfer am Stanford Intelligent Systems Laboratory (SISL) verfasst und auf der Advanced Maui Optical and Space Surveillance Technologies (AMOS) Conference 2026 vorgestellt. Die Veröffentlichung auf arXiv (Titel: "GPU-Accelerated Astrodynamics World Models for Spacecraft Rendezvous and Proximity Operations") stellt die vollständige Open-Source-Software AstroJAX der wissenschaftlichen Gemeinschaft zur Verfügung. Durch die Kombination von One-Step Flow Matching mit einer Transformer-Architektur wird erstmals die Unsicherheit von Trajektorien im latenten Raum mit einem minimalen Parameter-Footprint modelliert - ein technologischer Durchbruch, der bisherige World-Model-Ansätze im Weltraumbereich übertrifft.

Herausforderungen und Risikofaktoren

Trotz der beeindruckenden Kennzahlen weist die Studie auf zwei zentrale Schwachstellen hin:

  • Übervorsichtige Abbruchkriterien: Das Modell bricht Manöver häufig ab, sobald es die "Keep-Out Zone" der ISS erreicht, weil Kollisionen im Belohnungssystem stark bestraft werden. Eine 53 %ige Erfolgsquote reicht für reale Raumfahrtmissionen noch nicht aus.
  • Hardware-Restriktionen: Das Training und die Inferenz von Transformer-Modellen benötigen leistungsfähige GPUs. Weltraumtaugliche, strahlungsgehärtete Bordcomputer (Rad-Hard) liegen jedoch oft mehrere Generationen hinter moderner Standard-GPU-Hardware zurück.

Diese Punkte müssen adressiert werden, bevor autonome KI-Steuerungen in bemannten Missionen eingesetzt werden können.

Fazit

Das Out-of-this-World-Model demonstriert, dass Transformer-basierte World Models mit One-Step Flow Matching autonome Rendezvous- und Andockmanöver deutlich effizienter und genauer ausführen können als klassische Reinforcement-Learning-Ansätze. Die drastische Reduktion der benötigten Trainingsschritte (500 000 vs. 25 Millionen) und die hohe Anomalie-Erkennungsrate von 98 % markieren einen bedeutenden Fortschritt für die Weltraumlogistik. Gleichzeitig zeigen die restriktiven Abbruchkriterien und die aktuelle Diskrepanz zwischen benötigter GPU-Leistung und verfügbaren rad-hard Bordcomputern, dass weitere Forschung notwendig ist, um die Technologie für den produktiven Einsatz in realen Raumfahrtmissionen zu reifen.