Die Raumfahrt steht vor der Herausforderung, Navigationssysteme zu entwickeln, die trotz extremer Lichtverhältnisse und schneller Bilddaten zuverlässig funktionieren. Das von Forschenden des Stanford Intelligent Systems Laboratory (SISL) entwickelte Out-of-this-World-Model (OWM) bietet mit einer Transformer-basierten World-Model-Architektur einen neuartigen Ansatz, der klassische Kalman-Filter und herkömmliche Reinforcement-Learning-Methoden deutlich übertrifft.
Wissenschaftlicher Ursprung und methodische Details der OWM-Architektur
Die Forschungsarbeit "GPU-Accelerated Astrodynamics World Models for Spacecraft Rendezvous and Proximity Operations" wurde von Duncan Eddy, Isaac R. Ward, Grace Ra Kim und Mykel J. Kochenderfer am Stanford Intelligent Systems Laboratory verfasst und auf der AMOS Conference 2026 vorgestellt (arXiv:2609.03067, 2. September 2026). Die Methode kombiniert einen Transformer-Backbone mit einem One-Step Flow-Matching Head zur probabilistischen Zustandsschätzung und nutzt Model Predictive Path Integral (MPPI) Control für die eigentliche Steuerung. Durch den Flow-Matching-Ansatz werden rechenintensive Posterior-Korrekturen, die frühere Modelle wie DreamerV3 erforderten, ersetzt.
Kernelemente der Architektur
- Transformer-Backbone für die Verarbeitung von Kinematikdaten und Kamerabildern.
- One-Step Flow-Matching Head zur direkten Schätzung von Zustandsverteilungen.
- MPPI-Control für stochastische Pfadintegration und Triebwerkssteuerung.
Technische Funktionsweise des Out-of-this-World-Model (OWM)
Das OWM fusioniert kinematische Messwerte (Geschwindigkeit, Position, Neigungswinkel) mit Videostreams der Bordkameras in einem latenten Raum. Dort werden die Rohdaten zu kompakten Merkmalen reduziert, sodass das System simultan Bild- und Sensordaten auswerten kann. Auf Basis dieser komprimierten Repräsentation berechnet das Modell zahlreiche mögliche Zukunftspfade und wählt den wahrscheinlichsten und sichersten für die Triebwerkssteuerung aus.
Training in der GPU-beschleunigten Simulationsumgebung AstroJAX
Um die enormen Rechenanforderungen zu bewältigen, entwickelte das Team die Simulationsumgebung AstroJAX, die vollständig auf Grafikprozessoren (GPU) läuft. Durch AstroJAX konnten die Forschenden das OWM mit lediglich 500.000 Zeitschritten trainieren - im Vergleich zu 25 Millionen Durchläufen, die ein klassisches Reinforcement-Learning-System benötigt hätte.
Leistungsdaten und Vergleich zu klassischen Methoden
| Metric | OWM | Baseline RL | Einheit | Jahr |
|---|---|---|---|---|
| Erfolgsquote beim ISS-Andocken (alle Ports) | 53 | 29 | % | 2026 |
| Erfolgsquote an unbekannten Ports (OOD) | 40 | 17 | % | 2026 |
| Genauigkeit bei Anomalieerkennung | 98 | - | % | 2026 |
| Benötigte Trainingsschritte / Zustandsübergänge | 500 000 | 25 000 000 | - | 2026 |
Die Zahlen zeigen, dass das OWM nicht nur bei bekannten Andockports, sondern auch bei völlig neuen Zielstationen deutlich bessere Erfolgsquoten erzielt. Die Anomalieerkennung erreicht eine Trefferquote von 98 %.
Die Forschungsarbeit des Stanford Intelligent Systems Laboratory unter der Leitung von Duncan Eddy und Mykel J. Kochenderfer (Eddy et al., 2026) führt diesen Entwicklungsschritt methodisch auf eine Kopplung von Transformern mit sogenannten Flow-Matching-Heads zurück. Statt deterministischer Pfade berechnet das System kontinuierlich Wahrscheinlichkeitsverteilungen möglicher Folgezustände und steuert die Triebwerke über stochastische Pfadintegrale. Dieser Mechanismus erklärt auch die hohe Resilienz gegenüber unerwarteten Hindernissen: Als das Team eine bereits angedockte Kapsel als Blockade in die Simulation einfügte, erkannte das OWM die Störung mit 98-prozentiger Treffsicherheit als Anomalie und wich rechtzeitig aus.
Anwendungsfelder: On-Orbit Servicing und Active Debris Removal
Aufgrund der derzeitigen Erfolgsquote von 53 % wird das System nicht für bemannte Flüge eingesetzt. Stattdessen zielt die Raumfahrtbranche auf unbemannte Missionen, bei denen Kommunikationslatenzen ein autonomes Handeln erfordern:
- On-Orbit Servicing (OSAM): Inspektion, Betankung und Reparatur von Kommunikationssatelliten im geostationären Orbit.
- Active Debris Removal (ADR): Einfangen und Entsorgen von Weltraumschrott, um die Kollisionsgefahr zu reduzieren.
- Weitere mögliche Einsätze: autonome Satellitenwartungen, Trümmerbeseitigung und unkooperative Zielobjekte unter extremen Lichtbedingungen.
Der Verzicht auf menschliche Piloten spart Kommunikationslatenzen und ermöglicht schnelle Reaktionen auf sich ändernde Umgebungsbedingungen.
Herausforderungen und Sicherheitsrisiken
Obwohl das OWM in Simulationen überzeugende Ergebnisse liefert, gibt es kritische Punkte, die eine operative Nutzung noch verhindern:
- Ungenügende Zuverlässigkeit für operative Raumfahrtstandards: Eine Erfolgsquote von 53 % bedeutet, dass fast 47 % der Versuche fehlschlagen - weit unter den >99,9 %-Anforderungen der Raumfahrt.
- Übervorsichtiges Kollisionsvermeidungsverhalten: In den letzten Metern vor dem Andocken brechen die Algorithmen häufig ab, weil sie strikte Keep-Out-Zones einhalten.
- Sim-to-Real-Gap: AstroJAX simuliert Optik und Dynamik GPU-beschleunigt, jedoch können reale Effekte wie Mikrometeoritenschäden, Triebwerksabgas-Verwirbelungen oder Sensorrauschen das Modell destabilisieren.
Langfristig planen die Forschenden, die Software in Hardware-in-the-Loop-Prüfständen mit realer Flug-Avionik zu testen, um die Diskrepanz zwischen GPU-Simulation und den harten physikalischen Realitäten des Vakuums zu schließen.
FAQ zum Out-of-this-World-Model
Wer hat das System entwickelt und worauf basiert es genau?Das System wurde von einem Team um Duncan Eddy und Prof. Mykel Kochenderfer am Stanford Intelligent Systems Laboratory entwickelt und kombiniert Transformer-World-Models mit einem JAX-basierten GPU-Simulator namens AstroJAX.Warum scheitern klassische Navigationsfilter im Orbit?Klassische Kalman-Filter verarbeiten nur skalare Sensordaten (GPS, Sternentracker) und können keine schnellen Videodaten auswerten. Bildbasierte Verfahren werden durch extreme Lichtreflexionen und Schatten im All stark gestört.Wofür könnte OWM als Erstes in der Praxis eingesetzt werden?Am wahrscheinlichsten ist ein Einsatz bei unbemannten Satellitenwartungen (On-Orbit Servicing) oder beim Einfangen von Weltraumschrott, wo kein Menschenleben gefährdet ist und autonome Entscheidungen erforderlich sind.Fazit
Das Out-of-this-World-Model demonstriert, dass transformer-basierte World Models, unterstützt durch die GPU-Simulation AstroJAX, die Daten-effizienz und Robustheit von autonomen Rendezvous- und Andockmanövern erheblich steigern können. Die beeindruckenden Erfolgsquoten im Vergleich zu klassischen Reinforcement-Learning-Ansätzen und die fast perfekte Anomalieerkennung zeigen das Potenzial für zukünftige On-Orbit-Servicing- und Debris-Removal-Missionen. Gleichzeitig verdeutlichen die noch bestehenden Sicherheitslücken - insbesondere die niedrige Gesamterfolgsquote und das Sim-to-Real-Gap - dass das System derzeit noch als Machbarkeitsstudie zu werten ist. Weitere Tests in Hardware-in-the-Loop-Umgebungen und Optimierungen des Kollisionsverhaltens werden nötig sein, bevor das OWM in sicherheitskritischen Raumfahrtmissionen eingesetzt werden kann.