Skip to main content
QUICK REVIEW

[論文レビュー] Towards on-sky adaptive optics control using reinforcement learning

Nousiainen, J., Rajani, C.|arXiv (Cornell University)|May 16, 2022
Adaptive optics and wavefront sensing被引用数 5
ひとこと要約

この論文は、波面誤差を低減するために動的モデルを学習し、ニューラルネットワークポリシーを最適化するモデルベース強化学習手法PO4AOを提案する。シミュレーションおよびMagAO-Xにおける実験で、標準の積分器制御に比べてコロナグラフのコントラストが3–5倍向上し、トレーニング時間は10秒未塔、推論時間は1ms未塔であり、超大型望遠鏡でのリアルタイム利用が可能である。

ABSTRACT

The direct imaging of potentially habitable Exoplanets is one prime science case for the next generation of high contrast imaging instruments on ground-based extremely large telescopes. To reach this demanding science goal, the instruments are equipped with eXtreme Adaptive Optics (XAO) systems which will control thousands of actuators at a framerate of kilohertz to several kilohertz. Most of the habitable exoplanets are located at small angular separations from their host stars, where the current XAO systems' control laws leave strong residuals.Current AO control strategies like static matrix-based wavefront reconstruction and integrator control suffer from temporal delay error and are sensitive to mis-registration, i.e., to dynamic variations of the control system geometry. We aim to produce control methods that cope with these limitations, provide a significantly improved AO correction and, therefore, reduce the residual flux in the coronagraphic point spread function. We extend previous work in Reinforcement Learning for AO. The improved method, called PO4AO, learns a dynamics model and optimizes a control neural network, called a policy. We introduce the method and study it through numerical simulations of XAO with Pyramid wavefront sensing for the 8-m and 40-m telescope aperture cases. We further implemented PO4AO and carried out experiments in a laboratory environment using MagAO-X at the Steward laboratory. PO4AO provides the desired performance by improving the coronagraphic contrast in numerical simulations by factors 3-5 within the control region of DM and Pyramid WFS, in simulation and in the laboratory. The presented method is also quick to train, i.e., on timescales of typically 5-10 seconds, and the inference time is sufficiently small (< ms) to be used in real-time control for XAO with currently available hardware even for extremely large telescopes.

研究の動機と目的

  • 時間遅れ誤差や誤登録への感受性といった、現在のアダプティブオプティクス(AO)制御手法の限界を解消し、高コントラストイメージング性能を向上させること。
  • コロナグラフのポイントスプレッド関数(PSF)における残存フラックスを低減するために、極限アダプティブオプティクス(XAO)システムにおける波面補正を改善すること。これは、微弱で居住可能な惑星を検出する上で不可欠である。
  • 動的システム変化(光学的利得効果、非線形波面センシングなど)に適応できるデータ駆動型で自己キャリブレーション可能な制御戦略を開発すること。
  • 10,000アクチュエータまで対応可能なスケーラブルなリアルタイム制御を実現し、効率的な推論と最小限のトレーニングデータを用いること。
  • 数値的シミュレーションおよびMagAO-Xにおける実験を用いて、現実の空でのAO制御に強化学習を適用可能であることを実証すること。

提案手法

  • PO4AOはモデルベースポリシー最適化を採用し、相互作用データからAOシステムの予測可能な動的モデルを学習する。
  • 波面センサの測定値と予測されたシステム状態に基づいて、制御指令を生成するための畳み込みニューラルネットワーク(CNN)ポリシーを用いる。
  • コロナグラフ後におけるPSF分散を最小化する報酬信号を用いてポリシーをトレーニングし、高コントラストイメージング性能を直接最適化する。
  • 主なイノベーションの一つは、標準的なGPUハードウェア上で300μs未塔の推論を可能にする浅いCNNアーキテクチャの採用である。これはリアルタイム制御に適している。
  • アルゴリズムは、5,000~10,000フレームの相互作用データのみを用いてエンドツーエンドでトレーニングされ、5~10秒で収束する。
  • データ分布のシフトに強く、運用中に大気的およびシステム的条件の変化に対しても適応可能である。

実験結果

リサーチクエスチョン

  • RQ1強化学習を用いて、従来の積分器ベースの手法に比べてコロナグラフのコントラストを向上させる制御ポリシーをトレーニングできるか?
  • RQ2モデルベースRLアプローチは、最大10,000アクチュエータを持つシステムにおいて、1ms未塔の推論時間でリアルタイム性能を達成できるか?
  • RQ3PO4AO手法は、未観測の大気条件や、誤登録や光学的利得効果などのシステム不整合に対してどれほど一般化できるか?
  • RQ4数秒以内にトレーニングが完了し、外部のチューニングなしに性能を維持できるか?これにより、即時使用可能なAO制御システムが実現可能か?
  • RQ5PO4AOのデータ駆動型特性により、運用中のシステムダイナミクス変化に自己キャリブレーションして適応できるか?

主な発見

  • 数値的シミュレーションにおいて、8メートルおよび40メートルの望遠鏡アパーチャーの両方で、PO4AOは標準の積分器コントローラーに比べてコロナグラフのコントラストを3–5倍向上させた。
  • MagAO-Xを用いた実験では、PO4AOは積分器に比べてコロナグラフ後PSFの時間的分散を3–5倍低減し、特に内側作動角領域におけるPSF分散の平均が顕著に低くなった。
  • わずか5~10秒のトレーニングデータで収束を達成し、最小限の相互作用からの迅速な学習を示した。
  • 現代のラップトップGPU上で推論時間は300μsであったため、現在のハードウェアでもELTスケールにおいてリアルタイム制御が可能であることが確認された。
  • 大気条件の変化など顕著なデータ分布のシフトに対しても、PO4AOは高い性能を維持し、現実世界の変動に強いことが示された。
  • 自己キャリブレーション行動を示し、手動での再チューニングの必要性を低減した。これは、完全に自動化された即時使用可能なAO運用の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。