Skip to main content
QUICK REVIEW

[논문 리뷰] Towards on-sky adaptive optics control using reinforcement learning

Nousiainen, J., Rajani, C.|arXiv (Cornell University)|2022. 05. 16.
Adaptive optics and wavefront sensing인용 수 5
한 줄 요약

이 논문은 파동면 오차를 줄이기 위해 동역학 모델을 학습하고 신경망 정책를 최적화하는 모델 기반 강화학습 방법인 PO4AO를 제안한다. 시뮬레이션과 MagAO-X에서의 실험실 실험 모두에서 표준 적분기 제어보다 3–5배 더 높은 코로나그래픽 대비를 달성하며, 학습 시간은 10초 이내, 추론 시간은 1ms 이내로, 초대형 망원경에서 실시간 사용이 가능하다.

ABSTRACT

The direct imaging of potentially habitable Exoplanets is one prime science case for the next generation of high contrast imaging instruments on ground-based extremely large telescopes. To reach this demanding science goal, the instruments are equipped with eXtreme Adaptive Optics (XAO) systems which will control thousands of actuators at a framerate of kilohertz to several kilohertz. Most of the habitable exoplanets are located at small angular separations from their host stars, where the current XAO systems' control laws leave strong residuals.Current AO control strategies like static matrix-based wavefront reconstruction and integrator control suffer from temporal delay error and are sensitive to mis-registration, i.e., to dynamic variations of the control system geometry. We aim to produce control methods that cope with these limitations, provide a significantly improved AO correction and, therefore, reduce the residual flux in the coronagraphic point spread function. We extend previous work in Reinforcement Learning for AO. The improved method, called PO4AO, learns a dynamics model and optimizes a control neural network, called a policy. We introduce the method and study it through numerical simulations of XAO with Pyramid wavefront sensing for the 8-m and 40-m telescope aperture cases. We further implemented PO4AO and carried out experiments in a laboratory environment using MagAO-X at the Steward laboratory. PO4AO provides the desired performance by improving the coronagraphic contrast in numerical simulations by factors 3-5 within the control region of DM and Pyramid WFS, in simulation and in the laboratory. The presented method is also quick to train, i.e., on timescales of typically 5-10 seconds, and the inference time is sufficiently small (< ms) to be used in real-time control for XAO with currently available hardware even for extremely large telescopes.

연구 동기 및 목표

  • 시간 지연 오차 및 잘못된 정렬에 대한 민감도 등의 현재 적응형 광학(AO) 제어 방법의 한계를 해결함으로써 고대비 이미징 성능을 향상시키기 위해.
  • 코로나그래프의 점원형 분포함수(PSF) 잔여 빛을 줄이기 위해 초대형 적응형 광학(XAO) 시스템에서 파동면 보정을 향상시키기 위해.
  • 수동 재조정 없이도 동적인 시스템 변화, 예를 들어 광학적 이득 효과와 비선형 파동면 센서와 같은 변화에 적응할 수 있는 데이터 기반, 자가 校정 제어 전략을 개발하기 위해.
  • 최대 10,000개의 액추에이터를 가진 초대형 망원경(ELTs)에 대해 효율적인 추론과 최소한의 학습 데이터를 사용해 실시간으로 확장 가능한 제어를 가능하게 하기 위해.
  • 수치 시뮬레이션과 MagAO-X에서의 실험실 실험을 통해 실시간 천체에서의 AO 제어에 대한 강화학습의 실현 가능성을 입증하기 위해.

제안 방법

  • PO4AO는 상호작용 데이터로부터 AO 시스템의 예측 동역학 모델을 학습하는 모델 기반 정책 최적화를 사용한다.
  • 파동면 센서 측정값과 예측된 시스템 상태를 바탕으로 제어 명령어를 생성하기 위해 컨볼루션 신경망(CNN) 정책을 사용한다.
  • 후코로나그래프 PSF 분산을 최소화하는 보상 신호를 기반으로 정책을 학습함으로써 고대비 이미징 성능을 직접 최적화한다.
  • 핵심 혁신은 실시간 제어에 적합한 표준 GPU 하드웨어에서 300μs 이내의 추론을 가능하게 하는 얕은 CNN 아키텍처의 사용이다.
  • 알고리즘은 단지 5,000~10,000 프레임의 상호작용 데이터만을 사용해 엔드 투 엔드로 학습되며, 5~10초 내에 수렴한다.
  • 데이터 분포 이탈에 강건하며, 운영 중 대기 및 시스템 조건의 변화에도 적응한다.

실험 결과

연구 질문

  • RQ1강화학습을 사용해 전통적인 적분기 기반 방법보다 코로나그래픽 대비 성능을 뛰어넘는 AO 제어 정책을 훈련시킬 수 있는가?
  • RQ2모델 기반 강화학습 접근법이 최대 10,000개의 액추에이터를 가진 시스템에서 1ms 이내의 추론 시간을 달성할 수 있는가?
  • RQ3PO4AO 방법은 예상치 못한 대기 조건과 정렬 오차, 예를 들어 잘못된 정렬 또는 광학적 이득 효과와 같은 시스템 오차에 대해 얼마나 잘 일반화되는가?
  • RQ4단 몇 초 내에 훈련이 가능하고 외부 조정 없이도 성능을 유지할 수 있는가? 이는 즉시 사용 가능한(AO) 제어 시스템을 가능하게 하는가?
  • RQ5PO4AO의 데이터 기반 성격은 현장 운영 중 시스템 동역학 변화에 자가 캘리브레이션하고 적응할 수 있는가?

주요 결과

  • 수치 시뮬레이션에서 8미터 및 40미터 망원경의 입구에서 PO4AO는 표준 적분기 제어기 대비 코로나그래픽 대비를 3–5배 향상시켰다.
  • MagAO-X 시스템을 사용한 실험실 실험에서 PO4AO는 적분기 대비 후코로나그래프 PSF의 시간적 분산을 3–5배 감소시켰으며, 내부 작업 각도 영역에서 PSF 분산의 반경 평균이 크게 낮아 보였다.
  • 단지 5–10초의 학습 데이터로도 수렴을 달성하여 극히 소량의 상호작용 데이터로부터 빠른 학습을 입증했다.
  • 현대 랩탑 GPU에서 추론 시간을 300μs로 측정하여 현재 하드웨어에서 실시간 제어의 실현 가능성을 확인했으며, 초대형 망원경 규모에서도 적용 가능했다.
  • 대기 조건 변화 등 심각한 데이터 분포 이탈 상황에서도 높은 성능를 유지하여 실제 환경의 변동성에 강건함을 입증했다.
  • 자기 캘리브레이션 행동을 보였으며, 수동 재조정이 필요한 정도를 줄였고, 완전히 자동화된 즉시 사용 가능한 AO 운영의 잠재력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.