Skip to main content
QUICK REVIEW

[논문 리뷰] Constrained Contextual Bandit Learning for Adaptive Radar Waveform Selection

Charles E. Thornton, R. Michael Buehrer|arXiv (Cornell University)|2021. 03. 09.
Radar Systems and Signal Processing참고 문헌 55인용 수 31
한 줄 요약

이 논문은 적응형 레이더 웨이브폼 선택을 제약 조건이 있는 선형 연속적 밴딧 문제로 공식화하여, 동적 환경에서 샘플 효율적이고 온라인 학습이 가능하도록 한다. 스펙트럼 감지와 수신기 피드백을 통합함으로써, 톰슨 샘플링과 EXP3 알고리즘을 사용하여 시간에 따라 변화하는 웨이브폼 왜곡 제약 조건을 통해 목표 탐지 성능을 향상시키고 도플러 사이드로브를 감소시킨다. 이는 공존 및 조작 환경에서 고정형 및 단순 적응형 레이더보다 뛰어난 성능을 발휘한다.

ABSTRACT

A sequential decision process in which an adaptive radar system repeatedly interacts with a finite-state target channel is studied. The radar is capable of passively sensing the spectrum at regular intervals, which provides side information for the waveform selection process. The radar transmitter uses the sequence of spectrum observations as well as feedback from a collocated receiver to select waveforms which accurately estimate target parameters. It is shown that the waveform selection problem can be effectively addressed using a linear contextual bandit formulation in a manner that is both computationally feasible and sample efficient. Stochastic and adversarial linear contextual bandit models are introduced, allowing the radar to achieve effective performance in broad classes of physical environments. Simulations in a radar-communication coexistence scenario, as well as in an adversarial radar-jammer scenario, demonstrate that the proposed formulation provides a substantial improvement in target detection performance when Thompson Sampling and EXP3 algorithms are used to drive the waveform selection process. Further, it is shown that the harmful impacts of pulse-agile behavior on coherently processed radar data can be mitigated by adopting a time-varying constraint on the radar's waveform catalog.

연구 동기 및 목표

  • 제한된 사전 지식이 있는 간섭 제한된 동적 환경에서 실시간으로 적응형 레이더 웨이브폼 선택 문제를 해결하기 위해.
  • 레이더 웨이브폼 적응을 위한 계산적으로 실현 가능하고 샘플 효율적인 온라인 학습 프레임워크를 개발하기 위해.
  • 펄스 유연한 웨이브폼 선택에서 발생하는 해로운 도플러 사이드로브 영향을 시간에 따라 변화하는 왜곡 제약 조건을 통해 완화하기 위해.
  • 스토케스틱 및 악성 환경 모두에서 견고한 성능을 확보하기 위해, 레이더-조작 및 레이더-셀룰러 공존 시나리오를 포함한 환경에서의 성능을 향상시키기 위해.
  • 레이더 추적 시스템과 온라인 학습을 통합하여 전체 감지 성능을 향상시키기 위해.

제안 방법

  • 스펙트럼 관측을 컨텍스트로, 수신기 피드백을 보상으로 사용하여 레이더 웨이브폼 선택을 선형 연속적 밴딧 문제로 공식화한다.
  • 연속적인 웨이브폼 간의 왜곡 지표를 기반으로 시간에 따라 변화하는 웨이브폼 전이 제약 조건을 도입하여 도플러 사이드로브를 감소시킨다.
  • 스토케스틱 및 악성 환경 모두에서 불확실성 하에 있는 온라인 의사결정을 위해 톰슨 샘플링과 EXP3 알고리즘을 활용한다.
  • 선형 보상 모델을 사용하여 기대 보상이 스펙트럼 감지와 목표 채널 상태를 통합한 컨텍스트 벡터에 의존하도록 한다.
  • 온라인 학습 이론에서 유도된 리그레트 경계를 적용하여 베이지안 및 빈도주의 가정 하에 성능를 보장한다.
  • 학습된 웨이브폼 정책을 칼만 추적기와 통합하여 거리 및 도플러 추정 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1제한된 피드백과 동적 간섭 조건 하에서 연속적 밴딧 프레임워크가 적응형 레이더 웨이브폼 선택을 효과적으로 모델링할 수 있는가?
  • RQ2시간에 따라 변화하는 웨이브폼 왜곡 제약 조건을 통합할 경우 도플러 사이드로브 수준과 탐지 성능에 어떤 영향을 미치는가?
  • RQ3톰슨 샘플링과 EXP3를 사용한 온라인 학습이 공존 및 조작 시나리오에서 고정형 또는 단순 적응형 레이더보다 어떤 성능 향상을 제공하는가?
  • RQ4제안된 알고리즘의 이론적 리그레트 경계는 컨텍스트 차원과 시간 수평선에 따라 어떻게 스케일링되는가?
  • RQ5제약 조건이 있는 연속적 밴딧 모델이 실세계 레이더 구현에서 추적 정확도 향상에 얼마나 기여하는가?

주요 결과

  • 제약 조건이 없는 경우, 제약 조건이 있는 EXP3 알고리즘이 평균 비용을 0.1 이하로 낮추었으며, 목표 피크를 더 두드러지게 하고 사이드로브를 낮추어 탐지 성능을 향상시켰다.
  • 왜곡 제약 조건이 ˆd=0.2일 경우, 도플러 사이드로브 수준이 크게 감소하였고, 실제 목표 피크가 거리-도플러 이미지에서 명확하게 확인되었다.
  • 제약 조건이 있는 EXP3 알고리즘이 제약 조건이 없는 변형보다 더 낮은 추적 RMSE를 기록하여, 거리 및 도플러 추정 정확도 향상을 입증하였다.
  • 왜곡 제약 조건을 적용한 톰슨 샘플링도 탐지 성능을 향상시켜 악성 조건에서도 견고함을 입증하였다.
  • 제안된 프레임워크는 레이더-셀룰러 공존 및 의도적인 조작 시나리오 모두에서 뛰어난 성능을 기록하였으며, 고정 대역폭 레이더 및 단순 적응형 기법보다 뛰어난 성능을 발휘하였다.
  • 톰슨 샘플링과 EXP3에 대한 이론적 리그레트 경계가 유도되었으며, 각각 적절한 가정 하에 O(√n log n) 및 O(√n) 스케일링을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.