[論文レビュー] Constrained Contextual Bandit Learning for Adaptive Radar Waveform Selection
本稿は、動的環境におけるサンプル効率的でオンライン学習可能な状況を実現するため、適応レーダ波形選択を制約付き線形文脈バンディット問題として定式化する。スペクトラム監視と受信機フィードバックを統合することで、タイム・ヴァリエイティングな波形歪み制約を用いてドップラー sidelobe を低減し、Thompson Sampling および EXP3 アルゴリズムを用いて、共存およびジャミング状況において固定波形およびナイーブな適応レーダーを凌駕する目標検出性能を実現する。
A sequential decision process in which an adaptive radar system repeatedly interacts with a finite-state target channel is studied. The radar is capable of passively sensing the spectrum at regular intervals, which provides side information for the waveform selection process. The radar transmitter uses the sequence of spectrum observations as well as feedback from a collocated receiver to select waveforms which accurately estimate target parameters. It is shown that the waveform selection problem can be effectively addressed using a linear contextual bandit formulation in a manner that is both computationally feasible and sample efficient. Stochastic and adversarial linear contextual bandit models are introduced, allowing the radar to achieve effective performance in broad classes of physical environments. Simulations in a radar-communication coexistence scenario, as well as in an adversarial radar-jammer scenario, demonstrate that the proposed formulation provides a substantial improvement in target detection performance when Thompson Sampling and EXP3 algorithms are used to drive the waveform selection process. Further, it is shown that the harmful impacts of pulse-agile behavior on coherently processed radar data can be mitigated by adopting a time-varying constraint on the radar's waveform catalog.
研究の動機と目的
- 制限された事前知識のもとで、干渉制限環境および動的環境におけるリアルタイムで適応的なレーダ波形選択の課題に対処すること。
- レーダ波形適応のための計算的に実行可能でサンプル効率的なオンライン学習フレームワークを開発すること。
- 時間変動する歪み制約を用いて、パルス・グレージー波形選択に起因する有害なドップラー sidelobe 効果を軽減すること。
- レーダジャミングおよびレーダ・セルラー共存シナリオを含む、確率的および敵対的環境においても堅牢な性能を実現すること。
- オンライン学習をレーダトラッキングシステムと統合し、全体的なセンシング性能を向上させること。
提案手法
- スペクトラム観測を文脈、受信機フィードバックを報酬として用い、レーダ波形選択を線形文脈バンディット問題として定式化する。
- 連続する波形間の歪み指標に基づく時間変動する波形遷移制約を導入し、ドップラー sidelobe を低減する。
- 確率的および敵対的環境における不確実性下でのオンライン意思決定に、Thompson Sampling および EXP3 アルゴリズムを用いる。
- 文脈ベクトルとしてスペクトラム監視とターゲットチャネル状態を統合した線形報酬モデルを用いる。
- オンライン学習理論からのレジーットバウンドを適用し、ベイジアンおよび頻度主義の両仮定下で性能を保証する。
- 学習された波形ポリシーをカルマントラッカーと統合し、距離およびドップラー推定の精度を向上させる。
実験結果
リサーチクエスチョン
- RQ1限られたフィードバックと動的干渉下で、文脈バンディットフレームワークが適応レーダ波形選択を効果的にモデル化できるか?
- RQ2時間変動する波形歪み制約を組み込むことで、ドップラー sidelobe 水平および検出性能にどのような影響を与えるか?
- RQ3Thompson Sampling および EXP3 を用いたオンライン学習は、共存およびジャミング状況において、固定帯域幅レーダーやナイーブな適応レーダーに比べてどの程度の性能向上をもたらすか?
- RQ4提案されたアルゴリズムの理論的レジーットバウンドは、文脈次元および時間の長さに応じてどのようにスケーリングされるか?
- RQ5制約付き文脈バンディットモデルは、実世界のレーダ展開において、トラッキング精度をどの程度向上できるか?
主な発見
- 制約付き EXP3 アルゴリズムは、制約なしの場合に平均コストを 0.1 未満に抑え、ターゲットピークをより顕著に、 sidelobe を低くすることで検出性能を向上させた。
- 歪み制約 ˆd=0.2 の場合、ドップラー sidelobe 水平が顕著に低減され、距離-ドップラー画像において真のターゲットピークが明確に可視化された。
- 制約付き EXP3 アルゴリズムは、制約なしの変種よりも低いトラッキング RMSE を達成しており、距離およびドップラー推定の精度が向上していることを示している。
- 歪み制約を組み込んだ Thompson Sampling も検出性能を向上させ、悪条件下でも頑健性を示した。
- 提案されたフレームワークは、レーダ・セルラー共存および意図的なジャミングシナリオの両方で優れた性能を発揮し、固定帯域幅レーダーやナイーブな適応方式を上回った。
- Thompson Sampling および EXP3 の理論的レジーットバウンドが導出され、それぞれ適切な仮定下で O(√n log n) および O(√n) のスケーリングを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。