[論文レビュー] Noise-Robust End-to-End Quantum Control using Deep Autoregressive Policy Networks
本稿では、深層自己回帰的方策ネットワークを用いて連続的なゲート持続時間と離散的なユニタリーサイクルを同時に最適化することで、ノイズに強いエンドツーエンドの量子制御フレームワークであるRL-QAOAを提案する。ポキシマル・ポリシー最適化(PPO)と連続的・離散的アクション空間を組み合わせることで、古典的および量子的ノイズ下において非可積分な量子イジング模型の基底状態を効果的に準備する。本手法は、複数のノイズモデルにおいて、先行研究のPG-QAOAおよびCD-QAOAを上回る性能を発揮する。
Variational quantum eigensolvers have recently received increased attention, as they enable the use of quantum computing devices to find solutions to complex problems, such as the ground energy and ground state of strongly-correlated quantum many-body systems. In many applications, it is the optimization of both continuous and discrete parameters that poses a formidable challenge. Using reinforcement learning (RL), we present a hybrid policy gradient algorithm capable of simultaneously optimizing continuous and discrete degrees of freedom in an uncertainty-resilient way. The hybrid policy is modeled by a deep autoregressive neural network to capture causality. We employ the algorithm to prepare the ground state of the nonintegrable quantum Ising model in a unitary process, parametrized by a generalized quantum approximate optimization ansatz: the RL agent solves the discrete combinatorial problem of constructing the optimal sequences of unitaries out of a predefined set and, at the same time, it optimizes the continuous durations for which these unitaries are applied. We demonstrate the noise-robust features of the agent by considering three sources of uncertainty: classical and quantum measurement noise, and errors in the control unitary durations. Our work exhibits the beneficial synergy between reinforcement learning and quantum control.
研究の動機と目的
- 量子制御プロトコルにおける連続的および離散的パラメータを同時に最適化する統合的強化学習フレームワークの開発。
- NISQデバイスに一般的に見られる古典的測定ノイズ、量子的測定ノイズ、ゲート持続時間の誤差といった複数のノイズ源に対する耐性の向上。
- 既存のQAOAベースの手法を拡張し、1つの微分可能な方策内でユニタリーサイクルの順序とゲート持続時間をエンドツーエンドで最適化可能にする。
- 実際のノイズ条件下で、非可積分な量子イジング鎖の基底状態を効率的に準備する手法の有効性を実証すること。
提案手法
- 本手法は、順次的量子制御プロトコルにおけるアクション間の因果的依存関係を捉えるために、ハイブリッド方策をモデル化するための深層自己回帰的ニューラルネットワークを採用する。
- 方策は、連続的および離散的アクション空間に適応した、変更を加えたプロキシマル・ポリシー最適化(PPO)アルゴリズムを用いて訓練される。
- 連続的アクションは、有界なゲート持続時間を保証するため、コンパクトにサポートされたベータ分布でパrameter化される。
- 離散的アクションは、事前に定義されたユニタリーセットからユニタリーを選択するもので、シーケンス順序がエンドツーエンドで最適化される。
- アルゴリズムは、可変なユニタリーオペレーションシーケンスと最適化された持続時間を許容する一般化されたQAOAアーキテクチャに適用される。
- ノイズ耐性は、3つの不確実性モデル—古典的測定ノイズ、量子的測定ノイズ、ゲート持続時間の確率的誤差—の下で評価される。
実験結果
リサーチクエスチョン
- RQ11つの強化学習エージェントが、量子制御における連続的ゲート持続時間と離散的ユニタリーサイクルの両方を効果的に最適化できるか?
- RQ2提案されたハイブリッド方策ネットワークは、NISQデバイスに一般的に見られる現実的なノイズ源において、どの程度の性能を示すか?
- RQ3方策の自己回帰的構造は、時間的因果関係のモデリングを改善し、量子制御における収束性を向上させるか?
- RQ4ノイズ下での耐性および性能において、RL-QAOAはPG-QAOAおよびCD-QAOAに比べて優れているか?
- RQ5本手法は、アーキテクチャの再設計なしに、可変長の制御シーケンスへ一般化可能か?
主な発見
- RL-QAOAは、非可積分な量子イジング模型の基底状態を、非常に非断熱的領域において効果的に準備でき、全テストノイズモデルにおいてPG-QAOAおよびCD-QAOAを上回る性能を発揮した。
- 本手法はノイズに無関係な耐性を示し、物理的ノイズ源が古典的測定ノイズ、量子的測定ノイズ、またはゲート持続時間の誤差であるかにかかわらず、高い性能を維持した。
- 深層自己回帰的方策ネットワークは、時間的因果関係を効果的にモデリングし、順次的量子制御プロトコルの安定的かつ効率的な最適化を可能にした。
- ハイブリッドPPOベースの訓練フレームワークにより、連続的および離散的アクション空間の両方を考慮した安定した学習が実現され、ノイズ環境下における従来の勾配ベース最適化手法の限界を克服した。
- 合計プロトコル持続時間が固定でない場合でも、アルゴリズムは効果を発揮した。これは、'停止'アクションの導入により可変長シーケンスが可能になったためである。
- 数値シミュレーションにより、RL-QAOAが、すべての検討されたノイズ条件下でベースライン手法よりも高い基底状態の忠実度を達成することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。