Skip to main content
QUICK REVIEW

[論文レビュー] Unentangled quantum reinforcement learning agents in the OpenAI Gym

Jen-Yueh Hsiao, Yuxuan Du|arXiv (Cornell University)|Mar 27, 2022
Neural Networks and Reservoir Computing被引用数 15
ひとこと要約

本論文は、エンタングルゲートを含まない1キュービットのパラメータ化された回路を用いた変分量子回路(VQC)に基づく強化学習エージェントを提案する。このエージェントは、後処理用に古典的ニューラルネットワークと統合されており、CartPoleおよびAcrobotにおいて、古典的全結合ネットワークよりも収束が早く、より優れたサンプル効率を示した。また、実際のIBM量子ハードウェア上で検証された最初のLunarLanderにおける量子強化学習エージェントの成功した訓練を達成した。

ABSTRACT

Classical reinforcement learning (RL) has generated excellent results in different regions; however, its sample inefficiency remains a critical issue. In this paper, we provide concrete numerical evidence that the sample efficiency (the speed of convergence) of quantum RL could be better than that of classical RL, and for achieving comparable learning performance, quantum RL could use much (at least one order of magnitude) fewer trainable parameters than classical RL. Specifically, we employ the popular benchmarking environments of RL in the OpenAI Gym, and show that our quantum RL agent converges faster than classical fully-connected neural networks (FCNs) in the tasks of CartPole and Acrobot under the same optimization process. We also successfully train the first quantum RL agent that can complete the task of LunarLander in the OpenAI Gym. Our quantum RL agent only requires a single-qubit-based variational quantum circuit without entangling gates, followed by a classical neural network (NN) to post-process the measurement output. Finally, we could accomplish the aforementioned tasks on the real IBM quantum machines. To the best of our knowledge, none of the earlier quantum RL agents could do that.

研究の動機と目的

  • 大規模な状態・行動空間における古典的強化学習(RL)のサンプル非効率性を解消すること。
  • 量子RLエージェントが顕著に少ないトレーニング可能なパrameter数で、同等またはそれ以上の性能を達成できることを示すこと。
  • エンタングルゲートを必要とせず、NISQデバイスと互換性を持つスケーラブルな近道量子RLアーキテクチャを設計すること。
  • 最小限の量子回路と実際の量子ハードウェアを用いて、LunarLanderのような困難な環境での訓練に成功すること。
  • NISQ時代における強化学習におけるサンプル効率における量子優位性の実証的証拠を提供すること。

提案手法

  • エンタングルゲートを回避するため、パラメータ化されたパウリ回転を用いた1キュービットの変分量子回路(VQC)を特徴マップとして採用し、誤り率を低減する。
  • 量子回路の測定結果を処理するための古典的フィードフォワードニューラルネットワークを用い、ハイブリッド量子古典ポリシー・ネットワークを構築する。
  • 複数のOpenAI Gym環境において、量子RLエージェントのトレーニングにプロキシマルポリシー最適化(PPO)を適用する。
  • シミュレータおよび実際のIBM量子プロセッサ(例:ibmq_quito)の両方で量子回路を実装し、ハードウェアの実現可能性を検証する。
  • 微分可能な量子回路を用いて勾配ベースの最適化を実施し、勾配計算にパラメータシフト則を活用する。
  • 探索戦略を用いた報酬ベースのトレーニングループを採用し、連続的および離散的制御タスクにおける活用と探索のバランスを図る。

実験結果

リサーチクエスチョン

  • RQ1最小限の量子回路(1キュービット、エンタングルゲートなし)を備えた量子RLエージェントは、サンプル効率において古典的RLエージェントを上回ることができるか?
  • RQ2このような量子エージェントは、OpenAI Gym環境におけるLunarLanderのような困難な連続的制御タスクを効果的に解けるか?
  • RQ3同一の最適化設定下で、提案されたハイブリッド量子古典アーキテクチャは、古典的全結合ニューラルネットワークよりも収束が速いか?
  • RQ4提案された量子RLエージェントは、実際のノイジィな中規模量子(NISQ)ハードウェア上でトレーニング可能で安定性を示せるか?
  • RQ5量子RLと古典的RLの両者において、モデルの複雑さ(トレーニング可能なパラメータ数)と学習性能のトレードオフは何か?

主な発見

  • 同じ最適化プロセス下で、CartPoleおよびAcrobot環境において、量子RLエージェントは古典的全結合ニューラルネットワークよりも収束が速かった。
  • 同様の性能に到達するため、量子エージェントは古典的モデルに比べて少なくとも1桁の少ないトレーニング可能なパラメータ数を要した。
  • エンタングルゲートを含まない1キュービットのVQCを用いて、LunarLander環境における量子RLエージェントの最初の成功した訓練が達成された。
  • 量子エージェントは実際のIBM量子デバイス(ibmq_quitoを含む)に正常にデプロイされ実行され、ハードウェアの実現可能性が裏付けられた。
  • エンタングルゲートの欠如により、回路の深さと誤り率が顕著に低下し、NISQハードウェア上で信頼性の高い実行が可能になった。
  • ハイブリッドアーキテクチャ(VQCにfollowed by 古典的ニューラルネットワーク)は、測定結果の後処理およびポリシー最適化に有効であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。