Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning with Quantum Variational Circuits

Owen Lockwood, Mei Si|arXiv (Cornell University)|Aug 15, 2020
Quantum Computing Algorithms and Architecture参考文献 29被引用数 16
ひとこと要約

本稿では、深層強化学習を向上させるために量子変分回路(QVCs)の使用を提案し、Deep Q-Network(DQN)およびDouble DQNアルゴリズムにおける純粋な量子的およびハイブリッドな量子的手法を比較している。本稿では、スケーリングおよび方向性符号化という2つの新しい古典的から量子的へのデータ符号化方式を導入し、QVCsが、特にOpenAI GymのCartPoleおよびBlackjack環境において、顕著に少ないパラメータで古典的ニューラルネットワークと同等またはそれ以上の性能を達成できることを示している。

ABSTRACT

The development of quantum computational techniques has advanced greatly in recent years, parallel to the advancements in techniques for deep reinforcement learning. This work explores the potential for quantum computing to facilitate reinforcement learning problems. Quantum computing approaches offer important potential improvements in time and space complexity over traditional algorithms because of its ability to exploit the quantum phenomena of superposition and entanglement. Specifically, we investigate the use of quantum variational circuits, a form of quantum machine learning. We present our techniques for encoding classical data for a quantum variational circuit, we further explore pure and hybrid quantum algorithms for DQN and Double DQN. Our results indicate both hybrid and pure quantum variational circuit have the ability to solve reinforcement learning tasks with a smaller parameter space. These comparison are conducted with two OpenAI Gym environments: CartPole and Blackjack, The success of this work is indicative of a strong future relationship between quantum machine learning and deep reinforcement learning.

研究の動機と目的

  • 量子変分回路(QVCs)が、パラメータの複雑さを低減しつつ強化学習の性能を向上させられるかどうかを調査すること。
  • 強化学習の入力に適した新しい古典的から量子的へのデータ符号化技術の開発と評価。
  • DQNおよびDouble DQNフレームワークにおける純粋なQVCとハイブリッド量子-古典的モデルの比較。
  • QVCベースの強化学習の一般化可能性およびスケーラビリティを、CartPoleやBlackjackを含むさまざまな環境で評価すること。
  • 最小限のパラメータ空間で非自明な強化学習タスクを解けるかどうかを実証すること。

提案手法

  • 著者らは、DQNおよびDouble DQNアルゴリズムにおけるQ値関数の表現に、パrameter化された量子ゲートを用いたQVCsを実装した。
  • 2種類の符号化方式を設計した:有界で非歪みのない浮動小数点入力に適したスケーリング符号化、および無限範囲または大きさが無視可能な範囲の入力に適した方向性符号化。
  • QVCsは量子シミュレータを用いて訓練され、最適化のための勾配はパラメータシフト則によって計算された。
  • 学習の安定化を図るため、古典的DQNと同様に、リプレイバッファおよびターゲットネットワークを採用した。
  • 同じ強化学習環境において、さまざまな深さとパラメータ数を持つ古典的ニューラルネットワークと比較した。
  • トレーニングプロセスはTensorFlow Quantumおよび量子回路最適化を活用し、平均二乗ベルナウリ誤差を最小化した。

実験結果

リサーチクエスチョン

  • RQ1量子変分回路が、顕著に少ないパラメータで古典的ニューラルネットワークと同等またはそれ以上の強化学習性能を達成できるか?
  • RQ2スケーリングおよび方向性という異なる古典的から量子的へのデータ符号化方式が、QVCの強化学習タスクにおける性能に与える影響は何か?
  • RQ3DQNおよびDouble DQNアルゴリズムにおける純粋なQVCとハイブリッド量子-古典的モデルの相対的な性能はいかほどか?
  • RQ4ハイブリッドモデルの高速収束が、早期収束に起因して局所最適解に陥り、結果として劣った方策を生じさせる可能性はあるか?
  • RQ5QVCベースの強化学習は、CartPoleやBlackjackのようなさまざまな環境にどの程度一般化できるか?

主な発見

  • 純粋なQVCモデルは、CartPoleにおけるDouble DQNで、ハイブリッドモデルおよび古典的ニューラルネットワークよりも優れた性能を達成し、パラメータ数も少ないことから優位であった。
  • ハイブリッドQVCモデルは古典的ネットワークよりも高速に収束したが、一部の実験では局所最適解に陥り、CartPole実験では純粋なQVCに比べてわずかに劣る性能を示した。
  • Blackjack環境では、純粋およびハイブリッドQVCsともに、1,250パラメータの古典的ネットワークと同等の結果を達成したが、パラメータ数はわずか33にとどまり、高いサンプル効率を示した。
  • スケーリング符号化方式は、有界で非歪みのない入力の量子状態へのマッピングに効果的であり、さまざまな環境で安定した学習を可能にした。
  • 方向性符号化方式は、大きさが無視可能な入力に特化しており、多様な入力タイプへの広範な一般化を支援した。
  • 結果から、特にパラメータ数が少ない状況下では、QVCsが古典的ニューラルネットワークよりも優れた表現能力を有している可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。