Skip to main content
QUICK REVIEW

[論文レビュー] Free energy-based reinforcement learning using a quantum processor

Anna Levit, Daniel Crawford|arXiv (Cornell University)|May 29, 2017
Quantum Computing Algorithms and Architecture参考文献 1被引用数 17
ひとこと要約

本稿では、D-Wave 20000Q量子アンネーリング機を用いて横磁場イジング模型からのサンプリングを実行することで、量子ボルツマン機械(QBM)における自由エネルギーの効率的近似を可能にする、自由エネルギーに基づく強化学習(FERL)フレームワークを提案する。本手法はレプリカスタッキングを用いて量子測定結果を有効な古典的配置にマッピングし、グリッドワールドタスクにおいて古典的FERLおよびDQNベースラインと比較して、初期学習段階での優れた性能を示している。

ABSTRACT

Recent theoretical and experimental results suggest the possibility of using current and near-future quantum hardware in challenging sampling tasks. In this paper, we introduce free energy-based reinforcement learning (FERL) as an application of quantum hardware. We propose a method for processing a quantum annealer's measured qubit spin configurations in approximating the free energy of a quantum Boltzmann machine (QBM). We then apply this method to perform reinforcement learning on the grid-world problem using the D-Wave 2000Q quantum annealer. The experimental results show that our technique is a promising method for harnessing the power of quantum sampling in reinforcement learning tasks.

研究の動機と目的

  • 現在の量子ハードウェア(特にD-Wave 20000Q量子アンネーリング機)を強化学習タスクに有効に利用できるかを検討すること。
  • 量子サンプリングを強化学習に活用する挑戦に応えるために、測定されたキュービットスピン配置から量子ボルツマン機械(QBM)の自由エネルギーを近似すること。
  • 量子アンネーリング機の出力を有効な古典的イジング模型からのサンプルとみなす手法を開発し、既存の自由エネルギーに基づく学習フレームワークへの統合を可能にすること。
  • 量子強化学習FERLの性能を古典的ベースライン(特に初期段階の学習効率)と比較して評価すること。
  • 適切に有効な古典的配置にマッピングされた場合、量子サンプリングが強化学習において古典的サンプリングを上回る可能性があるという仮説を検証すること。

提案手法

  • 量子アンネーリングプロセスを高次元古典的イジング模型にマッピングするためのスズキ–トロッター分解を用いることで、量子測定結果をレプリカとして解釈可能にする。
  • D-Wave 20000Qからの複数回の測定結果を用いてレプリカスタッキングを適用し、量子デバイスをQBMのサンプリングオракルとして扱う有効な古典的配置を生成する。
  • 量子サンプルから導出された有効な古典的イジング模型のエネルギーを用いて、自由エネルギーに基づくQ関数近似を実装する。
  • 深層ボルツマン機械(DBM)または制限付きボルツマン機械(RBM)を用いてQ関数をパラメータ化し、自由エネルギー近似に基づく時系列差分(TD)更新により学習を進める。
  • 性能比較のため、シミュレーテッドアンネーリング(SA)と量子アンネーリング(SQA)をベースラインとして用い、両者に同一の仮想パラメータ(β = 2.0, Γ = 0.5)を適用する。
  • 測定されたスピン配置を次元が拡張された有効イジング模型に起因するものとみなすことにより、D-Wave 20000Qの出力を古典的ボルツマン分布にマッピングする。

実験結果

リサーチクエスチョン

  • RQ1現在の世代の量子アンネーリング機は、強化学習のための量子ボルツマン機械からのサンプリングに有効に利用可能か?
  • RQ2量子測定から得られる自由エネルギー近似は、初期段階の強化学習において古典的サンプリング手法を上回る性能を示すか?
  • RQ3D-Wave 20000Qの測定結果は、どの程度古典的イジング模型のボルツマン分布を近似しているか?
  • RQ4グリッドワールドナビゲーションタスクにおいて、量子アンネーリングを用いたFERLの性能は、RBMを用いた古典的FERLおよびDQNと比較してどうなるか?
  • RQ5ニューラルネットワークアーキテクチャの選択(例:DBM対キメラグラフ)が、量子強化学習FERLの性能に顕著な影響を及ぼすか?

主な発見

  • D-Wave 20000Qを用いたFERLは、RBMを用いた古典的FERLおよびDQNよりも初期段階の学習で優れた性能を示し、最適方策への収束が速い。
  • キメラグラフ上でSQAベースのFERLは、実際のD-Wave 20000Qのサンプルを用いたFERLとほぼ同等の性能を示しており、量子デバイスがサンプリングオラクルとしての忠実性を有していることを裏付けている。
  • DBMを用いたSQAベースのFERLは、キメラグラフ上でのD-Wave 20000QおよびSQAの両方をわずかに上回る性能を示しており、ネットワークの接続性とアーキテクチャが性能に顕著な影響を及ぼすことが示唆されている。
  • レプリカスタッキングの適用により、量子測定結果が有効な古典的配置にうまくマッピングされ、量子アンネーリング機がQBMのサンプリングデバイスとして扱えることが実証された。
  • 仮想パラメータΓ = 0.5およびβ = 2.0は最適なアンネーリングスケジュールに対応しており、Γ = 0.5がアンネーリング時間の2/3の位置に一致することが、先行理論的研究によって裏付けられている。
  • D-Wave 20000Qからの量子サンプルは、使用した問題サイズおよびモデルアーキテクチャにおいて、古典的ボルツマン分布のサンプルの有効な近似であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。