Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning Enhanced Quantum-inspired Algorithm for Combinatorial Optimization

Dmitrii Beloborodov, Alexander E. Ulanov|arXiv (Cornell University)|Feb 11, 2020
Quantum Computing Algorithms and Architecture参考文献 31被引用数 4
ひとこと要約

本論文は、イジングモデル最適化のための量子にインspiredなアルゴリズムであるSimCIMにおける正則化パラメータの動的チューニングを可能にする強化学習(RL)エージェントを提案する。局所最適解から脱出するための新規なスケーリング順位報酬(R3)手法を用いる。このアプローチは、ベースラインのヒューリスティクスやブラックボックス最適化(例:CMA-ES)を著しく上回り、特にランダムな問題に対する事前学習エージェントからの転移学習を組み合わせることで、高品質な解の高確率発見を実現する。

ABSTRACT

Quantum hardware and quantum-inspired algorithms are becoming increasingly popular for combinatorial optimization. However, these algorithms may require careful hyperparameter tuning for each problem instance. We use a reinforcement learning agent in conjunction with a quantum-inspired algorithm to solve the Ising energy minimization problem, which is equivalent to the Maximum Cut problem. The agent controls the algorithm by tuning one of its parameters with the goal of improving recently seen solutions. We propose a new Rescaled Ranked Reward (R3) method that enables stable single-player version of self-play training that helps the agent to escape local optima. The training on any problem instance can be accelerated by applying transfer learning from an agent trained on randomly generated problems. Our approach allows sampling high-quality solutions to the Ising problem with high probability and outperforms both baseline heuristics and a black-box hyperparameter optimization approach.

研究の動機と目的

  • 量子にインスパイアされた組合せ最適化アルゴリズム(例:SimCIM)におけるハイパーパramータチューニングの課題に対処すること。これは、最適なパフォーマンスを得るための問題固有の設定を必要とする。
  • 強化学習を用いたパrameter適応の自動化により、イジングエネルギー最小化問題(Max-Cut問題に等価)の解の品質と収束速度を向上させること。
  • 多くの劣悪解が類似したエネルギー値を持つため、局所最適解に陥りやすいイジング最適化の困難さを克服するため、報酬機構を設計し、それらの罠を越えての探索を促進すること。
  • ランダムに生成された問題に対する事前学習エージェントからの転移学習を可能にすることで、新しい問題インスタンスにおける学習を加速し、サンプル効率を向上させること。
  • 本手法をSimCIMやイジングモデルにとどまらず、他の連続的リラクゼーションに基づく離散最適化アルゴリズムへ一般化すること。

提案手法

  • 強化学習エージェントは、最適化中の解の動的進化を制御する、SimCIMアルゴリズム内の正則化(ゲイン・ロス)関数を制御するように訓練される。
  • スケーリング順位報酬(R3)機構は、最近の試行における現在の解のカット値の相対順位に基づいて報酬を割り当てる。局所最適解に頻繁に訪問された場合は低い報酬が、より良い解に対しては固定報酬が与えられる。
  • R3により、解の頻度に敏感な報酬が得られ、解空間の新しい、より高品質な領域への探索を促進するため、安定した単一プレイヤーのセルフプレイ学習が可能になる。
  • 転移学習は、多様なランダムに生成されたイジング問題インスタンス上でエージェントを事前学習し、その後、特徴量ごとの線形調製(FiLM)を用いて、ターゲット問題のパラメータに適応させる微調整によって実施される。
  • エージェントの方策ネットワークは、価値関数を推定するためのクライアントネットワークを用いた深層強化学習で訓練され、GPU実装により学習が加速される。
  • 本手法は、標準的なGsetベンチマークインスタンス上で評価され、固定パラメータのSimCIMおよびCMA-ESと比較して、解の品質と収束速度が評価された。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、イジング最適化問題におけるSimCIMアルゴリズムの正則化パラメータのチューニングを、効果的に自動化できるか?
  • RQ2提案されたスケーリング順位報酬(R3)機構は、標準的な報酬スキーム(例:R2)と比較して、安定した学習と局所最適解からの効果的脱出を可能にするか?
  • RQ3ランダムな問題に対する事前学習エージェントからの転移学習は、未観測の実世界の問題インスタンスにおける微調整の加速とパフォーマンス向上に、どの程度寄与するか?
  • RQ4伝統的なヒューリスティクスやブラックボックスハイパーパramータ最適化手法(例:CMA-ES)と比較して、RL強化SimCIMのパフォーマンスとサンプル効率はどの程度か?
  • RQ5提案手法は、SimCIM やイジングモデルにとどまらず、他の連続的リラクゼーションに基づく離散最適化アルゴリズムへ一般化可能か?

主な発見

  • R3手法により、エージェントがより良い解を発見した後、価値損失が顕著に低下するなど、安定した学習と局所最適解からの効果的脱出が実証された。これに対して、R2ベースラインは局所最適解に対するランダム報酬により、不安定な学習を示した。
  • FiLMとR3を併用した事前学習エージェントは、アブレーションバージョンを上回り、収束が速く、解の品質も高い。転移学習アプローチにより、問題を解くために必要なエピソード数が削減された。
  • GsetベンチマークのG2インスタンスにおいて、R3ベースのエージェントは500回の微調整エピソード後に0.80の解決率を達成した。これは、手動でチューニングされたパラメータを用いたベースラインSimCIM(0.70)およびCMA-ES(0.53)を上回った。
  • アブレーションスタディにより、FiLMとR3の両方が不可欠であることが確認された。両方のコンponentsを欠如させたエージェントは、著しく収束が遅く、解の品質も低かった。
  • RL強化SimCIMは、ヒューリスティクスベースラインおよびCMA-ESと比較して、高品質な解のサンプリング確率がより高かった。これは、多様な問題インスタンスにわたる頑健性と適応性を示している。
  • 本手法は、SimCIM やイジングモデルに限定されず、離散最適化問題の連続的リラクゼーションに基づくあらゆるアルゴリズムに適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。