Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning Driven Heuristic Optimization

Qingpeng Cai, Will Hang|arXiv (Cornell University)|Jun 16, 2019
Scheduling and Optimization AlgorithmsEngineering参考文献 17被引用数 19
ひとこと要約

本稿では、強化学習(PPO)を用いて、焼きなまし法(SA)などのヒューリスティック最適化アルゴリズムの高品質な初期解を生成するフレームワークであるRLHOを提案する。組合せ最適化問題において顕著な性能向上を達成している。SAの最終的な解の質を報酬信号として用いてRLエージェントを訓練することで、SAの効果を高める初期化戦略を学習可能となり、ランダム初期化や純粋な強化学習に比べ、複数のビンパッキング問題サイズで優れた性能を示した。

ABSTRACT

Heuristic algorithms such as simulated annealing, Concorde, and METIS are effective and widely used approaches to find solutions to combinatorial optimization problems. However, they are limited by the high sample complexity required to reach a reasonable solution from a cold-start. In this paper, we introduce a novel framework to generate better initial solutions for heuristic algorithms using reinforcement learning (RL), named RLHO. We augment the ability of heuristic algorithms to greedily improve upon an existing initial solution generated by RL, and demonstrate novel results where RL is able to leverage the performance of heuristics as a learning signal to generate better initialization. We apply this framework to Proximal Policy Optimization (PPO) and Simulated Annealing (SA). We conduct a series of experiments on the well-known NP-complete bin packing problem, and show that the RLHO method outperforms our baselines. We show that on the bin packing problem, RL can learn to help heuristics perform even better, allowing us to combine the best parts of both approaches.

研究の動機と目的

  • ランダムな初期解から開始する焼きなまし法のようなヒューリスティックアルゴリズムの高いサンプル必要量を解決すること。
  • 強化学習を活用して優れた初期解を生成することで、ヒューリスティック最適化の性能を向上させること。
  • 最終的な解の質を報酬信号として用いることで、ヒューリスティックアルゴリズムの性能から強化学習が学習できる仕組みを提供すること。
  • NP完全問題(例:ビンパッキング問題)において、強化学習とヒューリスティックの組み合わせが、単独で使用する場合よりも優れた結果をもたらすことを示すこと。

提案手法

  • RLHOフレームワークは、PPOエージェントによる初期解の生成と、焼きなまし法(SA)による精錬を交互に実行する。
  • RLエージェントは、SAの最終的な解の質を密度的で情報豊富な報酬信号として用いて訓練され、方策の改善を促進する。
  • RLエージェントは問題状態を観測し、アイテムをビンに割り当てる行動をとることで、SA用の初期解を生成する。
  • SA部は、RLが生成した初期解から出発し、温度スケジュールに基づく確率的局所探索と、摂動を用いた改善を実行する。
  • 訓練ループは、RLのロールアウトとSA最適化を交互に繰り返し、RLエージェントがヒューリスティックの勾配上昇的動作によりより良い状態を探索できるようにする。
  • フレームワークは、PPOを強化学習に、SAをヒューリスティック最適化に用い、さまざまなインスタンスサイズのビンパッキング問題に対して評価された。

実験結果

リサーチクエスチョン

  • RQ1強化学習は、焼きなまし法のようなヒューリスティック最適化アルゴリズムのより良い初期解を生成できるか?
  • RQ2ヒューリスティックアルゴリズムの最終的な解の質を報酬信号として用いることで、強化学習エージェントの組合せ最適化における性能が向上するか?
  • RQ3強化学習とヒューリスティックの組み合わせは、純粋な強化学習や純粋なヒューリスティック手法を上回る性能を発揮するか?
  • RQ4強化学習エージェントは、訓練時よりもはるかに長い時間、ヒューリスティックが実行される状況でも有効な初期化戦略を学習できるか?

主な発見

  • 1000アイテムのビンパッキング問題において、RLHOはSAが50,000ステップ実行された場合、ランダム初期化の734ビンから711ビンに平均的に削減した。
  • 5000ステップのSA実行時、n=1000のケースでRLHOは平均714ビンを達成したのに対し、ランダム初期化では734ビンであり、2.7%の一貫した改善が得られた。
  • SAを収束まで実行(数百万ステップ)した場合でも、5000ステップのSAで訓練されたRLHOの初期化は、ランダム初期化を上回った。
  • 交互最適化において、2000回の訓練イテレーション後、RLHOは純粋なPPOに比べ1000アイテム問題で2.1%の改善を達成し、より優れた探索能力を示した。
  • RLエージェントは、PPO単体では最適解に収束しなかったにもかかわらず、SAの勾配上昇的プロセスに適した初期解を学習して生成した。
  • 問題サイズが大きくなるほど、RLHOとランダム初期化の性能差が拡大しており、より大きな複雑なインスタンスにおいてRLHOのスケーラビリティが優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。