Skip to main content
QUICK REVIEW

[論文レビュー] A State Aggregation Approach for Solving Knapsack Problem with Deep Reinforcement Learning

Reza Refaei Afshar, Yingqian Zhang|TU/e Research Portal|Apr 25, 2020
Optimization and Search Problems参考文献 27被引用数 14
ひとこと要約

この論文は、状態集合の縮小と学習効率の向上を目的として、状態集約を用いた深層強化学習(DRL)アプローチを0-1ナップサック問題に提案する。アイテム特徴量を表形式強化学習で離散化し、アドバンテージアクターキャリブレーター(A2C)方策ネットワークを訓練することで、最大500個のアイテムを含む多様なインスタンスサイズにおいて、グリーディヒューリスティクスや集約なしDRLを上回る解の質とサンプル効率を達成する近似最適解を実現する。

ABSTRACT

This paper proposes a Deep Reinforcement Learning (DRL) approach for solving knapsack problem. The proposed method consists of a state aggregation step based on tabular reinforcement learning to extract features and construct states. The state aggregation policy is applied to each problem instance of the knapsack problem, which is used with Advantage Actor Critic (A2C) algorithm to train a policy through which the items are sequentially selected at each time step. The method is a constructive solution approach and the process of selecting items is repeated until the final solution is obtained. The experiments show that our approach provides close to optimal solutions for all tested instances, outperforms the greedy algorithm, and is able to handle larger instances and more flexible than an existing DRL approach. In addition, the results demonstrate that the proposed model with the state aggregation strategy not only gives better solutions but also learns in less timesteps, than the one without state aggregation.

研究の動機と目的

  • ナップサック問題に対する既存のDRL手法の限界、すなわち状態空間の非現実的増大とインスタンスサイズにわたる一般化の悪さを克服すること。
  • 深層強化学習による適応的選択方策の学習を通じて、グリーディヒューリスティクスを上回ること。
  • 一度の学習でN個のアイテムに対して適用可能であり、N以下の任意のサイズのインスタンスに一般化可能な汎用的DRLフレームワークを構築すること。
  • 特徴に基づく状態集約により状態空間サイズを縮小しながら、解の質を維持し、学習を加速すること。

提案手法

  • 連続的アイテム特徴量(価値、重さ、価値/重さ比)を表形式強化学習を用いて最適な集約方策を導出するための状態集約戦略を適用する。
  • 集約された特徴量がコンパクトな状態埋め込みを形成し、有効な状態空間サイズを縮小することで、一般化性能と学習効率が向上する。
  • アドバンテージアクターキャリブレーター(A2C)アルゴリズムを用いて、集約状態に基づきアイテムを逐次選択する深層ニューラルネットワーク方策を訓練する。
  • 方策ネットワークはN出力(アイテムごとに1つ)を持ち、グリーディまたはソフトマックスデコードにより行動を選択し、ナップサック容量に達するまで段階的に解を構築する。
  • この手法は一度のインスタンスセットでの学習で訓練され、再訓練なしに同じサイズまたはそれ以下のサイズの新しいインスタンスに一般化可能である。
  • ランダム、固定容量、およびフェーズ遷移付近のハードインスタンスの3種類のインスタンスタイプを、サイズ50、300、500で評価する。

実験結果

リサーチクエスチョン

  • RQ1DRLにおける状態集約は、解の質を維持したままナップサック問題の状態空間を顕著に縮小できるか?
  • RQ2提案手法のDRL(状態集約付き)は、グリーディヒューリスティクスおよび既存のDRLベースラインと比較して、解の質と学習速度の両面で優れているか?
  • RQ3N個のアイテムで学習した1つのDRLモデルが、N以下の任意のサイズのインスタンスを解けるか?
  • RQ4フェーズ遷移付近のハードインスタンス(解空間は大きいが最適解はまれ)において、状態集約は性能にどのように影響するか?
  • RQ5集約方策の導出に表形式RLを用いることで、下流のDRL学習における一般化性能の向上と収束速度の向上が達成されるか?

主な発見

  • 提案手法のDRL(状態集約付き)は、500個のアイテムを含むすべてのテストインスタンスで近似最適解を達成し、平均的な解の値が最適解から小数第2位まで一致する。
  • 500個のハードインスタンス(HI)において、DRL(集約あり)は最適解が少ないにもかかわらず、DRL(集約なし)よりも133個多い最高価値の解を達成した。
  • DRL(集約あり)は収束までに約10,000ステップ少ない時間を要し、学習がより速いことが示された。
  • 300および500個のアイテムインスタンスにおいて、DRL(集約あり)は解の質(平均値)および最高価値解の数の両面でDRL(集約なし)を上回った。
  • 状態集約は、巨大な可能解空間を持つハードインスタンスにおいて最も効果的であったが、可能な解が少ない小容量インスタンスではやや効果が薄かった。
  • 一般化性能は良好である:N個のアイテムで学習したモデルは、N以下の任意のサイズのインスタンスを解ける。これにより、従来のDRLアプローチのサイズ依存性の制限を克服した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。