Skip to main content
QUICK REVIEW

[論文レビュー] Attend2Pack: Bin Packing through Deep Reinforcement Learning with Attention

Jingwei Zhang, Bin Zi|arXiv (Cornell University)|Jul 9, 2021
Optimization and Packing Problems参考文献 38被引用数 16
ひとこと要約

Attend2Packは、自己注意メカニズムと優先順位付きオーバースマplingを用いて組合せ的行動空間を分解する、オフラインビンパッキングのためのエンドツーエンドの深層強化学習モデルを提案する。2次元および3次元のビンパッキングベンチマーク、特に厳密なオンライン-BPP設定においても最先端の性能を達成し、1エピソードあたり平均15.6個のアイテムをパッキングする際の利用率は67.0%に達する。

ABSTRACT

This paper seeks to tackle the bin packing problem (BPP) through a learning perspective. Building on self-attention-based encoding and deep reinforcement learning algorithms, we propose a new end-to-end learning model for this task of interest. By decomposing the combinatorial action space, as well as utilizing a new training technique denoted as prioritized oversampling, which is a general scheme to speed up on-policy learning, we achieve state-of-the-art performance in a range of experimental settings. Moreover, although the proposed approach attend2pack targets offline-BPP, we strip our method down to the strict online-BPP setting where it is also able to achieve state-of-the-art performance. With a set of ablation studies as well as comparisons against a range of previous works, we hope to offer as a valid baseline approach to this field of study.

研究の動機と目的

  • ビンパッキングにおける従来のヒューリスティック法および正確なアルゴリズムの計算コストと一般化性能の限界を克服すること。
  • 多様なビンパッキングシナリオに一般化可能なスケーラブルなエンドツーエンドの深層強化学習モデルを開発すること。
  • 大規模な組合せ的行動空間におけるオンポリシー学習の課題を、新しいトレーニング技術によって克服すること。
  • オフライン-BPPにとどまらず、パッキング中に将来のアイテムが不明であるという厳密なオンライン-BPP設定においても優れた性能を示すこと。

提案手法

  • ビンの状態と残りのアイテムを表すために自己注意に基づくエンコーダーを採用し、アイテム配置における長距離依存関係を捉える。
  • 組合せ的行動空間をシーケンス生成と配置意思決定に分解することで、構造的な方策学習を可能にする。
  • 優先順位付きオーバースマplingを導入——高報酬遷移に焦点を当てることで、オンポリシー学習を加速するトレーニング技術。
  • 2ストリーム方策ネットワークを採用:1つは配置順序の生成(π^s)に、もう1つは配置座標の予測(π^p)に使用し、共通の注意特徴を共有する。
  • 方策勾配を用いた最適化を促進するために、利用効率に基づく報酬関数 r_u = (アイテム体積の合計) / (ビン体積) を適用する。
  • 残りのアイテム埋め込みを配置方策から削除することで、モデルを厳密なオンライン-BPPに適応させ、推論時に将来のアイテム情報が漏洩しないようにする。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドの注意ベースの深層強化学習モデルは、複雑な3次元アイテム構成を伴うオフラインビンパッキングにおいて、既存手法を上回る性能を発揮できるか?
  • RQ2優先順位付きオーバースマplingは、大規模な行動空間を持つ組合せ最適化におけるオンポリシー学習の加速にどの程度効果的か?
  • RQ3オフライン-BPPで事前学習したモデルは、アイテム順序が事前に不明な厳密なオンライン-BPP設定にどの程度一般化できるか?
  • RQ4自己注意機構やシーケンスモデリングといったアーキテクチャ的要素は、ビンパッキングにおける性能向上にどの程度寄与しているか?
  • RQ5提案手法は、カット生成されたものおよびランダムに抽出されたボックスを含む多様なデータ分布においても、最先端の結果を達成できるか?

主な発見

  • 厳密なオンライン-BPP設定において、1エピソードあたり平均15.6個のアイテムをパッキングする際、Attend2Packは平均67.0%のビン利用率を達成し、類似条件下で54.7%にとどまった先行研究(Zhao et al., 2021)を上回った。
  • カット生成された3次元ビンパッキングインスタンスにおいて、Attend2Packは2次元および3次元両設定で、先行のSOTA手法(Laterre et al., 2019)を上回る最先端の性能を達成した。
  • サイズ100×100のビンを用いたランダムに生成された3次元ボックスにおいて、Attend2Packは全テストインスタンスサイズ(20, 30, 50, 100個のアイテム)でSOTA結果を達成し、安定した訓練曲線と向上した一般化性能を示した。
  • アブレーションスタディの結果、自己注意メカニズムおよび残りのアイテム埋め込みの導入が性能向上に顕著に寄与していることが確認され、特にシーケンス方策(π^s)がより良いアイテム順序を実現していることが示された。
  • 優先順位付きオーバースマpling技術は、オンポリシー学習の加速に効果的であり、訓練の不安定性を軽減し、収束速度を向上させた。
  • 100個のアイテムインスタンスのトレーニング中に1回の深刻な忘却イベントが発生したが、追加のトレーニングランによりモデルの性能は依然として安定しており、一貫したSOTA結果を再確認できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。