Skip to main content
QUICK REVIEW

[論文レビュー] Online 3D Bin Packing with Constrained Deep Reinforcement Learning

Hang Zhao, Qijin She|arXiv (Cornell University)|Jun 26, 2020
Optimization and Packing Problems参考文献 51被引用数 13
ひとこと要約

本稿では、再調整が許可されないリアルタイム制約下で、到着したアイテムを即座にパッケージングしなければならないオンライン3次元ビンパッキングに対して、制約付き深層強化学習(DRL)手法を提案する。本手法は、訓練中に実行可能性マスクを強制するための予測・プロジェクション方式を採用し、安定した順序依存パッケージング方策の効率的学習を可能にし、初期テストでは最先端手法および人間水準のパフォーマンスを上回る結果を得た。

ABSTRACT

We solve a challenging yet practically useful variant of 3D Bin Packing Problem (3D-BPP). In our problem, the agent has limited information about the items to be packed into the bin, and an item must be packed immediately after its arrival without buffering or readjusting. The item's placement also subjects to the constraints of collision avoidance and physical stability. We formulate this online 3D-BPP as a constrained Markov decision process. To solve the problem, we propose an effective and easy-to-implement constrained deep reinforcement learning (DRL) method under the actor-critic framework. In particular, we introduce a feasibility predictor to predict the feasibility mask for the placement actions and use it to modulate the action probabilities output by the actor during training. Such supervisions and transformations to DRL facilitate the agent to learn feasible policies efficiently. Our method can also be generalized e.g., with the ability to handle lookahead or items with different orientations. We have conducted extensive evaluation showing that the learned policy significantly outperforms the state-of-the-art methods. A user study suggests that our method attains a human-level performance.

研究の動機と目的

  • バッファリングや再調整が許可されない順次到着するアイテムに対するオンライン3次元ビンパッキングの実用的課題に対処すること。
  • 現実の物流およびロボット工学的応用を反映するため、物理的安定性および順序依存性の制約をパッケージングプロセスに組み込むこと。
  • 限られた先行予測と厳密なリアルタイム制約下で、実行可能で安定したパッケージング方策を学習する深層強化学習フレームワークを開発すること。
  • ベンチマークデータセット上で、既存のヒューリスティック法および学習ベース手法と比較して、空間利用効率およびパッケージング効率の面で優れたパフォーマンスを達成すること。
  • ユーザースタディを通じて人間の直観と比較し、実世界のパッケージングタスクにおいて人間と同等またはそれを上回るパフォーマンスを示すこと。

提案手法

  • 順序依存性および物理的安定性制約をモデル化するため、問題を制約付きマルコフ決定過程(CMDP)として定式化する。
  • 予測・プロジェクション方式を導入:エージェントはまず、潜在的な配置の実行可能性マスクを補助タスクとして予測する。
  • 予測されたマスクを用いて、訓練中にアクションネットワークの確率を投影・調節し、実行可能行動のみを強制する。
  • 3次元パッケージング状態を高さマップ表現で符号化し、モンテカルロツリー探索(MCTS)を用いてマルチビンおよび先行予測アイテムの処理をサポートする。
  • アクションスペースを倍増させ、方向変更に特化した方策を学習することで、アイテムの再方向転換に対応する。
  • 安定性と実行可能性を保証するため、制約付き方策最適化を用いたオンポリシーのアクタ・クリティックフレームワークでDRLエージェントを訓練する。

実験結果

リサーチクエスチョン

  • RQ1限られた先行予測と再調整が許可されないオンライン環境下で、深層強化学習エージェントは3次元アイテムを効率的にパッケージングできるか?
  • RQ2提案された予測・プロジェクション方式は、訓練中に物理的安定性および順序依存性制約をどの程度効果的に強制できるか?
  • RQ3空間利用効率およびパッケージングされたアイテム数の観点から、本手法は既存のヒューリスティック法および学習ベース手法を上回るか?
  • RQ4学習された方策は、実世界のパッケージングタスクにおいて人間の直観と同等またはそれを上回るパフォーマンスを達成できるか?
  • RQ5本手法は、アーキテクチャの変更なしにマルチビンパッキングおよびアイテムの再方向転換に対し、どの程度一般化可能か?

主な発見

  • 実ロボットテストでは、本手法が平均66.3%の空間利用効率を達成し、境界ルールベースライン(39.2%)およびオンラインBPH(43.2%)を顕著に上回った。
  • RSベンチマークでは、50.5%の空間利用効率と平均12.2個のアイテムパッケージングを達成し、最良のベースライン(BPH)を15.1ポイントの空間利用効率向上と3.5個の追加パッケージングで上回った。
  • CUT-1およびCUT-2ベンチマークでは、それぞれ73.4%および66.9%の空間利用効率を達成し、CUT-1ではオフラインLBP手法を上回り、CUT-2ではその性能に近づいた。
  • 1,851ゲームにわたるユーザースタディでは、AIが1,339ゲーム(72.3%の勝率)を獲得し、平均68.9%の空間利用効率を達成した。これに対して人間プレイヤーは平均52.1%であった。
  • アイテムの再方向転換を許可することで、RSデータセットにおいて空間利用効率が11.6%向上し、平均パッケージング数が3個増加した。これは、形状の変動に対して本手法の頑健性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。