[论文解读] Attend2Pack: Bin Packing through Deep Reinforcement Learning with Attention
Attend2Pack 提出了一种基于自注意力机制和优先级过采样技术的端到端深度强化学习模型,用于离线装箱问题,通过分解组合动作空间实现高效求解。该方法在 2D 和 3D 装箱基准测试中均达到最先进性能,包括严格在线-BPP 设置,在每轮平均打包 15.6 个物品时,平均利用率达 67.0%。
This paper seeks to tackle the bin packing problem (BPP) through a learning perspective. Building on self-attention-based encoding and deep reinforcement learning algorithms, we propose a new end-to-end learning model for this task of interest. By decomposing the combinatorial action space, as well as utilizing a new training technique denoted as prioritized oversampling, which is a general scheme to speed up on-policy learning, we achieve state-of-the-art performance in a range of experimental settings. Moreover, although the proposed approach attend2pack targets offline-BPP, we strip our method down to the strict online-BPP setting where it is also able to achieve state-of-the-art performance. With a set of ablation studies as well as comparisons against a range of previous works, we hope to offer as a valid baseline approach to this field of study.
研究动机与目标
- 解决传统启发式与精确算法在装箱问题中面临的计算效率与泛化能力局限。
- 开发一种可扩展的、端到端的深度强化学习模型,使其在多样化装箱场景中具备良好泛化能力。
- 通过新颖的训练技术,克服组合动作空间中在线学习的挑战。
- 不仅在离线-BPP 中表现优异,更在严格在线-BPP 设置中实现强性能,即打包过程中无法预知未来物品。
提出的方法
- 采用基于自注意力机制的编码器,表示箱子状态与剩余物品状态,捕捉物品配置中的长距离依赖关系。
- 将组合动作空间分解为序列生成与放置决策两部分,支持结构化策略学习。
- 提出优先级过采样——一种训练技术,通过聚焦于高回报转移,加速在线学习过程。
- 采用双流策略网络:一个用于生成物品放置序列(π^s),另一个用于预测放置坐标(π^p),两者共享注意力特征。
- 使用基于效用的奖励函数 r_u = (物品体积总和) / (箱子体积) ,通过策略梯度指导策略优化。
- 通过从放置策略中移除剩余物品嵌入,将模型适配至严格在线-BPP 设置,确保推理过程中不泄露未来物品信息。
实验结果
研究问题
- RQ1基于注意力机制的端到端深度强化学习模型能否在复杂 3D 物品配置的离线装箱问题中超越现有方法?
- RQ2优先级过采样在大规模动作空间的组合优化中,对加速在线学习的效率如何?
- RQ3在物品顺序未知的严格在线-BPP 设置下,于离线-BPP 上预训练的模型能多大程度实现泛化?
- RQ4自注意力机制与序列建模等架构组件在装箱问题中对性能提升的贡献程度如何?
- RQ5所提方法能否在包括切割生成与随机采样箱子在内的多样化数据分布中均实现最先进性能?
主要发现
- 在严格在线-BPP 设置下,Attend2Pack 平均打包 15.6 个物品时,实现 67.0% 的箱子利用率,显著优于先前工作(Zhao et al., 2021)在类似条件下仅达到的 54.7%。
- 在切割生成的 3D 装箱实例中,Attend2Pack 在 2D 和 3D 设置下均达到最先进性能,超越先前最先进方法(Laterre et al., 2019)。
- 在尺寸为 100×100 的随机生成 3D 箱子中,Attend2Pack 在所有测试实例规模(20、30、50、100 个物品)下均取得最先进结果,训练曲线稳定,泛化能力显著提升。
- 消融实验表明,自注意力机制与剩余物品嵌入的引入均显著提升性能,其中序列策略(π^s)在优化物品排序方面发挥关键作用。
- 优先级过采样技术有效加速了在线学习过程,降低训练不稳定性并提升收敛速度。
- 尽管在 100 个物品实例的训练过程中发生一次灾难性遗忘事件,模型性能仍保持稳健,额外一次训练运行确认了其一致的最先进结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。