Skip to main content
QUICK REVIEW

[论文解读] A State Aggregation Approach for Solving Knapsack Problem with Deep Reinforcement Learning

Reza Refaei Afshar, Yingqian Zhang|TU/e Research Portal|Apr 25, 2020
Optimization and Search Problems参考文献 27被引用 14
一句话总结

本文提出一种基于状态聚合的深度强化学习(DRL)方法,用于求解0-1背包问题,通过减少状态空间来提升学习效率。通过将表格强化学习应用于离散化物品特征,并训练优势演员-评论家(A2C)策略网络,该方法在不同规模的实例(最多500个物品)上实现了接近最优的解,其解的质量和样本效率均优于贪心启发式方法及无聚合的DRL方法。

ABSTRACT

This paper proposes a Deep Reinforcement Learning (DRL) approach for solving knapsack problem. The proposed method consists of a state aggregation step based on tabular reinforcement learning to extract features and construct states. The state aggregation policy is applied to each problem instance of the knapsack problem, which is used with Advantage Actor Critic (A2C) algorithm to train a policy through which the items are sequentially selected at each time step. The method is a constructive solution approach and the process of selecting items is repeated until the final solution is obtained. The experiments show that our approach provides close to optimal solutions for all tested instances, outperforms the greedy algorithm, and is able to handle larger instances and more flexible than an existing DRL approach. In addition, the results demonstrate that the proposed model with the state aggregation strategy not only gives better solutions but also learns in less timesteps, than the one without state aggregation.

研究动机与目标

  • 为克服现有DRL方法在背包问题上的局限性,如状态空间增长过快以及在不同实例规模间泛化能力差的问题。
  • 通过深度强化学习学习自适应选择策略,超越贪心启发式方法。
  • 开发一种可泛化的DRL框架,仅需对N个物品的实例进行一次训练,即可应用于任意大小不超过N的实例。
  • 通过基于特征的状态聚合减少状态空间大小,同时保持解的质量并加速学习。

提出的方法

  • 采用状态聚合策略,利用表格强化学习对连续物品特征(价值、重量、价值与重量之比)进行离散化,以推导出最优聚合策略。
  • 聚合后的特征构成紧凑的状态嵌入,显著减小有效状态空间大小,从而提升泛化能力和训练效率。
  • 使用优势演员-评论家(A2C)算法训练深层神经网络策略,根据聚合后的状态逐个选择物品。
  • 策略网络有N个输出(每个物品一个),通过贪心或Softmax解码选择动作,逐步构建解,直至背包容积达到上限。
  • 该方法在一组实例上仅需一次训练,即可推广至相同或更小规模的新实例,无需重新训练。
  • 在三种实例类型上进行评估:随机实例、固定容量实例以及接近相变点的困难实例,实例规模分别为50、300和500。

实验结果

研究问题

  • RQ1在DRL中使用状态聚合是否能显著减小背包问题的状态空间,同时保持解的质量?
  • RQ2所提出的结合状态聚合的DRL方法是否在解的质量和学习速度上均优于贪心启发式方法及现有的DRL基线方法?
  • RQ3一个在N个物品实例上训练的单一DRL模型是否能泛化到任意大小不超过N的实例?
  • RQ4在接近相变点的困难实例上,状态聚合对性能有何影响?此类实例的解空间庞大,但最优解稀少。
  • RQ5使用表格强化学习推导聚合策略是否能提升下游DRL训练的泛化能力并加快收敛速度?

主要发现

  • 所提出的结合状态聚合的DRL方法在所有测试实例上均实现了接近最优的解,包括500个物品的实例,平均解值与最优值相差不超过两位小数。
  • 在500个物品的困难实例(HI)中,尽管最优解数量较少,但该方法比无聚合的DRL方法多获得了133个最高价值解。
  • 该方法收敛所需时间步数约减少10,000个,表明学习速度更快。
  • 在300和500个物品的实例上,结合状态聚合的DRL在解的质量(平均值)和最高价值解数量方面均优于无聚合的DRL方法。
  • 状态聚合在具有大可行解空间的困难实例上效果最显著;在可行解较少的小容量实例上效果较弱。
  • 该方法泛化能力良好:在N个物品上训练的模型可解决任意大小不超过N的实例,克服了先前DRL方法对实例大小的依赖性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。