Skip to main content
QUICK REVIEW

[论文解读] Toolpath design for additive manufacturing using deep reinforcement learning

Mojtaba Mozaffar, Ablodghani Ebrahimi|arXiv (Cornell University)|Sep 30, 2020
Additive Manufacturing and 3D Printing Technologies参考文献 10被引用 4
一句话总结

本文提出一种基于深度强化学习的框架,用于优化金属基增材制造中的工具路径设计,将该过程建模为强化学习问题。采用DQN、SAC和PPO算法,结果表明无模型强化学习在密集奖励结构下表现优异,其中DQN和PPO优于人工设定的之字形工具路径,而SAC由于在此任务上下文中的不稳定性表现较差。

ABSTRACT

Toolpath optimization of metal-based additive manufacturing processes is currently hampered by the high-dimensionality of its design space. In this work, a reinforcement learning platform is proposed that dynamically learns toolpath strategies to build an arbitrary part. To this end, three prominent model-free reinforcement learning formulations are investigated to design additive manufacturing toolpaths and demonstrated for two cases of dense and sparse reward structures. The results indicate that this learning-based toolpath design approach achieves high scores, especially when a dense reward structure is present.

研究动机与目标

  • 解决金属基增材制造工具路径优化中的高维设计空间挑战。
  • 探究无模型强化学习是否能在不了解环境先验知识的情况下有效学习最优工具路径策略。
  • 比较三种先进深度强化学习算法——DQN、SAC和PPO——在密集与稀疏奖励设置下的工具路径生成性能。
  • 评估这些算法在模拟增材制造环境中的样本效率与收敛行为。
  • 证明工程化的密集奖励可显著提升复杂制造任务中的学习性能。

提出的方法

  • 将工具路径设计问题建模为马尔可夫决策过程(MDP),其中智能体基于环境状态学习选择动作(工具路径移动)。
  • 开发了定制的仿真环境以模拟增材制造过程,包括基于当前构件几何形状和沉积历史的状态表示。
  • 使用TensorFlow库实现了三种无模型深度强化学习算法——深度Q网络(DQN)、软演员-critic(SAC)和近端策略优化(PPO)——并进行训练。
  • 设计了密集与稀疏奖励函数:密集奖励在每一步基于几何与工艺质量指标提供反馈,而稀疏奖励仅在任务结束时给出成功或失败信号。
  • 通过超参数调优以最大化累积奖励,SAC通过温度参数引入熵正则化,以平衡探索与利用。
  • 智能体策略通过异策略(DQN、SAC)或同策略(PPO)学习进行更新,DQN与SAC使用经验回放与目标网络以提升稳定性。

实验结果

研究问题

  • RQ1深度强化学习能否有效优化高维增材制造设计空间中的工具路径策略?
  • RQ2在密集与稀疏奖励结构下,不同无模型RL算法(DQN、SAC、PPO)在学习最优工具路径方面的表现如何?
  • RQ3密集的、逐步的奖励是否显著提升工具路径设计中的学习效率与最终性能?
  • RQ4为何SAC尽管在其他强化学习基准中表现优异,却在此特定工具路径优化任务中表现欠佳?
  • RQ5尽管需要大量训练样本,同策略算法如PPO在多大程度上能获得更优解?

主要发现

  • 在密集奖励设置下,DQN和PPO优于人工编码的之字形工具路径,得分分别为59.31和62.98。
  • DQN使用比PPO少十倍的样本即达到稳定解,表明在此任务中具有更高的样本效率。
  • SAC在密集设置下得分最低(38.71),表明其不适用于此特定工具路径优化问题。
  • 在稀疏奖励设置下,PPO得分最高(40.54),而SAC表现最差(5.11),表明其在稀疏反馈下学习能力差。
  • 结果表明,密集奖励对有效学习至关重要,且在奖励设计得当的情况下,无模型强化学习在高维制造设计中是可行的。
  • PPO对样本的高需求限制了其在实际环境中的实用性,凸显了结合真实实验数据的混合无模型/有模型方法的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。