[论文解读] Synthesis of separation processes with reinforcement learning
本文展示了将深度强化学习(特别是Soft Actor-Critic)与Aspen Plus V12集成,用于烃类分离中蒸馏序列的自动化合成与优化。强化学习智能体通过迭代策略改进成功学习到最大化利润,经过9,405轮训练后实现最高利润856 M€,但性能受限于Aspen Plus中模拟速度较慢和API通信不稳定。
This paper shows the implementation of reinforcement learning (RL) in commercial flowsheet simulator software (Aspen Plus V12) for designing and optimising a distillation sequence. The aim of the SAC agent was to separate a hydrocarbon mixture in its individual components by utilising distillation. While doing so it tries to maximise the profit produced by the distillation sequence. All actions of the agent were set by the SAC agent in Python and communicated in Aspen Plus via an API. Here the distillation column was simulated by use of the build-in RADFRAC column. With this a connection was established for data transfer between Python and Aspen and the agent succeeded to show learning behaviour, while increasing profit. Although results were generated, the use of Aspen was slow (190 hours) and Aspen was found unsuitable for parallelisation. This makes that Aspen is incompatible for solving RL problems. Code and thesis are available at https://github.com/lollcat/Aspen-RL
研究动机与目标
- 探索在化学工程中使用强化学习进行过程合成的可行性,特别是针对蒸馏序列设计。
- 实现一个Soft Actor-Critic(SAC)智能体,使其在商用流程模拟器(Aspen Plus V12)中自主设计并优化蒸馏序列。
- 评估智能体在与模拟环境交互过程中,通过学习最优塔配置(回流比、塔板数)来最大化经济利润的能力。
- 识别使用Aspen Plus等商用过程模拟器作为强化学习环境的局限性,特别是其速度和稳定性方面的问题。
提出的方法
- 强化学习智能体使用Python实现,采用Soft Actor-Critic(SAC)算法,通过策略优化与熵最大化相结合,以平衡探索与利用。
- 智能体通过自定义API与Aspen Plus交互,向RADFRAC塔模型发送动作(如回流比、塔板数),并接收状态观测值和奖励信号。
- 状态空间包括物流组成、流量以及塔参数;动作空间包括对塔设计变量的离散与连续调整。
- 奖励函数定义为蒸馏序列的净利润,基于能耗与产品价值计算,并对不可行配置施加惩罚。
- 评论网络通过使用Polyak平均法的软目标Q网络进行训练,以提升训练稳定性,熵温度超参数实现自适应更新。
- 通过超参数调优调整学习率与目标平滑系数,以控制探索与利用的平衡。
实验结果
研究问题
- RQ1Soft Actor-Critic智能体是否能在Aspen Plus等商用流程模拟器中有效学习,以实现蒸馏序列的设计与优化,从而实现最大利润?
- RQ2智能体的学习行为在训练轮次中如何演变,特别是在策略收敛与奖励提升方面?
- RQ3智能体性能在多大程度上依赖于超参数,如每轮训练中的智能体更新次数与熵温度?
- RQ4使用Aspen Plus作为强化学习在过程合成中的环境,其主要技术限制是什么?
- RQ5能否利用传统方法(如DSTWU)生成的初始设计来提升强化学习智能体的样本效率与收敛速度?
主要发现
- 强化学习智能体成功学习到提升蒸馏序列利润,经过9,405轮训练(每轮4次智能体更新)后实现最高利润856 M€。
- 智能体表现出快速收敛,回报值在初期迅速上升,约在第6,500轮后趋于稳定,随后重新开始探索,导致方差增加。
- 智能体在分离流股方面达到98.9%的成功率,仅1.1%的动作导致无法分离,表明策略具有较强的稳定性。
- Aspen Plus中的收敛错误率较低(最佳配置下为0.03%),表明大多数动作均能生成可行的模拟结果。
- 9,405轮训练共耗时160.9小时,表明Aspen Plus的模拟速度过慢,难以支持高效的强化学习训练。
- API连接不稳定,出现0.2%的断连事件,且环境不支持并行化,限制了可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。