Skip to main content
QUICK REVIEW

[논문 리뷰] Synthesis of separation processes with reinforcement learning

Stephan C. P. A. van Kalmthout, Laurence I. Midgley|arXiv (Cornell University)|2022. 11. 03.
Process Optimization and Integration인용 수 7
한 줄 요약

이 논문은 수소화물 분리의 자동화된 증류 순서 설계 및 최적화를 위해 딥 강화학습(특히 소프트 액터-크리틱)을 Aspen Plus V12와 통합하는 것을 보여준다. 강화학습 에이전트는 반복적인 정책 개선을 통해 수익을 극대화하는 데 성공하였으며, 9,405 에피소드 후 최대 수익 856M€를 달성하였다. 다만, 시뮬레이션 속도가 느리고 Aspen Plus의 API 통신이 불안정하여 성능이 제한되었다.

ABSTRACT

This paper shows the implementation of reinforcement learning (RL) in commercial flowsheet simulator software (Aspen Plus V12) for designing and optimising a distillation sequence. The aim of the SAC agent was to separate a hydrocarbon mixture in its individual components by utilising distillation. While doing so it tries to maximise the profit produced by the distillation sequence. All actions of the agent were set by the SAC agent in Python and communicated in Aspen Plus via an API. Here the distillation column was simulated by use of the build-in RADFRAC column. With this a connection was established for data transfer between Python and Aspen and the agent succeeded to show learning behaviour, while increasing profit. Although results were generated, the use of Aspen was slow (190 hours) and Aspen was found unsuitable for parallelisation. This makes that Aspen is incompatible for solving RL problems. Code and thesis are available at https://github.com/lollcat/Aspen-RL

연구 동기 및 목표

  • 화학공학 분야의 공정 설계에 강화학습을 적용할 수 있는지 탐색하는 것, 특히 증류 순서 설계에 초점을 맞춘다.
  • 상용 플로우시트 시뮬레이터(Aspen Plus V12) 내에서 자율적으로 증류 순서를 설계하고 최적화하는 소프트 액터-크리틱(SAC) 에이전트를 구현하는 것.
  • 시뮬레이션 환경과의 상호작용을 통해 최적의 열매름 비율 및 단계 수 설정을 학습함으로써 경제적 수익을 극대화할 수 있는 에이전트의 능력을 평가하는 것.
  • 특히 시뮬레이션 속도와 안정성 측면에서 상용 공정 시뮬레이터(예: Aspen Plus)를 강화학습 환경으로 사용할 경우의 한계를 규명하는 것.

제안 방법

  • 에이전트는 소프트 액터-크리틱(SAC) 알고리즘을 사용하여 파이썬으로 구현되었으며, 탐색과 이용의 균형을 이루기 위해 정책 최적화와 엔트로피 최대화를 결합한다.
  • 에이전트는 커스터마이즈된 API를 통해 Aspen Plus와 상호작용하며, 예를 들어 열매름 비율과 단계 수와 같은 조작 명령어를 RADFRAC 열매름 모델에 전송하고 상태 관측치 및 보상을 수신한다.
  • 상태 공간은 스트림 조성, 유량 및 열매름 파rameter를 포함하며, 행동 공간은 열매름 설계 변수에 대한 이산적 및 연속적 조정을 포함한다.
  • 보상 함수는 에너지 비용과 제품 가치를 기반으로 계산된 증류 순서의 순수익으로 정의되었으며, 비가능한 구성에 대한 패널티가 포함되어 있다.
  • 비판 네트워크는 학습 안정성을 향상시키기 위해 폴리악 평균을 사용하는 타겟 Q-네트워크를 사용하여 훈련되었으며, 엔트로피 온도 초항수는 적응적으로 업데이트되었다.
  • 학습률과 타겟 스무딩 계수를 조절하여 탐색과 이용의 균형을 제어하기 위해 하이퍼파ram터 튜닝이 수행되었다.

실험 결과

연구 질문

  • RQ1소프트 액터-크리틱 에이전트는 상용 공정 시뮬레이터인 Aspen Plus 내에서 최대 수익을 위한 증류 순서 설계 및 최적화를 효과적으로 학습할 수 있는가?
  • RQ2에피소드 수에 따라 에이전트의 학습 행동은 정책 수렴 및 보상 향상 측면에서 어떻게 변화하는가?
  • RQ3에이전트의 성능이 에피소드당 에이전트 업데이트 수나 엔트로피 온도와 같은 하이퍼파ram터에 얼마나 의존하는가?
  • RQ4Aspen Plus를 강화학습을 통한 공정 설계 환경으로 사용할 경우의 주요 기술적 한계는 무엇인가?
  • RQ5기존 방법(예: DSTWU)으로부터의 초기 설계를 사용하면 강화학습 에이전트의 샘플 효율성과 수렴 속도가 향상되는가?

주요 결과

  • 에이전트는 증류 순서의 수익을 성공적으로 향상시켰으며, 에피소드 9,405회 후 최대 수익 856M€를 달성하였다. 이는 에피소드당 4회의 에이전트 업데이트를 기준으로 하였다.
  • 에이전트는 빠른 수렴을 보였으며, 수익이 급격히 증가한 후 약 6,500번째 에피소드 이후 안정화되었고, 이후 탐색이 재개되면서 변동성이 증가하였다.
  • 에이전트는 스트림 분리 성공률가 98.9%에 도달하였으며, 분리에 실패한 행동은 1.1%에 그쳐 정책 안정성이 높음을 보여주었다.
  • Aspen Plus에서의 수렴 오류는 낮았으며, 최고의 구성에서 0.03%에 불과하여 대부분의 행동이 타당한 시뮬레이션을 유도함을 시사했다.
  • 9,405 에피소드 동안 시뮬레이션이 총 160.9시간 소요되어, Aspen Plus는 효율적인 강화학습 훈련을 위해 너무 느리다는 점이 확인되었다.
  • API 연결이 불안정하여 0.2%의 연결 끊김 이벤트가 발생하였으며, 환경은 병렬화에 적합하지 않아 확장성에 제약이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.