Skip to main content
QUICK REVIEW

[논문 리뷰] Model-Free Adaptive Optimal Control of Sequential Manufacturing Processes using Reinforcement Learning.

Johannes Dornheim, Norbert Link|arXiv (Cornell University)|2018. 09. 18.
Advanced Control Systems Optimization참고 문헌 33인용 수 3
한 줄 요약

이 논문은 Q-학습 기반 강화학습을 사용하여 사전 공정 모델링이 필요 없는 순차적 제조 공정을 위한 모델 자유형 적응 최적 제어 프레임워크를 제안한다. 실시간 제품 품질 피드백으로부터 직접 최적의 제어 정책을 학습함으로써, 유한요소법(FEM) 시뮬레이션을 통한 깊은 브레이딩 공정에서 모델 기반 방법인 모델 예측 제어(MPC)와 근사 동적 프rogramming(ADP)보다 뛰어난 성능을 달성한다.

ABSTRACT

A self-learning optimal control algorithm for sequential manufacturing processes with time-discrete control actions is proposed and evaluated with simulated deep drawing processes. The necessary control model is built during consecutive process executions under optimal control via Reinforcement Learning, using the measured product quality as reward after each process execution. Prior model formation, which is required by state-of-the-art algorithms like Model Predictive Control and Approximate Dynamic Programming, is therefore obsolete. This avoids the difficulties in system identification and accurate modelling, which arise with processes subject to non-linear dynamics and stochastic influences. Also runtime complexity problems of these approaches are avoided, which arise when more complex models and larger control prediction horizons are employed. Instead of using pre-created process- and observation-models, Reinforcement Learning algorithms build functions of expected future reward during processing, which are then used for optimal process control decisions. The learning of such expectation functions is realized online by interacting with the process. The proposed algorithm also takes stochastic variations of the process conditions into consideration and is able to cope with partial observability. A method for the adaptive optimal control of partially observable fixed-horizon manufacturing processes, based on Q-learning is developed and studied. The resulting algorithm is instantiated and then evaluated by application to a time-stochastic optimal control problem in metal sheet deep drawing, where the experiments use FEM-simulated processes. The Reinforcement Learning based control shows superior results over the model-based Model Predictive Control and Approximate Dynamic Programming approaches.

연구 동기 및 목표

  • 순차적 제조 공정의 최적 제어에서 사전 공정 모델링이 필요 없도록 하는 것.
  • 비선형적이고 확률적인 공정에 대한 시스템 식별 및 모델 정확도 과제를 해결하는 것.
  • 伝통적인 최적 제어 방법에서 복잡한 모델과 긴 예측 수평선으로 인한 런타임 복잡도를 줄이는 것.
  • 부분 관측 가능하고 시간에 따라 변동하는 제조 환경에서의 적응형 제어를 가능하게 하는 것.
  • 깊은 브레이딩 공정에서 고정 수평선 최적 제어를 위한 Q-학습 기반 알고리즘을 개발하고 평가하는 것.

제안 방법

  • 강화학습을 사용하여 각 공정 사이클 후 측정된 제품 품질에서 미래 보상의 기대값을 나타내는 가치 함수를 학습한다.
  • 사전 정의된 공정 모델이나 관측 모델이 필요 없이, 물리적 공정과의 상호작용을 통해 온라인으로 최적의 제어 정책을 학습한다.
  • 부분 관측 가능성과 공정 조건의 확률적 변동을 다루기 위해 Q-학습 기반 접근법을 활용한다.
  • 시간 이산 제어 프레임워크에서 작동하며, 시뮬레이션된 깊은 브레이딩 공정으로부터 실시간 피드백에 기반해 정책을 업데이트한다.
  • 미래 보상의 기대 함수를 구축함으로써, 명시적인 시스템 동역학 모델링 없이도 최적의 제어 결정을 이끌어내는 방법이다.
  • 유한요소법(FEM)을 사용한 시뮬레이션된 깊은 브레이딩 공정을 활용하여 알고리즘을 구현하고 평가한다.

실험 결과

연구 질문

  • RQ1모델 자유형 강화학습 접근법이 사전 시스템 모델링 없이 순차적 제조 공정에서 최적 제어를 달성할 수 있는가?
  • RQ2제안된 RL 기반 방법의 성능은 모델 기반 방법인 모델 예측 제어(MPC)와 근사 동적 프로그래밍(ADP)과 비교해 어떻게 되는가?
  • RQ3RL 방법이 제조 공정의 확률적 변동과 부분 관측 가능성에 얼마나 잘 대응할 수 있는가?
  • RQ4시스템 식별 및 모델 복잡도를 제거함으로써 제어 런타임과 적응 가능성에 어떤 영향을 미치는가?
  • RQ5RL 알고리즘이 시뮬레이션된 깊은 브레이딩 공정에서 제품 품질 피드백을 직접 사용해 효과적인 제어 정책을 학습할 수 있는가?

주요 결과

  • 제안된 강화학습 기반 제어 방법은 FEM 시뮬레이션된 깊은 브레이딩 공정에서 모델 예측 제어(MPC)와 근사 동적 프로그래밍(ADP)보다 제어 성능 면에서 뛰어나다.
  • 이 방법은 사전 공정 모델링이 필요 없이 최적의 제어 정책을 성공적으로 학습하여, 시스템 식별 및 모델 정확도 과제를 피한다.
  • 알고리즘은 제조 공정의 확률적 변동과 부분 관측 가능성을 효과적으로 다루며, 강건한 제어 성능를 유지한다.
  • 복잡한 모델과 긴 예측 수평선에 의존하는 모델 기반 방법에 비해 런타임 복잡도가 크게 감소한다.
  • 제품 품질을 유일한 보상 신호로 사용하여 공정과의 직접적 상호작용을 통해 학습 과정이 최적의 제어 정책으로 수렴한다.
  • 결과는 복잡하고 비선형적인 제조 환경에서 모델 자유형 RL이 적응형 최적 제어에 대해 실현 가능하고 우수한 성능을 보임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.