Skip to main content
QUICK REVIEW

[논문 리뷰] Deep reinforcement learning for the control of conjugate heat transfer with application to workpiece cooling

Elie Hachem, Hassan Ghraieb|arXiv (Cornell University)|2020. 11. 30.
Heat Transfer Mechanisms참고 문헌 65인용 수 4
한 줄 요약

이 논문은 유체-구조 시스템에서의 공액 열전달을 최적화하기 위해 열화된 프록시멀 정책 최적화(PPO) 알고리즘을 사용하는 새로운 딥 강화학습(DRL) 프레임워크를 제안한다. 2D 및 3D 설정에서 자연 대류와 강제 대류를 효과적으로 제어하며, 온도 균일도를 향상시키고, 대칭 구동 조건 하에서 비대칭 위치 설정과 같은 비직관적인 최적 구성 요소를 발견한다.

ABSTRACT

This research gauges the ability of deep reinforcement learning (DRL) techniques to assist the control of conjugate heat transfer systems governed by the coupled Navier--Stokes and heat equations. It uses a novel, "degenerate" version of the proximal policy optimization (PPO) algorithm, intended for situations where the optimal policy to be learnt by a neural network does not depend on state, as is notably the case in optimization and open-loop control problems. The numerical reward fed to the neural network is computed with an in-house stabilized finite elements environment combining variational multi-scale (VMS) modeling of the governing equations, immerse volume method, and multi-component anisotropic mesh adaptation. Several test cases of natural and forced convection in two and three dimensions are used as testbed for developing the methodology. The approach successfully alleviates the natural convection induced enhancement of heat transfer in a two-dimensional, differentially heated square cavity controlled by piece-wise constant fluctuations of the sidewall temperature. It also proves capable of improving the homogeneity of temperature across the surface of two and three-dimensional hot workpieces under impingement cooling. Various cases are tackled, in which the position of multiple cold air injectors is optimized relative to a fixed workpiece position. The flexibility of the numerical framework makes it tractable to solve also the inverse problem, i.e., to optimize the workpiece position relative to a fixed injector distribution. The obtained results showcase the potential of the method for black-box optimization of practically meaningful computational fluid dynamics (CFD) conjugate heat transfer systems.

연구 동기 및 목표

  • 결합된 나비에-스토크스 방정식과 열전달 방정식에 의해 지배되는 공액 열전달을 위한 DRL 기반 제어 전략을 개발한다.
  • 사전 지식이 최소한인 고차원, 대규모 매개변수 공간 최적화 문제를 해결하는 데 도전한다.
  • 전통적인 설계 직관을 초월하여 놀라운 고성능 제어 구성 요소를 발견할 수 있는 DRL의 잠재력을 탐색한다.
  • 열관리 문제에서 정방향 및 역방향 제어 문제를 동시에 해결할 수 있는 방법의 유연성을 입증한다.
  • 실제 2D 및 3D 공액 열전달 시나리오, 즉 충격 냉각 및 이질적으로 가열된 캐비티에서 접근 방식을 검증한다.

제안 방법

  • 정책 네트워크가 상태 의존성 없이 훈련되는 '열화된' PPO의 변형을 적용하여, 개방 루프 및 최적화 문제에 적합하다.
  • 변분 다스키 모델링, 수침 경계 방법, 이방향 메쉬 적응 기법을 통합한 고안정성 유한요소 해석기 사용으로 정확한 CFD 시뮬레이션을 구현한다.
  • 온도 균일도와 열기울기를 기반으로 수치적으로 계산된 보상 신호를 사용하여 정책 학습을 유도한다.
  • 복잡한 기하구조에서 해의 정확도를 향상시키고 계산 비용을 절감하기 위해 다성분 이방향 메쉬 적응 전략을 통합한다.
  • 동일한 프레임워크 내에서 정방향 제어(노즐 위치 최적화)와 역방향 제어(작업물 위치 최적화)를 모두 가능하게 한다.
  • 딥 신경망을 활용해 시뮬레이션 데이터에서 직접 제어 정책을 학습하며, 시스템을 블랙박스 최적화 문제로 간주한다.

실험 결과

연구 질문

  • RQ1상태에 의존하지 않는 액션 선택 없이도 열화된 PPO 알고리즘이 공액 열전달 시스템에서 최적 제어 정책을 효과적으로 학습할 수 있는가?
  • RQ2충격 냉각 조건 하에서 DRL이 2D 및 3D 뜨거운 작업물의 온도 균일도를 어느 정도 향상시킬 수 있는가?
  • RQ3DRL은 대칭 구동 조건 하에서 비대칭 작업물 위치 설정과 같은 비직관적이거나 반직관적인 최적 구성 요소를 드러내는가?
  • RQ4산업적 열제어 문제에서 흔히 나타나는 고차원 매개변수 공간을 다룰 때 DRL 프레임워크의 확장성과 견고성은 어느 정도인가?
  • RQ5동일한 프레임워크가 공액 열전달 문제에서 정방향 및 역방향 제어 문제를 효율적으로 해결할 수 있는가?

주요 결과

  • 열화된 PPO 알고리즘은 2D 이질적으로 가열된 캐비티에서 자연 대류에 의해 유도되는 열전달 향상을 효과적으로 억제하기 위해 측벽 온도 변동을 최적화함으로써 성공적으로 제어한다.
  • 충격 냉각 조건 하에서 2D 및 3D 뜨거운 작업물 표면의 온도 균일도를 크게 향상시키기 위해 냉각 공기 주입 노즐의 공간 분포를 최적화함으로써 성과를 거두었다.
  • 역방향 문제 설정에서 DRL 프레임워크는 대칭 구동 조건 하에서 최적의 작업물 위치가 중심에서 벗어난 것을 밝혀내었으며, 이는 대칭 기반 설계에서 예상할 수 없는 비직관적인 결과이다.
  • 이 방법은 고차원 제어 공간에서 뛰어난 수렴성과 해의 품질을 보이며, 단순한 파arametric 스윕 방식을 능가한다.
  • 동일한 수치 환경에서 정방향 및 역방향 제어 문제를 모두 처리할 수 있는 탄력성과 확장성을 보이며, 더 넓은 설계 탐색을 가능하게 한다.
  • 결과적으로 DRL이 전통적인 최적화나 히우리스틱 설계 접근 방식으로는 도달할 수 없는 새로운 고성능 제어 전략을 드러낼 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.