[논문 리뷰] An application of data driven reward of deep reinforcement learning by dynamic mode decomposition in active flow control
이 논문은 원형 실린더의 능동 유동 제어(AFC)에서 깊이 강화 학습(DRL)을 위한 데이터 기반 보상 함수를 제안한다. 유동 시뮬레이션 데이터에서 전체 유동 특징을 추출하기 위해 동적 모드 분해(DMD)를 사용한다. PPO 기반 DRL 프레임워크에서 이 DMD 기반 보상 함수를 최적화함으로써, 기존의 프로브 기반 보상과 비교해 항력은 최대 10.8% 감소시키고, 순환 영역은 124% 증가시켜 카르만 소용돌이 도서가 현저히 안정화됨을 확인하였다.
This paper focuses on the active flow control (AFC) of the flow over a circular cylinder with synthetic jets through deep reinforcement learning (DRL) by implementing a reward function based on dynamic mode decomposition (DMD). As a main factor that affects the DRL model, the reward is determined by the information extracted from flow field by performing DMD on measurements through simulation. With the data-driven reward, the DRL model is able to learn the AFC policy through the more global information of the field, and instructs the mass flow rate of the synthetic jets. As a result of this type of AFC, the vortex street is stabilized with a reduction of approximately 8% in drag and an improvement of approximately 109% in recirculation area. Furthermore, the configuration of the flow modified by the AFC is studied with DMD on the velocity measurement of the complete flow field.
연구 동기 및 목표
- 기존의 프로브 기반 보상 대신 전체 유동 역학에서 유도된 데이터 기반 보상으로 깊이 강화 학습(DRL) 성능을 향상시키기 위해.
- 전체 유속 측정값에 대해 동적 모드 분해(DMD)를 적용하여 주요 유동 구조를 추출하고, 그 진폭을 DRL 에이전트의 보상 신호로 활용하기 위해.
- 합성 제트를 사용한 원형 실린더 위 2차원 유동에서 항력 감소 및 순환 영역 증대 효과를 평가하기 위해 DMD 기반 보상의 효과성을 검증하기 위해.
- 다양한 학습 기간과 측정 해상도에서 메서드의 강건성과 확장 가능성을 입증하기 위해.
- 분산 센서 측정치와 연장된 에피소드 길이와 호환되는 DRL 프레임워크를 설계하여 향후 실험 적용 가능성을 확보하기 위해.
제안 방법
- DRL 에이전트는 원형 실린더의 합성 제트의 질량 유량을 제어하기 위해 프록실 필 정책 최적화(PPO) 알고리즘을 사용한다.
- 전체 유속 측정값에서 압축을 적용한 동적 모드 분해(DMDc)를 통해 추출한 동적 모드의 진폭을 사용하여 데이터 기반 보상 함수를 구축한다.
- DMDc는 시간 해상도가 높은 유동장 데이터를 처리하여 응집된 구조와 그 시간적 동역학을 식별하고, 이를 보상 신호 계산에 활용한다.
- 특히 주요 소용돌이 방출 모드를 포함한 주요 불안정 모드의 억제를 강조함으로써 유동 안정화를 유도하는 보상 함수를 설계한다.
- 학습은 레이놀즈 수 100에서 실시된 원형 실린더 위 2차원 유동의 시뮬레이션 데이터를 사용하며, 합성 제트를 제어 액추에이터로 활용한다.
- 다른 학습 기간(400 및 800 에포크)에서의 성능을 평가하고, 프로브 측정값만을 사용하는 베이스라인과 비교한다.
실험 결과
연구 질문
- RQ1DMD 기반의 데이터 기반 보상 함수는 기존의 프로브 기반 보상과 비교해 DRL 성능 향상에 기여하는가?
- RQ2DMDc를 통한 전체 유동 정보 활용이 소용돌이 도서 제어에서 항력 감소 및 순환 영역 향상에 어떤 영향을 미치는가?
- RQ3DMD 기반 보상은 주파수 및 모드 진폭 억제 측면에서 카르만 소용돌이 도서의 안정성 향상에 어느 정도 기여하는가?
- RQ4연장된 학습 기간과 향상된 측정 해상도에서 학습 효율성과 최종 성능는 어떻게 변화하는가?
- RQ5제안된 DMD 기반 보상과 함께 DRL 프레임워크는 분산 센서를 활용한 실험적 구현에 적합한가?
주요 결과
- DMD 기반 보상은 800 에포크 학습 시 평균 항력 계수를 약 10.8% 감소시켰으며, 이는 프로브 기반 보상으로 얻은 8.6% 감소보다 뛰어난 성능을 보였다.
- DMD 기반 보상으로 800 에포크 학습 후 순환 영역은 최대 124% 향상되었고, 400 에포크 학습 시 109% 향상된 것과 비교해 더욱 높은 성능를 기록하였다.
- 제어된 유동에서 소용돌이 방출의 기본 주파수는 약 11% 감소하여 더 안정적이고 비정기적인 유동 구조를 나타내었다.
- 제어된 유동에 대한 DMD 분석 결과, 특히 근접한 후류 영역에서 주요 모드의 진폭이 현저히 감소한 것으로 확인되어 불안정한 비정상 유동의 효과적인 억제가 이루어졌음을 확인하였다.
- DMD 모드에서 재구성한 속도 크기 등고선도에서 유동 변동 모드 간의 공간적 간격이 하류에서 증가한 것으로 나타나, 소용돌이 쌍정화가 감소하고 유동의 일관성이 향상됨을 시사하였다.
- 다양한 학습 기간과 측정 해상도에서 강건성을 입증하였으며, 항력 감소 및 순환 영역 향상 측면에서 일관된 향상이 관찰되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.