[논문 리뷰] When to Trust Your Simulator: Dynamics-Aware Hybrid Offline-and-Online Reinforcement Learning
이 논문은 제한된 실세계 오프라인 데이터와 불완전한 시뮬레이터에서의 온라인 롤아웃을 결합하여 시뮬레이션에서 실제 환경으로의 정책 배포 격차를 줄이는 다이내믹스 인식형 하이브리드 오프라인-온라인 강화학습 프레임워크인 H2O를 제안한다. 실세계 데이터 비교를 통해 시뮬레이션 전이에서 다이내믹스 격차가 큰 경우에 Q-값을 적응적으로 페널티 부여함으로써, H2O는 순수 오프라인 또는 온라인 기반 모델보다 뛰어난 성능을 달성하며, 특히 작은 오프라인 데이터셋에서 뛰어난 견고성과 샘플 효율성을 보여주어 시뮬레이션 및 실제 로봇 작업 전반에서 우수한 성능을 발휘한다.
Learning effective reinforcement learning (RL) policies to solve real-world complex tasks can be quite challenging without a high-fidelity simulation environment. In most cases, we are only given imperfect simulators with simplified dynamics, which inevitably lead to severe sim-to-real gaps in RL policy learning. The recently emerged field of offline RL provides another possibility to learn policies directly from pre-collected historical data. However, to achieve reasonable performance, existing offline RL algorithms need impractically large offline data with sufficient state-action space coverage for training. This brings up a new question: is it possible to combine learning from limited real data in offline RL and unrestricted exploration through imperfect simulators in online RL to address the drawbacks of both approaches? In this study, we propose the Dynamics-Aware Hybrid Offline-and-Online Reinforcement Learning (H2O) framework to provide an affirmative answer to this question. H2O introduces a dynamics-aware policy evaluation scheme, which adaptively penalizes the Q function learning on simulated state-action pairs with large dynamics gaps, while also simultaneously allowing learning from a fixed real-world dataset. Through extensive simulation and real-world tasks, as well as theoretical analysis, we demonstrate the superior performance of H2O against other cross-domain online and offline RL algorithms. H2O provides a brand new hybrid offline-and-online RL paradigm, which can potentially shed light on future RL algorithm design for solving practical real-world tasks.
연구 동기 및 목표
- 불완전한 시뮬레이터가 단순화된 다이내믹스를 갖는 데서 기인하는 시뮬레이션-실세계 일반화 격차를 해결하기 위해.
- 오프라인 데이터셋의 상태-액션 커버리지가 제한되어 있을 경우 과도하게 경계적인 성향을 보이며 성능이 떨어지는 순수 오프라인 RL의 한계를 극복하기 위해.
- 시뮬레이션에서의 자유로운 탐색과 실제 세계 오프라인 데이터의 정확한 다이내믹스를 유기적으로 조합하는 통합 프레임워크를 개발하기 위해.
- 대규모 실세계 데이터 수집이 비용이 많이 들거나 실현 가능하지 않은 실제 응용 분야에서 고성능 정책 학습을 가능하게 하기 위해.
제안 방법
- H2O는 학습된 다이내믹스 모델을 사용하여 시뮬레이션된 전이와 실제 전이 간의 다이내믹스 격차를 정량화하는 다이내믹스 인식 정책 평가 메커니즘을 도입한다.
- 다이내믹스 격차가 큰 시뮬레이션 상태-액션 쌍의 Q-값을 적응적으로 페널티 부여함으로써, 학습 중에 잘못된 시뮬레이션 데이터의 영향을 줄인다.
- 고정된 오프라인 실세계 데이터셋과 불완전한 시뮬레이터에서의 온라인 롤아웃을 동시에 학습하며, 일정 크기의 시뮬레이션 버퍼를 유지한다.
- 다이내믹스 격차의 크기에 따라 Q-값 업데이트를 동적으로 조정하는 값 정규화 기반 기법을 활용하여 샘플 효율성과 정책의 견고성을 향상시킨다.
- 대조 학습 기반의 다이내믹스 모델을 사용하여 시뮬레이션된 경로와 실제 경로 간의 격차를 추정함으로써 신뢰할 수 있는 격차 탐지 기능을 제공한다.
- H2O는 CQL과 같은 표준 오프라인 RL 알고리즘과 호환되도록 설계되어 있어 원활한 통합과 성능 향상을 가능하게 한다.
실험 결과
연구 질문
- RQ1불완전한 시뮬레이터와 제한된 실세계 데이터를 사용할 때, 하이브리드 오프라인-온라인 RL 프레임워크가 시뮬레이션-실세계 격차를 효과적으로 줄일 수 있는가?
- RQ2고정밀 시뮬레이터에 의존하지 않고도 시뮬레이션과 현실 간의 다이내믹스 격차를 정량화하고 정책 학습을 이끄는 데 사용할 수 있는가?
- RQ3시뮬레이션에서의 온라인 탐색과 실제 세계의 오프라인 데이터를 조합하면 순수 오프라인 또는 온라인 RL보다 더 뛰어난 샘플 효율성과 성능을 달성할 수 있는가?
- RQ4다이내믹스 인식 보정 메커니즘을 사용할 경우 오프라인 데이터셋 크기가 정책 성능에 미치는 영향은 어떠한가?
- RQ5제안된 프레임워크는 시뮬레이션 및 실제 로봇 환경 모두에서 기존의 오프라인 및 온라인 RL 방법을 능가할 수 있는가?
주요 결과
- H2O는 HalfCheetah 및 Walker2d 환경에서 CQL 및 기타 기준 모델보다 일관되게 뛰어난 성능을 보이며, 오프라인 데이터셋 크기가 50,000 건 이하로 줄어들 경우 더욱 두드러진다.
- 60,000건의 오프라인 전이를 사용할 경우, H2O는 강력한 성능 유지를 보이며 CQL의 성능는 심각하게 저하됨을 확인하여 H2O가 작은 오프라인 데이터셋에 대해 뛰어난 견고성을 지님을 입증한다.
- 저품질 데이터를 포함한 HalfCheetah Random 데이터셋(마찰력 다이내믹스)에서 H2O는 4,862±1,608의 리워드를 기록하여 SAC(2,684±2,646)와 CQL(2,465±180)을 모두 앞서며 낮은 품질의 데이터에 대한 내성 강화를 입증한다.
- 중간 크기의 재생 데이터셋인 Walker2d Medium Replay에서 중력 조건을 변경한 환경에서 H2O는 3,656±582의 리워드를 기록하여 DARC+(2,375±579)와 CQL(1,445±1,077)을 모두 앞서며 실제 다이내믹스 환경에서의 효과성을 확인한다.
- 학습 곡선 분석 결과, H2O와 그 변종인 H2O(v)는 모든 작업에서 기준 모델보다 일관되게 뛰어난 성능를 보이며, DARC+는 일부 경우에서 성능이 열등함을 확인하여 온라인과 오프라인 데이터의 정교한 통합의 중요성을 강조한다.
- 제거 실험 결과, 다이내믹스 인식 Q-값 보정 기법이 필수적임을 입증하였으며, 이를 제거할 경우 특히 다이내믹스 격차가 큰 상황에서 성능 저하가 발생함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.