[논문 리뷰] NeoRL: A Near Real-World Benchmark for Offline Reinforcement Learning
NeoRL은 다중 도메인, 유한 데이터 세트 및 추가 테스트 데이터를 갖춘 거의 실제 현장 offline RL 벤치마크를 제시하며, 결정적 행동 정책이 이러한 작업에서 많은 offline RL 방법과 종종 동등하거나 이를 상회하는 경향이 있음을 보여줍니다.
Offline reinforcement learning (RL) aims at learning a good policy from a batch of collected data, without extra interactions with the environment during training. However, current offline RL benchmarks commonly have a large reality gap, because they involve large datasets collected by highly exploratory policies, and the trained policy is directly evaluated in the environment. In real-world situations, running a highly exploratory policy is prohibited to ensure system safety, the data is commonly very limited, and a trained policy should be well validated before deployment. In this paper, we present a near real-world offline RL benchmark, named NeoRL, which contains datasets from various domains with controlled sizes, and extra test datasets for policy validation. We evaluate existing offline RL algorithms on NeoRL and argue that the performance of a policy should also be compared with the deterministic version of the behavior policy, instead of the dataset reward. The empirical results demonstrate that the tested offline RL algorithms become less competitive to the deterministic policy on many datasets, and the offline policy evaluation hardly helps. The NeoRL suit can be found at http://polixir.ai/research/neorl. We hope this work will shed some light on future research and draw more attention when deploying RL in real-world systems.
연구 동기 및 목표
- 실세계의 안전 의식이 필요한 환경에서 제한된 데이터로 offline RL을 동기부여한다.
- 다양한 도메인에 걸친 통합적이고 거의 실제 현장 벤치마크 스위트를 제공한다.
- 기존의 offline RL 방법을 평가하고 이를 결정적 행동 정책과 비교한다.
- 이러한 현실적 맥락에서 offline 정책 평가(OPE)의 제한된 유용성을 강조한다.
- 배포 준비가 된 RL 연구를 안내할 데이터세트와 평가 프로토콜을 제시한다.
제안 방법
- 다양한 도메인에서 데이터 규모를 제어할 수 있는 거의 실제 현장 offline RL 데이터세트를 구성하고 정책 검증용 추가 테스트 데이터세트를 더한다.
- 전문가, 저/중/높은 수익의 다층 정책을 생성하고, 현실 세계의 데이터 분포를 시뮬레이션하기 위해 노이즈를 주입한 부적합 정책으로 학습 데이터를 수집한다.
- 상태, 행동, 보상, 다음 상태, 보상 함수 인터페이스를 각 작업별로 접근할 수 있는 통합 API를 제공한다.
- 결정적 행동 정책과 전문가에 대해 모델 프리 및 모델 기반 offline RL 방법을 벤치마크한다.
- 최종 정책 순위를 위한 온라인 평가와 offline 모델 선정을 위한 FQE를 사용한 오프라인 평가를 포함하고, 데이터 지원 영역에 근접하게 유지하기 위한 KL 제약 및 섭동 메커니즘을 도입한다.
실험 결과
연구 질문
- RQ1현실에 근접한 offline 벤치마크에서 현재의 offline RL 방법이 결정적 버전의 행동 정책보다 뛰어난가?
- RQ2데이터 품질 및 양이 현실적 작업에서 모델-free 대 모델-기반 offline RL 방법의 상대적 성능에 어떤 영향을 미치는가?
- RQ3FQE와 같은 offline 정책 평가 방법이 거의 실제 현장 데이터셋에서 정책을 신뢰성 있게 순위를 매기고 모델 선택을 안내할 수 있는가?
- RQ4행동 정책과의 근접성( KL 페널티나 섭동 제약)을 강제하는 것이 offline RL 성능에 어떤 영향을 주는가?
- RQ5로봇공학, 산업, 금융, 도시 관리 등 다양한 도메인이 offline RL 알고리즘의 효과성에 어떤 영향을 미치는가?
주요 결과
- BC가 NeoRL 작업에서 많은 offline RL 방법을 능가하거나 동일하게 맞추는 경우가 많아 결정적 행동 정책의 강력한 베이스라인을 시사한다.
- CQL은 여러 offline 방법 중 약 3분의 1 수준의 작업에서 최상으로 나타나지만 MuJoCo 및 IB 환경에서 결정적 정책에 비해 이득이 제한된다.
- 모델 기반 방법은 적절한 제약(KL 등) 없이 낮은 성능을 보일 수 있으며 모델 악용으로 인한 문제가 발생할 수 있지만, MOPO의 앙상블은 일부 작업에서 이를 완화할 수 있다.
- MOPO는 특정 작업(예: HalfCheetah 변형)에서 상당한 개선을 보이지만, 롤아웃 길이와 페널티 하이퍼파라미터에 민감하다.
- FQE를 통한 오프라인 모델 선택은 정책의 순위를 매길 수 있지만 온라인 평가를 능가하지 못하는 경우가 많아 오프라인 평가 신뢰성의 도전에 직면한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.