[논문 리뷰] Offline RL Policies Should be Trained to be Adaptive
이 논문은 오프라인 강화학습(RL) 정책이 순수하게 보수적인 것보다 적응형이어야 한다고 주장한다. 제한된 데이터셋에서 발생하는 지식적 불확실성은 암묵적인 부분 관측 문제를 유도하며, 이는 이력 기반의 적응이 필요하게 만든다. 저자들은 추론 중에 가치 함수들 사이에서 적응적으로 선택하는, 앙상블 기반의 APE-V를 제안한다. 이는 Procgen Mazes와 D4RL와 같은 오프라인 RL 벤치마크에서 보수적 기준선을 능가하는 우수한 성능을 달성하며, 동적 전략 전환을 통해 성능을 향상시킨다.
Offline RL algorithms must account for the fact that the dataset they are provided may leave many facets of the environment unknown. The most common way to approach this challenge is to employ pessimistic or conservative methods, which avoid behaviors that are too dissimilar from those in the training dataset. However, relying exclusively on conservatism has drawbacks: performance is sensitive to the exact degree of conservatism, and conservative objectives can recover highly suboptimal policies. In this work, we propose that offline RL methods should instead be adaptive in the presence of uncertainty. We show that acting optimally in offline RL in a Bayesian sense involves solving an implicit POMDP. As a result, optimal policies for offline RL must be adaptive, depending not just on the current state but rather all the transitions seen so far during evaluation.We present a model-free algorithm for approximating this optimal adaptive policy, and demonstrate the efficacy of learning such adaptive policies in offline RL benchmarks.
연구 동기 및 목표
- 오프라인 RL에서 보수적이고 정적 정책에 대한 일반적인 의존성을 도전하며, 이는 보수성 초파라미터에 민감하여 최적화되지 않을 수 있기 때문이다.
- 지식적 불확실성이 암묵적인 부분 관측을 유도하는 바이어스 문제로 오프라인 RL을 공식화하며, 이는 적응형 정책이 필요하게 만든다.
- 오프라인 RL에서 내부 에피소드 적응을 가능하게 하는 실용적인 알고리즘을 개발하여, 정적 정책보다 평가 시 성능을 향상시킨다.
- 데이터가 부족한 환경에서도 적응형 정책이 보수적 정책을 능가할 수 있음을 보여주며, 가치 함수 가설들 사이에서 동적으로 선택하는 방식으로 이를 실현한다.
제안 방법
- 지식적 불확실성에 의해 유도되는 POMDP로 오프라인 RL을 공식화하며, 에이전트의 MDP에 대한 믿음은 관측된 전이에 따라 변화한다.
- 이력 기반의 적응형 정책를 위한 정책 기울기 목적함수를 유도하며, MDP의 사후분포와 가치 함수의 분포를 사용해 불확실성을 모델링한다.
- APE-V를 제안한다. 이는 모델리스 알고리즘으로, Q-함수의 앙상블을 유지하고 평가 중에 이들의 믿음 분포를 사용해 행동 선택을 이끈다.
- 관측된 전이에 기반해 믿음 상태를 동적으로 업데이트함으로써 내부 에피소드 적응을 구현하며, 초기 예측이 잘못되었을 경우 전략을 전환할 수 있도록 한다.
- 암묵적 POMDP 목적함수를 사용해 적응형 정책을 최적화하는 정책 기울기 업데이트를 적용하며, 이는 데이터셋과 평가 중 실시간 피드백 양쪽에서 학습할 수 있도록 한다.
- SAC-n을 기반 가치 함수 학습기로 사용하고 CQL 및 SAC-n과 같은 보수적 기준선과 비교하여, Procgen Mazes와 D4RL를 포함한 오프라인 RL 벤치마크에 이 방법을 적용한다.
실험 결과
연구 질문
- RQ1평가 중 새로운 정보에 적응할 수 없는 정적 보수적 정책은 오프라인 RL에서 보수성 초파라미터 민감성으로 인해 임의로 열등해질 수 있는가?
- RQ2데이터셋의 불확실성에서 기인하는 암묵적 부분 관측은 오프라인 RL에서 적응 행동을 필수로 하는가?
- RQ3모델리스 앙상블 기반 방법이 오프라인 RL에서 베이즈 최적의 적응형 정책을 효과적으로 근사할 수 있는가?
- RQ4가치 함수에 대한 믿음 업데이트를 사용한 내부 에피소드 적응은 정적 보수적 정책보다 평가 시 성능을 향상시키는가?
- RQ5어떤 환경에서 적응은 보수성보다 상당한 이점을 제공하는가?
주요 결과
- APE-V는 Procgen 환경에서 보류된 미로를 해결하는 데 79%의 성공률을 기록하며, 보수적 및 비적응적 방법을 모두 능가한다.
- 단지 200개의 훈련용 미로만 있는 저데이터 환경에서 APE-V는 보류된 미로에서 31%의 성공률을 기록했으며, 보수적 방법은 23%였다.
- D4RL에서 APE-V는 중간 성능 및 중간 재생 데이터셋에서 SAC-n과 CQL을 능가하며, 앙상블 구성원 중 어느 하나의 평균 수익보다도 높은 평균 수익을 달성했다.
- D4RL에서의 적응형 정책는 항상 고정된 가치 함수 선택보다 성능이 뛰어나며, 평가 중 동적 믿음 업데이트의 이점을 입증한다.
- 데이터 분포의 모호성이 낮은 과제, 예를 들어 전문가나 무작위 정책이 수집한 데이터에서는 적응이 약간의 성능 향상만을 제공하며, 이는 여러 가설이 덜 두드러지기 때문이다.
- 결과는 정적 정책가 불확실성 하에서 임의로 열등해질 수 있기 때문에 최적의 오프라인 RL 성능을 위해서는 적응이 필수적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.