[논문 리뷰] Confidence-Conditioned Value Functions for Offline Reinforcement Learning
이 논문은 평가 중 동적 보수성을 가능하게 하기 위해 신뢰도 수준에 조건화된 가치 함수를 학습하는 오프라인 강화학습 방법인 Confidence-Conditioned Value Learning (CCVL)을 제안한다. 목표 신뢰도 수준에 조건화된 Q-값을 통해 CCVL는 정책이 온라인 관측 자료를 기반으로 보수성을 동적으로 조정할 수 있으며, 고정된 보수성 방법인 CQL보다 샘플 효율성과 최종 성능에서 뚜렷한 향상을 보인다.
Offline reinforcement learning (RL) promises the ability to learn effective policies solely using existing, static datasets, without any costly online interaction. To do so, offline RL methods must handle distributional shift between the dataset and the learned policy. The most common approach is to learn conservative, or lower-bound, value functions, which underestimate the return of out-of-distribution (OOD) actions. However, such methods exhibit one notable drawback: policies optimized on such value functions can only behave according to a fixed, possibly suboptimal, degree of conservatism. However, this can be alleviated if we instead are able to learn policies for varying degrees of conservatism at training time and devise a method to dynamically choose one of them during evaluation. To do so, in this work, we propose learning value functions that additionally condition on the degree of conservatism, which we dub confidence-conditioned value functions. We derive a new form of a Bellman backup that simultaneously learns Q-values for any degree of confidence with high probability. By conditioning on confidence, our value functions enable adaptive strategies during online evaluation by controlling for confidence level using the history of observations thus far. This approach can be implemented in practice by conditioning the Q-function from existing conservative algorithms on the confidence.We theoretically show that our learned value functions produce conservative estimates of the true value at any desired confidence. Finally, we empirically show that our algorithm outperforms existing conservative offline RL algorithms on multiple discrete control domains.
연구 동기 및 목표
- 기존의 보수성 정책이 정적 하이퍼파라미터에 의존하는 고정된 보수성의 한계를 해결하기 위해.
- 고정된 오프라인 튜닝이 아닌 관측된 데이터를 기반으로 온라인 평가 중 보수성의 동적 적응을 가능하게 하기 위해.
- 모든 원하는 신뢰도 수준에서 보수적인 추정치를 제공하는 실용적이고 이론적으로 타당한 가치 함수 학습 방법을 개발하기 위해.
- 실시간 관측 기록에 기반해 정책이 위험 수용 능력을 조정할 수 있도록 하여 오프라인 강화학습의 샘플 효율성과 최종 성능을 향상시키기 위해.
- 하나의 가치 함수가 하한 및 상한 추정치를 모두 학습함으로써 온라인 미세조정을 지원할 수 있도록 오프라인 강화학습을 확장하기 위해.
제안 방법
- 신뢰도 수준 δ에 조건화된 Q-값을 출력하는, 상태-행동 쌍에 대한 가치 함수를 제안하며, 이는 추정치가 진짜 수익의 하한이 되는 확률을 나타낸다.
- 모든 δ에 대해 보수적인 Q-값을 동시에 학습하기 위해, 보수성 인식 정규화 목표를 강제하는 새로운 벨먼 백업을 유도한다.
- 파라미터 공유와 분포형 강화학습 스타일의 헤드 아키텍처를 사용해 Q-네트워크에 δ를 조건화함으로써, 엔드 투 엔드 학습이 가능하도록 구현한다.
- 추론 시기 동안 관측 기록에 기반해 신뢰도 수준 δ를 조정함으로써, 과대추정이 나타날 경우 보수성을 줄일 수 있도록 정책을 허용한다.
- 프레임워크를 확장하여 하한 및 상한 추정치를 모두 학습함으로써, 개선된 탐색을 위한 온라인 미세조정을 가능하게 한다.
- CQL 스타일의 보수적 Q-학습 정규화를 사용하여, 반-탐색 보너스에 의존하지 않고도 모든 신뢰도 수준에서 보수적인 추정치를 보장한다.
실험 결과
연구 질문
- RQ1기존의 고정된 하이퍼파라미터에 의존하는 대신, 관측된 데이터에 기반해 오프라인 강화학습 정책이 평가 중 보수성 수준을 동적으로 조정할 수 있는가?
- RQ2신뢰도 수준에 조건화된 가치 함수 학습이 고정된 보수성 방법보다 오프라인 강화학습에서 더 높은 성능을 내는가?
- RQ3신뢰도 적응형 정책이 낮은 데이터 환경에서 샘플 효율성과 최종 성능을 향상시킬 수 있는가?
- RQ4제안된 방법이 표본 설정에서 어떤 신뢰도 수준에서도 보수적인 추정치를 보장하는 데 이론적으로 타당한가?
- RQ5신뢰도 조건화 프레임워크는 개선된 탐색을 위한 온라인 미세조정을 지원하도록 확장될 수 있는가?
주요 결과
- CCVL은 아케이드 환경에서 3가지 데이터 제약 조건(1%, 5%, 10%) 전반에서 CQL 및 REM을 모두 압도하며, 1% 데이터에서 최종 정규화된 IQM가 59.1로 CQL의 56.9보다 높게 기록되었다.
- 5% 데이터에서 CCVL는 정규화된 IQM 110.1을 기록하여 CQL(105.7)과 Fixed-CCVL(105.9)을 크게 앞서며, 적응형 신뢰도의 이점을 입증했다.
- 온라인 미세조정에서 CCVL은 5개 아케이드 게임 중 4개에서 가장 높은 최종 성능을 기록했으며, 아스테릭스에서 159.5 점(비교 기준 CQL 52.7점)을 기록해 추가 온라인 데이터로의 성능 향상이 뚜렷했다.
- 절단 실험 결과, 모두가 중요하다는 것이 확인되었으며, CCVL은 적응형 신뢰도 제어가 없는 Fixed-CCVL 및 AEVL보다 뛰어난 성능을 보였다.
- CCVL의 성능는 시드에 대해 매우 안정적이며, 95% 부트스트랩 신뢰구간을 통해 특히 낮은 데이터 환경에서 기준 모델들에 비해 일관되게 뛰어난 성능을 보였다.
- 하한 및 상한 추정치를 모두 학습함으로써, CCVL는 온라인 미세조정을 효과적으로 지원하며, 오프라인에서는 보수적인 행동을, 온라인에서는 낙관적인 탐색을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.