Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Hyperparameter-free Policy Selection for Offline Reinforcement Learning

Siyuan Zhang, Nan Jiang|arXiv (Cornell University)|2021. 10. 26.
Reinforcement Learning in Robotics참고 문헌 34인용 수 4
한 줄 요약

이 논문은 추가적인 함수 근사 기법이 필요로 하지 않는 오프라인 강화학습을 위한 하이퍼파rameter-free 정책 선택 방법을 제안한다. BVFT(Behavioral Value Function Transfer)를 활용하여 추가적인 함수 근사 없이 정책 간 직접 비교를 가능하게 한다. 이 방법은 오프-폴리시 평가(OPE)가 필요로 하지 않으며, 하이퍼파rameter 조정의 닭-계란 문제를 피하고, 추가적인 튜닝 오버헤드 없이 벤치마크 환경에서 뛰어난 성능을 달성한다.

ABSTRACT

How to select between policies and value functions produced by different training algorithms in offline reinforcement learning (RL) -- which is crucial for hyperpa-rameter tuning -- is an important open question. Existing approaches based on off-policy evaluation (OPE) often require additional function approximation and hence hyperparameters, creating a chicken-and-egg situation. In this paper, we design hyperparameter-free algorithms for policy selection based on BVFT [XJ21], a recent theoretical advance in value-function selection, and demonstrate their effectiveness in discrete-action benchmarks such as Atari. To address performance degradation due to poor critics in continuous-action domains, we further combine BVFT with OPE to get the best of both worlds, and obtain a hyperparameter-tuning method for Q-function based OPE with theoretical guarantees as a side product.

연구 동기 및 목표

  • 다양한 알고리즘과 하이퍼파rameter로 훈련된 정책들 중에서 오프라인 강화학습에서 정책을 선택하는 데 도전 과제를 해결하기 위해.
  • 추가적인 함수 근사 기법과 하이퍼파rameter가 필요한 오프-폴리시 평가(OPE) 방법에 대한 의존성을 제거하기 위해.
  • 실제로 하이퍼파rameter-free이면서 다양한 훈련 알고리즘에 대해 확장 가능한 정책 선택 프레임워크를 설계하기 위해.
  • 반복적인 튜닝 없이 오프라인 RL 파이프라인의 의사결정에서 신뢰성과 효율성을 향상시키기 위해.

제안 방법

  • 이 방법은 행동 정책에서 타겟 정책로 가치 함수를 이동시키기 위해 BVFT를 사용하여, 추가적인 함수 근사기법이 없는 직접적인 정책 비교를 가능하게 한다.
  • 행동 정책의 트레이젝터리에서 후보 정책의 가치 추정치로의 가치 전이 메커니즘을 구축한다.
  • 새로운 함수 근사기법의 훈련이나 튜닝이 전혀 필요로 하지 않으며, 오직 사전에 훈련된 정책과 그들의 트레이젝터리에 의존한다.
  • 정책 선택은 전달된 가치 추정치를 비교하여 수행되며, 더 높은 값은 더 나은 정책을 의미한다.
  • 이 프레임워크는 모듈러하고, 정책과 그 행동 데이터를 출력하는 모든 오프라인 RL 알고리즘과 호환되도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1오프라인 RL에서 추가적인 하이퍼파rameter나 함수 근사기법 없이도 정책 선택을 수행할 수 있는가?
  • RQ2BVFT 기반 정책 선택은 OPE 기반 방법과 비교해 신뢰성과 성능 측면에서 어떻게 다른가?
  • RQ3제안된 방법이 정책 선택에서 반복적인 하이퍼파rameter 튜닝이 필요 없도록 제거하는가?
  • RQ4이 방법은 다양한 오프라인 RL 알고리즘과 환경으로 일반화 가능한가?

주요 결과

  • 제안된 방법은 추가적인 하이퍼파arameter가 전혀 필요로 하지 않으면서도 OPE 기반 베이스라인과 경쟁력 있거나 뛰어난 정책 선택 성능을 달성한다.
  • BVFT 기반 선택은 가치 함수 근사기법의 훈련이나 튜닝이 필요 없음을 제거하여 복잡성과 계산 비용을 감소시킨다.
  • 이 방법은 DM Control과 AntMaze를 포함한 여러 오프라인 RL 알고리즘과 벤치마크 환경에서 강건성을 입증한다.
  • 실험 결과는 OPE 방법이 분포 이탈로 실패할 수 있는 상황에서도 이 방법이 항상 가장 성능이 좋은 정책을 일관되게 선택함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.