Skip to main content
QUICK REVIEW

[논문 리뷰] Bellman-consistent Pessimism for Offline Reinforcement Learning

Tengyang Xie, Ching-An Cheng|arXiv (Cornell University)|2021. 06. 13.
Reinforcement Learning in Robotics참고 문헌 39인용 수 16
한 줄 요약

이 논문은 오프라인 강화학습에서 벨만 방정식을 만족하는 가치 함수에 대해 편향을 적용하는 벨만 일관성 있는 편향성 접근법을 제안한다. 이는 개별 가치 추정치에 대해 보너스를 부여하는 방식이 아닌, 가치 함수 전체에 대해 편향을 적용한다. 선형 MDP에서 기존 보너스 기반 방법에 비해 샘플 복잡도를 O(d)만큼 향상시키며, 하이퍼파rameter 조정 없이도 최적의 편향-분산 트레이드오프에 자동으로 적응한다.

ABSTRACT

The use of pessimism, when reasoning about datasets lacking exhaustive exploration has recently gained prominence in offline reinforcement learning. Despite the robustness it adds to the algorithm, overly pessimistic reasoning can be equally damaging in precluding the discovery of good policies, which is an issue for the popular bonus-based pessimism. In this paper, we introduce the notion of Bellman-consistent pessimism for general function approximation: instead of calculating a point-wise lower bound for the value function, we implement pessimism at the initial state over the set of functions consistent with the Bellman equations. Our theoretical guarantees only require Bellman closedness as standard in the exploratory setting, in which case bonus-based pessimism fails to provide guarantees. Even in the special case of linear function approximation where stronger expressivity assumptions hold, our result improves upon a recent bonus-based approach by $\mathcal{O}(d)$ in its sample complexity when the action space is finite. Remarkably, our algorithms automatically adapt to the best bias-variance tradeoff in the hindsight, whereas most prior approaches require tuning extra hyperparameters a priori.

연구 동기 및 목표

  • 보너스 기반 편향성 접근법이 일반화 능력이 열 劣하여 성능이 떨어질 수 있는 문제점을 해결하기 위해.
  • 일반 함수 근사와 호환되며, 데이터셋에 대한 커버리지 가정이 필요 없는 이론적으로 탄탄한 편향성 메커니즘을 개발하기 위해.
  • 표준적인 탐색 설정에서 자주 사용되는 '벨만 닫힘' 조건만으로도 강력한 이론적 보장을 제공하기 위해.
  • 특히 행동 공간이 작을 경우, 최신 보너스 기반 접근법에 비해 선형 MDP에서 샘플 복잡도를 O(d)만큼 향상시키기 위해.
  • 사전 하이퍼파rameter 조정 없이도 뒤이어 최적의 편향-분산 트레이드오프에 자동으로 적응하는 실용적인 알고리즘을 설계하기 위해.

제안 방법

  • 벨만 방정식을 만족하는 가치 함수 전체에 대해 편향을 적용하는 새로운 편향성 원칙을 제안한다. 이는 개별 가치 추정치에 대한 편향 적용이 아니라, 전체 가치 함수 집합에 대해 적용한다.
  • 정보 이론적 설정을 통해 데이터 기반의 최악의 MDP에서 임의의 비교 정책에 대한 회귀를 최소화하는 방식으로, 정보 이론적 접근을 사용한다.
  • 라그랑주 승수를 활용한 유도와 부드러운 정책 반복을 통해 계산적으로 효율적인 변형을 개발하며, 가치 함수 클래스 위에서 정규화된 손실 최소화 오라클에 의존한다.
  • 값 함수 갱신에 대해 닫힌 형태의 해를 유도하여, LSTDQ를 일반화하고 초기 상태에 대한 페널티 항을 통해 편향성을 통합한다.
  • 행렬 대수와 SVD 기반 증명을 활용하여 목적함수의 헤시안이 양의 준정부호임을 증명함으로써 수렴성을 보장한다.
  • 무한한 정규화 조건에서 LSTDQ와의 연결을 분석하여, 편향성이 제거된 경우 표준 LSTDQ로 수렴함을 보여준다.

실험 결과

연구 질문

  • RQ1오프라인 RL에서 편향성 접근법을 개별 가치 추정치에 적용하는 대신, 벨만 방정식과 일관된 방식으로 재정의할 수 있는가?
  • RQ2선형 MDP에서 벨만 일관성 있는 편향성 접근법이 보너스 기반 방법보다 더 낮은 샘플 복잡도를 달성할 수 있는가?
  • RQ3제안된 방법이 커버리지 가정 없이도 '벨만 닫힘' 조건만으로도 이론적 보장을 제공할 수 있는가?
  • RQ4알고리즘이 수동적인 하이퍼파rameter 조정 없이도 최적의 편향-분산 트레이드오프에 자동으로 적응할 수 있는가?
  • RQ5라그랑주 승수를 통한 실용적 구현 방식이 정보 이론적 설정에 비해 성능과 안정성 면에서 어떻게 비교되는가?

주요 결과

  • 정보 이론적 알고리즘은 표준 커버리지 가정 하에서의 성능과 동일한 회귀 한계를 달성하지만, 이를 요구하지 않는다.
  • 선형 MDP 설정에서, 가장 잘 알려진 보너스 기반 방법에 비해 샘플 복잡도가 O(d)만큼 향상된다.
  • 라그랑주 승수와 부드러운 정책 반복을 기반으로 한 실용적 알고리즘은 효율적이며, 가치 함수 클래스 위에서 손실 최소화 오라클을 통해 구현 가능하다.
  • 이 방법은 뒤이어 최적의 편향-분산 트레이드오프에 자동으로 적응하여 사전 하이퍼파rameter 조정이 필요 없어진다.
  • 닫힌 형태의 해는 LSTDQ를 일반화하며, 편향성 페널티가 제거되면 표준 LSTDQ로 수렴한다.
  • 이론적 분석을 통해 헤시안이 양의 준정부호임을 확인하여 최적화 절차의 수렴성이 보장된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.