[논문 리뷰] Offline Reinforcement Learning with Pseudometric Learning
이 논문은 기록된 전이 데이터로부터 상태-행동 가짜거리( pseudometric )를 학습하여 분포 외 행동 외삽을 줄이는 오프라인 강화학습 방법인 PLOff을 제안한다. 이 가짜거리로 계산된 룩업 기반 보너스를 액터-크리틱 프레임워크에 통합함으로써, PLOff는 D4RL 수동 조작 및 이동 작업에서 정책 성능을 향상시켜 기존 최고 성능를 달성하거나 초월한다. 이는 새로운 사고적 거리 측정 기반의 성능 향상 방법이다.
Offline Reinforcement Learning methods seek to learn a policy from logged transitions of an environment, without any interaction. In the presence of function approximation, and under the assumption of limited coverage of the state-action space of the environment, it is necessary to enforce the policy to visit state-action pairs close to the support of logged transitions. In this work, we propose an iterative procedure to learn a pseudometric (closely related to bisimulation metrics) from logged transitions, and use it to define this notion of closeness. We show its convergence and extend it to the function approximation setting. We then use this pseudometric to define a new lookup based bonus in an actor-critic algorithm: PLOFF. This bonus encourages the actor to stay close, in terms of the defined pseudometric, to the support of logged transitions. Finally, we evaluate the method on hand manipulation and locomotion tasks.
연구 동기 및 목표
- 함수 근사가 사용될 때 오프라인 강화학습에서 분포 외 행동 외삽 문제를 해결하기 위해.
- 기존의 이분할 가짜거리 연구를 오프라인 및 상태-행동 설정으로 확장하여 기록된 전이 데이터로부터 임의의 작업에 관련된 가짜거리를 학습하기 위해.
- 이 가짜거리 기반 보너스 메커니즘을 설계하여 정책이 기록된 데이터의 지원에 가까이 머무르도록 유도하기 위해.
- 가짜거리 기반 보너스를 표준 액터-크리틱 알고리즘에 통합하여 샘플 효율성과 성능을 향상시키기 위해.
- 어려운 D4RL 벤치마크 작업에서 방법을 경험적으로 검증하여 기존 최고 수준의 오프라인 강화학습 방법과의 경쟁력을 입증하기 위해.
제안 방법
- 이 방법은 시아모이드 네트워크 구조를 영감으로 삼은 신경망 아키텍처를 사용하여 전이 데이터로부터 상태-행동 쌍에 대한 가짜거리를 학습하며, 기대 수익 차이를 기반으로 한 대비 손실을 통해 훈련한다.
- 가짜거리는 공유된 행동 시퀀스를 따라 누적 보상 차이를 기반으로 유사도를 측정하는 벨먼 유사 연산자의 固定점으로 정의된다.
- 학습된 가짜거리를 사용하여 룩업 기반 보너스를 계산하며, 기록된 전이의 지원에서 멀리 떨어진 행동을 제재한다.
- 보너스는 두 가지 방식으로 적용된다: 액터 업데이트 시 비가능한 행동을 걸러내기 위해, 그리고 크리틱 평가 시 분포 외 행동에 대해 높은 가치 예측을 제재하기 위해.
- 신경망 아키텍처를 통해 함수 근사를 확장하여 상태-행동 쌍을 동시에 임bedding하고 가짜거리를 계산한다.
- 훈련 절차는 반복적이며, 오프라인 데이터셋을 여러 번 통과하면서 가짜거리를 개선한다.
실험 결과
연구 질문
- RQ1오프라인 강화학습에서 기록된 전이의 지원에 가까운 정도를 측정하기 위해 학습된 상태-행동 쌍에 대한 가짜거리가 효과적으로 작용하는가?
- RQ2이러한 가짜거리를 기반으로 하여 함수 근사 설정에서 외삽 오차를 줄이는 실용적인 보너스를 설계할 수 있는가?
- RQ3제안된 PLOff 방법이 표준 벤치마크 환경에서 기존 오프라인 강화학습 알고리즘을 초월하는가?
- RQ4가짜거리 학습 절차가 표본 설정과 딥 러닝 설정 모두에서 안정적이고 수렴하는가?
- RQ5행동 복제나 분포 제약을 사용하는 방법과 비교해 PLOff의 성능은 어떠한가?
주요 결과
- PLOff는 D4RL 벤치마크의 수동 조작 스위트에서 최고 성능를 달성하여 기존 방법들을 능가한다.
- 이동 작업에서는 비교된 방법들 중 두 번째로 높은 순위를 기록하며 다양한 제어 환경에서 강력한 일반화 능력을 보여준다.
- 학습된 가짜거리는 MDP 내에서 구조적 유사성을 효과적으로 포착하여 분포 외 행동를 효과적으로 걸러내는 데 기여한다.
- 표본 설정에서는 수렴성을 보이며, 신경망을 통한 함수 근사로도 잘 일반화된다.
- 오프라인 설정에서 분포 제약이나 행동 복제보다 가짜거리 기반 보너스가 더 효과적인 인덕티브 바이어스를 제공한다.
- 낮은 데이터 환경에서 특히 강건성과 성능 향상에 기여함으로써, 룩업 보너스의 계산 비용이 정당화된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.