Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Diffusion Policies for Offline Reinforcement Learning

Bingyi Kang, Xiao Ma|arXiv (Cornell University)|2023. 05. 31.
Robotic Locomotion and Control인용 수 5
한 줄 요약

이 논문은 오프라인 강화학습에서 훈련 중에 손상된 상태로부터 행동을 근사함으로써 비용이 많이 드는 디퓨전 샘플링 체인을 피하는 방법인 효율적 디퓨전 정책(EDP)을 제안한다. EDP는 디퓨전-QL 대비 25배 빠른 훈련(5시간 대비 5일)을 달성하며, 표본 효율성과 일반화 능력 향상으로 인해 D4RL 모든 도메인에서 새로운 최고 성능을 기록한다.

ABSTRACT

Offline reinforcement learning (RL) aims to learn optimal policies from offline datasets, where the parameterization of policies is crucial but often overlooked. Recently, Diffsuion-QL significantly boosts the performance of offline RL by representing a policy with a diffusion model, whose success relies on a parametrized Markov Chain with hundreds of steps for sampling. However, Diffusion-QL suffers from two critical limitations. 1) It is computationally inefficient to forward and backward through the whole Markov chain during training. 2) It is incompatible with maximum likelihood-based RL algorithms (e.g., policy gradient methods) as the likelihood of diffusion models is intractable. Therefore, we propose efficient diffusion policy (EDP) to overcome these two challenges. EDP approximately constructs actions from corrupted ones at training to avoid running the sampling chain. We conduct extensive experiments on the D4RL benchmark. The results show that EDP can reduce the diffusion policy training time from 5 days to 5 hours on gym-locomotion tasks. Moreover, we show that EDP is compatible with various offline RL algorithms (TD3, CRR, and IQL) and achieves new state-of-the-art on D4RL by large margins over previous methods. Our code is available at https://github.com/sail-sg/edp.

연구 동기 및 목표

  • 긴 마르코프 체인을 통한 전방 및 역방향 전파가 필요한 오프라인 RL에서 디퓨전 정책 훈련의 계산 비효율성을 해결하기 위해.
  • 해당 가능성에 대한 로그우도가 필요한 알고리즘(예: IQL, CRR)과의 호환성을 보장하기 위해.
  • 복잡하고 다중 모달인 오프라인 데이터셋에서 표준 가우시안 정책보다 뛰어난 표본 효율성과 일반화 능력을 갖춘 일반적이고 효율적이며 확장 가능한 정책 파arameterization을 개발하기 위해.
  • 디퓨전 정책가 오프라인 RL 벤치마크에서 기존 방법보다 더 빠르고 효과적일 수 있음을 입증하기 위해.

제안 방법

  • EDP는 재패aram터라이제이션을 통해 손상된 행동에서 깨끗한 행동으로 매핑하는 노이즈 예측 네트워크를 학습하기 위해 소음 제거 디퓨전 확률 모델(DDPM)을 사용한다.
  • 전체 디퓨전 체인을 통한 샘플링 대신, 학습된 노이즈 예측 네트워크를 사용해 손상된 입력에서 행동을 재구성함으로써 훈련 계산을 크게 줄이는 행동 근사 기법을 도입한다.
  • 고정된 분산과 행동 근사에서 유도된 평균을 갖는 가우시안 분포를 사용해 정책의 우도를 근사함으로써, IQL 및 CRR와 같은 우도 기반 알고리즘과의 호환성을 확보한다.
  • 샘플링에 필요한 모델 호출 수를 줄임으로써 훈련 및 추론을 가속화하기 위해, ODE 기반 샘플러인 DPM-Solver를 통합한다.
  • 표본 품질 향상을 위해 추론 중에 에너지 기반 행동 선택(EAS)을 적용하였으며, 효율성과 성능의 균형을 고려해 10개의 행동을 사용한다.
  • TD3, CRR, IQL 등 다양한 오프라인 RL 알고리즘과 Gym-Locomotion, AntMaze, Adroit, Kitchen 등 다양한 도메인에서 평가하여 광범위한 호환성과 성능 향상을 입증한다.

실험 결과

연구 질문

  • RQ1디퓨전 정책의 훈련 시간을 성능 손실 없이 크게 줄일 수 있는가?
  • RQ2IQL 및 CRR와 같이 해석 가능한 로그우도가 필요한 우도 기반 RL 알고리즘과의 호환성을 확보할 수 있는가?
  • RQ3제안된 행동 근사 방법이 전체 디퓨전 샘플링 대비 표본 품질과 정책 성능을 유지하거나 향상시키는가?
  • RQ4EDP가 다양한 오프라인 RL 알고리즘과 벤치마크 환경에서 일반화되어 최고 성능을 달성할 수 있는가?

주요 결과

  • EDP는 D4RL Gym-Locomotion 작업에서 훈련 시간을 5일에서 5시간으로 줄여 디퓨전-QL 대비 25배 빠른 성능 향상을 달성한다.
  • EDP는 D4RL의 네 도메인 전반에서 새로운 최고 성능을 기록하였으며, RAT 지표 기준 평균 점수는 각각 Gym-Locomotion(85.5), AntMaze(63.0), Adroit(73.4), Kitchen(43.8)을 기록한다.
  • AntMaze, Adroit, Kitchen에서 EDP + IQL은 모든 베이스라인보다 평균 점수에서 10점 이상 높은 성능을 기록하여 복잡하고 다중 모달 작업에서 강력한 성능 향상을 입증한다.
  • TD3, CRR, IQL과 함께 사용할 때 EDP는 성능을 유지하거나 향상시키며, 모든 알고리즘과 환경에서 표준 가우시안 정책보다 호환성과 우수성을 보여준다.
  • 절단 분석 결과, OMS(최고) 점수는 훈련 불안정성으로 인해 오해의 소지가 있으며, RAT(평균)가 더 신뢰할 수 있는 평가 지표임을 확인한다.
  • DPM-Solver에서 15회의 모델 호출을 사용할 경우 근사 최적의 성능를 달성하며 뛰어난 효율성을 보이며, EAS에서 행동 수를 늘릴수록 9개 작업 중 8개에서 성능이 단조롭게 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.