Skip to main content
QUICK REVIEW

[논문 리뷰] Double Check Your State Before Trusting It: Confidence-Aware Bidirectional Offline Model-Based Imagination

Jiafei Lyu, Xiu Li|arXiv (Cornell University)|2022. 06. 16.
Reinforcement Learning in Robotics인용 수 11
한 줄 요약

이 논문은 모델-프리 오프라인 강화학습의 성능을 햖을 수 있도록 신뢰할 수 있는 합성 전이를 생성하는 이중 확인 메커니즘을 통해 신뢰도 높은 합성 전이를 생성하는 데이터 증강 방법인 Confidence-Aware Bidirectional Offline Model-Based Imagination (CABI)을 제안한다. 이는 전방 및 후방 역학 모델이 모두 일치하는 상태만 신뢰한다. CABI는 D4RL 벤치마크에서 최신 기술을 뛰어넘는 성능을 크게 향상시킨다.

ABSTRACT

The learned policy of model-free offline reinforcement learning (RL) methods is often constrained to stay within the support of datasets to avoid possible dangerous out-of-distribution actions or states, making it challenging to handle out-of-support region. Model-based RL methods offer a richer dataset and benefit generalization by generating imaginary trajectories with either trained forward or reverse dynamics model. However, the imagined transitions may be inaccurate, thus downgrading the performance of the underlying offline RL method. In this paper, we propose to augment the offline dataset by using trained bidirectional dynamics models and rollout policies with double check. We introduce conservatism by trusting samples that the forward model and backward model agree on. Our method, confidence-aware bidirectional offline model-based imagination, generates reliable samples and can be combined with any model-free offline RL method. Experimental results on the D4RL benchmarks demonstrate that our method significantly boosts the performance of existing model-free offline RL algorithms and achieves competitive or better scores against baseline methods.

연구 동기 및 목표

  • 모델-프리 오프라인 강화학습에서 분포 외 상태-행동 일반화 문제를 해결하기 위해.
  • 자주 정확도가 떨어지는 역학 모델로 인해 발생하는 모델 기반 오프라인 강화학습의 합성 궤적 신뢰도를 향상시키기 위해.
  • 이중 역학 모델링을 통해 검증된 보수적인, 신뢰도 기반 메커니즘을 도입하기 위해.
  • 아ーイ텍처 변경 없이도 어떤 모델-프리 오프라인 강화학습 알고리즘도 고품질의 신뢰할 수 있는 합성 롤아웃의 이점을 얻을 수 있도록 하기 위해.
  • D4RL과 같은 실제 세계 강화학습 벤치마크에서 더 뛰어난 샘플 효율성과 성능을 달성하기 위해 전방 및 후방 모델 간의 이중 확인 일致성 활용하기 위해.

제안 방법

  • 양방향 역학 모델 훈련: 전방 모델은 다음 상태를 예측하고, 후방 모델은 미래 상태로부터 이전 상태를 재구성한다.
  • 전방 및 후방 롤아웃을 사용하여 합성 궤적을 생성하고, 생성된 전이를 검증하기 위해 이중 확인 메커니즘을 적용한다.
  • 원래 상태와 후방 추적 후 재구성된 상태 간의 유사도를 기반으로 신뢰도 점수를 정의한다: 후방 모델이 원래 상태를 잘 복원하면 전방 모델이 생성한 상태를 신뢰한다.
  • 보수적인 데이터 증강 전략 도입: 전방 및 후방 모델이 일치하는 전이만 포함하여 신뢰도를 확보한다.
  • 기존의 오프더쉐프 모델-프리 오프라인 강화학습 알고리즘(예: BCQ, TD3_BC)과 증강된 데이터셋을 통합하여 정책 학습을 향상시킨다.
  • 원래 상태와 후방 추적 상태 간의 재구성 오차를 최소화하기 위해 전방 및 후방 역학 모델을 함께 훈련하기 위한 일致성 손실을 사용한다.

실험 결과

연구 질문

  • RQ1이중 역학 모델링이 오프라인 강화학습에서 합성 롤아웃의 신뢰도를 향상시키는 데 기여하는가?
  • RQ2전방 및 후방 모델 일치 기반의 이중 확인 메커니즘이 더 보수적이고 일반화 능력이 뛰어난 정책을 도출하는가?
  • RQ3이 방법이 아키텍처 수정 없이 기존의 모델-프리 오프라인 강화학습 알고리즘의 성능을 크게 향상시킬 수 있는가?
  • RQ4기본 벤치마크에서 최신 기술의 모델-프리 및 모델 기반 오프라인 강화학습 접근법과 비교해 볼 때 이 방법은 어떻게 성능을 내는가?
  • RQ5신뢰도 기반 데이터 증강이 오프라인 강화학습에서 분포 이탈 문제를 얼마나 효과적으로 완화하고 일반화 능력을 향상시키는가?

주요 결과

  • CABI+BCQ는 Adroit pen-클론 태스크에서 54.7 ± 2.0의 정규화 평균 점수를 기록하여 BCQ(44.0) 및 기타 베이스라인을 크게 앞서며 성능을 뛰어넘었다.
  • MuJoCo Halfcheetah-medium 태스크에서 CABI+TD3_BC는 45.1 ± 0.1의 점수를 기록하여 TD3_BC(42.8 ± 0.3)를 초월했고, 대부분의 다른 방법들과 비교해도 유사하거나 뛰어난 성능을 보였다.
  • CABI+TD3_BC는 D4RL MuJoCo 벤치마크에서 총 점수 1020.7을 기록하여 다음으로 높은 성능을 낸 방법(FisherBRC, 974.6)을 능가했고, 일부 설정에서는 전문가 수준의 베이스라인을 초월했다.
  • hopper-expert 및 walker2d-expert 태스크에서 CABI+TD3_BC는 각각 112.4 ± 0.1 및 108.6 ± 1.5의 점수를 기록하여 전문가 성능에 가까이 도달하거나 초월했고, CQL 및 MOPO를 모두 능가했다.
  • 이 방법은 인간의 시범 및 전문가 시범이 포함된 모든 D4RL 벤치마크 태스크에서 경쟁력 있거나 뛰어난 성능을 기록하며 강력한 일반화 능력을 입증했다.
  • 제거 실험 결과는 이중 확인 메커니즘이 필수적임을 확인했다: 이를 제거할 경우 성능 저하가 발생했으며, 이는 안정적인 데이터 생성을 위해 이중 일치성의 필요성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.