[논문 리뷰] Offline Imitation Learning with Variational Counterfactual Reasoning
이 논문은 저자원 전문가 데이터 환경에서 정책 일반화를 크게 향상시키기 위해 가려진 변동형 오토인코더를 사용해 반사적 전문가 경로를 생성하는 새로운 오프라인 타도미메이션 학습 프레임워크인 OILCA를 제안한다. 이 방법은 인과 기반으로 분리된 데이터 합성으로 인해 강건성을 향상시켜, 분포 내(DeepMind Control Suite) 및 분포 외(CausalWorld) 벤치마크에서 강력한 기준 모델들을 능가한다.
In offline imitation learning (IL), an agent aims to learn an optimal expert behavior policy without additional online environment interactions. However, in many real-world scenarios, such as robotics manipulation, the offline dataset is collected from suboptimal behaviors without rewards. Due to the scarce expert data, the agents usually suffer from simply memorizing poor trajectories and are vulnerable to variations in the environments, lacking the capability of generalizing to new environments. To automatically generate high-quality expert data and improve the generalization ability of the agent, we propose a framework named \underline{O}ffline \underline{I}mitation \underline{L}earning with \underline{C}ounterfactual data \underline{A}ugmentation (OILCA) by doing counterfactual inference. In particular, we leverage identifiable variational autoencoder to generate extit{counterfactual} samples for expert data augmentation. We theoretically analyze the influence of the generated expert data and the improvement of generalization. Moreover, we conduct extensive experiments to demonstrate that our approach significantly outperforms various baselines on both extsc{DeepMind Control Suite} benchmark for in-distribution performance and extsc{CausalWorld} benchmark for out-of-distribution generalization. Our code is available at \url{https://github.com/ZexuSun/OILCA-NeurIPS23}.
연구 동기 및 목표
- 제한된 전문가 시범 데이터가 존재할 때 오프라인 타도미메이션 학습에서 낮은 일반화 성능을 해결하기 위해.
- 라벨이 없는 오프라인 데이터 내에서 최적화되지 않거나 노이즈가 있는 경로로 인한 성능 저하를 완화하기 위해.
- 온라인 상호작용 없이도 분포 내 및 분포 외 환경에서 정책 일반화를 향상시키기 위해.
- 반사적 추론을 통한 고품질, 인과적으로 타당한 전문가 데이터 생성을 위한 이론적으로 탄탄한 방법을 개발하기 위해.
제안 방법
- 프레임워크는 전문가 데이터의 잠재적 구조를 모델링하고 외생 변수를 조작하여 반사적 상태를 생성하기 위해 식별 가능한 변동형 오토인코더(VAE)를 사용한다.
- 반사적 경로는 수정된 상태에 조건을 줌으로써 VAE를 조작하여 '만약에' 시나리오를 시뮬레이션한다.
- 외생 변수가 관측되지 않은 환경적 변동을 기록하는 인과적 구조를 구조적 인과 모델(SCM)을 통해 도입한다.
- 생성된 반사적 전문가 데이터는 학습 세트를 증강하는 데 사용되며, 분포 이동에 대한 정책의 강건성을 향상시킨다.
- 이론적 분석은 외생 변수의 분리가 반사적 결과의 식별 가능성을 보장하고 일반화 오차를 제한함을 보여준다.
- 증강된 데이터의 영향을 평가하기 위해 샘플러 정책을 사용하여 생성된 경로가 다양하고 행동적으로 일관되도록 보장한다.
실험 결과
연구 질문
- RQ1제한된 전문가 데이터에서 반사적 추론이 오프라인 타도미메이션 학습의 정책 일반화를 향상시킬 수 있는가?
- RQ2온라인 상호작용 없이도 열악한 오프라인 데이터셋에서 고품질, 인과적으로 타당한 전문가 데이터를 어떻게 생성할 수 있는가?
- RQ3반사적 데이터 증강이 정책 일반화 오차 경계에 미치는 이론적 영향은 무엇인가?
- RQ4VAE 내 외생 변수의 분리가 생성된 경로의 품질과 다양성에 어떤 영향을 미치는가?
- RQ5제안된 방법은 분포 내 및 분포 외 일반화 설정 모두에서 기존 오프라인 IL 기준 모델을 능가하는가?
주요 결과
- DeepMind Control Suite 벤치마크에서 OILCA는 분포 내 일반화에서 최고 성능을 기록하며, ORIL 및 DWBC를 포함한 모든 기준 모델을 능가한다.
- CausalWorld 벤치마크에서 OILCA는 모든 작업의 평균 수익에서 최고를 기록했으며, Stacked Blocks 작업에서 BC-exp 대비 2.6배 향상된 성과(2617.71 ± 88.07 vs. 1000.00 ± 0.00)를 기록했다.
- OILCA는 오차 누적 문제로 어려움을 겪는 BCND와 과도하게 보수적인 정규화로 어려움을 겪는 LobsDICE를 크게 능가한다.
- CausalWorld의 Reaching 작업에서 OILCA는 976.60 ± 20.13의 수익을 기록했으며, 이는 두 번째로 좋은 방법(DWBC: 479.92 ± 18.75)의 두 배 이상이다.
- Towers 작업에서 OILCA는 994.82 ± 5.76의 성과를 기록했으며, 다음으로 좋은 방법(768.68 ± 24.77)보다 225점 이상 높았다.
- 제거 실험 결과는 반사적 데이터 증강이 필수적임을 확인했으며, 이를 제거하면 표준 행동 복제와 유사한 성능 저하가 발생한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.