[논문 리뷰] Causal Imitation Learning with Unobserved Confounders
본 논문은 관찰되지 않은 혼동 변수로 인해 시연자와 학습자가 서로 다른 공변량을 관찰하는 상황에서 모방학습에 대한 인과적 프레임워크를 개발하고, 시연으로부터 모방 정책을 학습하기 위한 그래프적 기준과 실용적 알고리즘을 제시한다.
One of the common ways children learn is by mimicking adults. Imitation learning focuses on learning policies with suitable performance from demonstrations generated by an expert, with an unspecified performance measure, and unobserved reward signal. Popular methods for imitation learning start by either directly mimicking the behavior policy of an expert (behavior cloning) or by learning a reward function that prioritizes observed expert trajectories (inverse reinforcement learning). However, these methods rely on the assumption that covariates used by the expert to determine her/his actions are fully observed. In this paper, we relax this assumption and study imitation learning when sensory inputs of the learner and the expert differ. First, we provide a non-parametric, graphical criterion that is complete (both necessary and sufficient) for determining the feasibility of imitation from the combinations of demonstration data and qualitative assumptions about the underlying environment, represented in the form of a causal model. We then show that when such a criterion does not hold, imitation could still be feasible by exploiting quantitative knowledge of the expert trajectories. Finally, we develop an efficient procedure for learning the imitating policy from experts' trajectories.
연구 동기 및 목표
- 전문가 입력이 관찰되지 않은 공변량의 영향을 받고 보상이 잠재된 경우에 모방학습을 동기 부여한다.
- 인과 다이어그램과 관찰 데이터로부터 모방 가능성을 평가하는 완전한 그래프 기준을 제시한다.
- 모방 가능성이 식별적으로 성립하지 않을 때에도 모방 정책을 식별하기 위한 충분한 알고리즘을 개발한다.
- 명시적 인과 매개변수를 통한 모방 정책 학습 및 합성 데이터에서의 검증에 대한 실용적 절차를 제시한다.
제안 방법
- 관찰된 내생 변수와 잠재 변수를 모델링하기 위해 부분 관찰 구조적 인과 모델(POSCMs)을 도입한다.
- 잠재 보상을 가진 정책에 대한 식별가능성과 모방가능성의 정의를 한다.
- 모방이 가능할 때를 위한 Global 및 backdoor 기반 기준(직접 부모에 의한 모방, π-백도어에 의한 모방)을 입증한다.
- 모방 도구(대리변수 및 식별 가능한 부분공간)를 탐색하고 P(s|do(π)) = P(s)를 풀어 정책을 학습하는 Imitate 알고리즘을 도입한다.
- P(s|do(π))가 식별된 부분공간 내에서 식별 가능하고 표준 밀도 추정이나 선형 방정식 시스템으로 해결되는 실용적 최적화 프레임워크를 제공한다.
- 대리변수 선택, 도구 식별 및 모방 정책를 얻기 위한 최적화 구현 절차를 개략적으로 제시한다.
실험 결과
연구 질문
- RQ1보상이 잠재적이고 혼동이 존재할 때 그래프적 조건으로 전문가의 보상을 모방하는 것이 가능해지는가?
- RQ2백도어 유사 기준과 관찰 데이터를 활용하여 전문가의 정책이 학습자의 정책 공간 밖에 있을 때 모방 정책을 구성하는 방법은?
- RQ3대리변수와 식별 가능한 부분공간을 어떻게 활용하여 POSCM에서 전문가의 성능을 복제하는 정책을 학습할 수 있는가?
- RQ4실수 값 관찰 분포를 사용하여 모방 정책을 효율적으로 찾을 수 있는 실용적 알고리즘은 무엇인가?
주요 결과
- 완전한 그래프 기준(직접 부모에 의한 모방)은 인과 그래프와 정책 공간에 근거하여 모방이 가능함을 식별한다.
- 두 번째 기준(π-백도어에 의한 모방)은 관찰 데이터를 사용한 정책 기반 모방을 가능하게 하는 백도어 허용 집합을 통해 모방 가능성을 특징 짓는다.
- 확장된 프레임워크(실용적 모방 가능성)는 순수 식별 가능성이 실패하더라도 실제 관찰 분포 P(o)와 대리변수를 활용하여 모방이 달성될 수 있음을 보여준다.
- 모방 도구와 식별 가능한 부분공간을 탐색하고 P(s|do(π)) = P(s)을 만족하는 정책을 계산하는 Imitate 알고리즘의 도입.
- 개념 증명: 이 접근법은 매개변수/인과적 모델링을 통해 실용적인 모방 정책 학습 방법을 제공하고 고차원 합성 데이터세트에서의 검증을 수행한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.