[논문 리뷰] Domain-Adversarial and Conditional State Space Model for Imitation Learning
이 논문은 부분적으로 관찰 가능한 환경에서 큰 도메인 이동이 발생하는 상황에서, 도메인에 관계없이 작동하는, 임의의 작업과 동적 특성에 민감한 상태 표현을 학습하는 도메인-역방향적이고 도메인-조건부 상태 공간 모델(DAC-SSM)을 제안한다. 도메인 구분자와 도메인 조건부 인코더/디코더를 사용한 역방향 훈련을 통해 상태 추론, 관측 재구성, 전방 동적 예측, 보상 모델링을 동시에 최적화함으로써, DAC-SSM는 연속 제어 과제에서 전문가 수준의 성능을 달성한다 — 특히 보상이 희박한 시뮬레이터에서는 기준 모델보다 2배 이상 뛰어난 성능을 보였다.
State representation learning (SRL) in partially observable Markov decision processes has been studied to learn abstract features of data useful for robot control tasks. For SRL, acquiring domain-agnostic states is essential for achieving efficient imitation learning. Without these states, imitation learning is hampered by domain-dependent information useless for control. However, existing methods fail to remove such disturbances from the states when the data from experts and agents show large domain shifts. To overcome this issue, we propose a domain-adversarial and conditional state space model (DAC-SSM) that enables control systems to obtain domain-agnostic and task- and dynamics-aware states. DAC-SSM jointly optimizes the state inference, observation reconstruction, forward dynamics, and reward models. To remove domain-dependent information from the states, the model is trained with domain discriminators in an adversarial manner, and the reconstruction is conditioned on domain labels. We experimentally evaluated the model predictive control performance via imitation learning for continuous control of sparse reward tasks in simulators and compared it with the performance of the existing SRL method. The agents from DAC-SSM achieved performance comparable to experts and more than twice the baselines. We conclude domain-agnostic states are essential for imitation learning that has large domain shifts and can be obtained using DAC-SSM.
연구 동기 및 목표
- 전문가 데이터와 에이전트 데이터가 제어와 무관한 외관이나 맥락에서 상이한 도메인 이동 문제를 해결하기 위해.
- 로봇 외관, 카메라 각도 등 도메인 특화된 간섭 요소에 영향을 받지 않는 상태 표현을 학습하면서도, 작업에 관련된 동적 특성은 유지하기 위해.
- 부분적으로 관찰 가능한 마르코프 결정 과정(POMDPs)에서 도메인 불변 제어 특징과 도메인 특화된 노이즈를 분리함으로써 임의의 학습 성능을 향상시키기 위해.
- 상태 추론, 재구성, 동적 예측, 보상 모델링을 동시에 최적화하는 통합 프레임워크를 개발하여 강건한 임의의 학습을 가능하게 하기 위해.
- 큰 도메인 이동 하에서 도메인에 관계없는 상태 표현이 효과적인 임의의 학습을 위해 필수적임을 검증하기 위해, 특히 보상이 희박한 환경에서.
제안 방법
- DAC-SSM는 잠재 상태에 있는 도메인 특화 정보를 최소화하기 위해 순환 상태 공간 모델(RSSM)에 도메인 역방향 훈련을 확장한다.
- 도메인 구분자는 잠재 상태의 도메인을 분류하도록 훈련되며, 이 손실는 기울기 반전을 통해 최소화되어 도메인 불변성을 장려한다.
- 인코더와 디코더는 도메인 레이블에 조건부로 설정되어 도메인 특화된 특징과 제어 관련 특징을 분리하여 재구성할 수 있도록 한다.
- 모델은 네 가지 목적함수를 동시에 최적화한다: 상태 추론, 관측 재구성, 전방 동적 예측, 보상 모델링.
- 보상 모델은 잠재 상태를 기반으로 궤적 품질을 평가하는 최적성 구분자로 구현되며, 임의의 보상은 도메인에 관계없는 표현에서 계산된다.
- 훈련 목표는 도메인 혼동 손실(역방향)과 도메인 레이블 조건부 재구성 손실을 포함하며, 이는 제어 관련 특징과 도메인 특화된 특징의 분리에 기여한다.
실험 결과
연구 질문
- RQ1큰 도메인 이동이 발생하는 전문가 데이터와 에이전트 데이터에서 도메인에 관계없는 상태 표현을 효과적으로 학습할 수 있는가?
- RQ2제어에 무관한 시각적 변형이 존재할 경우, 도메인 구분자를 사용한 역방향 훈련이 임의의 학습 성능을 향상시키는가?
- RQ3도메인 레이블에 조건부로 설정된 인코더와 디코더는 도메인 불변 특징과 작업 관련 특징의 분리에 어떤 영향을 미치는가?
- RQ4DAC-SSM은 도메인 이동이 존재하는 보상이 희박한 연속 제어 과제에서 기존의 SRL 방법보다 뛰어난 성능을 낼 수 있는가?
- RQ5초기화 매개변수 조정(예: 도메인 혼동 손실 계수)은 학습된 상태 표현의 품질에 어떤 영향을 미치는가?
주요 결과
- DAC-SSM는 평가된 모든 보상이 희박한 과제에서 전문가 정책과 유사한 성능을 달성하였으며, 기준 모델(PlaNet+D_O)보다 누적 보상에서 2배 이상 뛰어났다.
- 이중 보상(이중 보상)을 사용한 DAC/dual의 성능이 모든 과제에서 가장 뛰어났지만, Cup-Catch 과제에서는 짧은 계획 수평으로 인해 임의의 보상이 열악하여 성능이 떨어졌다.
- 도메인 역방향 훈련을 제거한 경우(DA/dual), 성능이 크게 떨어졌으며, 이는 도메인 역방향 훈련이 도메인 불변성에 필수적임을 시사한다.
- 제거 실험 결과, 도메인 조건부 인코더/디코더만 사용한 경우(DC/dual)는 DAC/dual과 거의 유사한 성능를 보였지만, 도메인 역방향 훈련과 병행될 때에만 최적의 성능를 달성했다.
- 재구성 결과는 DAC-SSM가 제어 관련 특징(예: 관절 각도)을 잘 포착하면서도 도메인 특화된 특징(예: 바닥 색상, 물체 질감)을 억제함으로써 성공적인 분리가 이루어졌음을 확인했다.
- 도메인 혼동 손실 계수 λ는 과제에 따라 최적값을 가지며, Connector-Insertion 과제에서 λ=3일 때 최고의 성능를 보였고, 이는 초기화 매개변수 조정이 강건성에 매우 중요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.