[논문 리뷰] A Relational Intervention Approach for Unsupervised Dynamics Generalization in Model-Based Reinforcement Learning
이 논문은 레이블이 없는 전이 세그먼트에서 환경에 특화된 요소 $ ilde{Z}$ 를 학습함으로써 모델 기반 강화학습(MBRL)에서 비지도 동적 일반화를 위한 관계 기반 간섭 접근법(Relational Intervention Approach, RIA)을 제안한다. 이는 두 $ ilde{Z}$ 벡터가 동일한 환경에서 유래했는지 확률을 추정하는 간섭 모듈과, 유사한 $ ilde{Z}$ 벡터들 간의 유사성을 강제하는 관계 헤드를 도입하여 부가적인 정보를 줄이고, 동적 예측 정확도 및 새로운 동적 환경에서의 RL 에이전트 성능을 향상시킨다.
The generalization of model-based reinforcement learning (MBRL) methods to environments with unseen transition dynamics is an important yet challenging problem. Existing methods try to extract environment-specified information $Z$ from past transition segments to make the dynamics prediction model generalizable to different dynamics. However, because environments are not labelled, the extracted information inevitably contains redundant information unrelated to the dynamics in transition segments and thus fails to maintain a crucial property of $Z$: $Z$ should be similar in the same environment and dissimilar in different ones. As a result, the learned dynamics prediction function will deviate from the true one, which undermines the generalization ability. To tackle this problem, we introduce an interventional prediction module to estimate the probability of two estimated $\hat{z}_i, \hat{z}_j$ belonging to the same environment. Furthermore, by utilizing the $Z$'s invariance within a single environment, a relational head is proposed to enforce the similarity between $\hat{Z}$ from the same environment. As a result, the redundant information will be reduced in $\hat{Z}$. We empirically show that $\hat{Z}$ estimated by our method enjoy less redundant information than previous methods, and such $\hat{Z}$ can significantly reduce dynamics prediction errors and improve the performance of model-based RL methods on zero-shot new environments with unseen dynamics. The codes of this method are available at \url{https://github.com/CR-Gjx/RIA}.
연구 동기 및 목표
- 학습 환경과 다를 수 있는 새로운 전이 동적 특성을 가진 환경으로 모델 기반 강화학습(MBRL)의 일반화 문제를 해결한다.
- 기존 비지도 방법들이 전이 세그먼트에서 환경에 특화된 요소 $Z$ 를 추출하지만, 비동적 관련 정보를 포함하여 부가적인 정보를 유발하는 한계를 극복한다.
- 추정된 $\hat{Z}$ 벡터들이 동일한 환경 내에서는 유사하고, 서로 다른 환경 간에는 다를 수 있도록 보장하여 $Z$ 가 가져야 할 핵심 성질을 유지한다.
- 학습 환경과 다른 동적 특성을 가진 환경에서 제로샷 설정에서 MBRL 에이전트의 강인성과 일반화 능력을 향상시킨다.
제안 방법
- 비지도로 환경에 특화된 요소 $\hat{Z}$ 를 역사적 전이 세그먼트에서 컨텍스트 인코더를 사용하여 추정하고, 관측되지 않은 $Z$ 의 대체자로 간주한다.
- 두 $\hat{Z}$ 벡터가 동일한 환경에서 유래했는지 확률을 계산하는 간섭 예측 모듈을 도입하며, 대조 학습 기반 접근법을 사용한다.
- 높은 환경 간 유사성을 가진 $\hat{Z}$ 벡터들을 클러스터링하는 관계 헤드를 설계하여, 한 환경 내에서 $\hat{Z}$ 의 불변성을 강제한다.
- 개선된 $\hat{Z}$ 를 사용하여 동적 예측 모델을 훈련시켜 새로운 동적 특성을 가진 환경로의 일반화 능력을 향상시킨다.
- 동일한 환경에서 유래한 $\hat{Z}$ 벡터들이 잠재 공간에서 더 가까워지도록 자율 지도 대조 목표를 사용한다.
- 학습된 $\hat{Z}$ 를 동적 모델에 통합하여 전이 동적 특성이 다른 환경 간의 일반화를 가능하게 한다.
실험 결과
연구 질문
- RQ1레이블이 없는 전이 세그먼트에서 비지도로 부가적인 비동적 관련 정보를 포함하지 않고 환경에 특화된 요소 $\hat{Z}$ 를 학습할 수 있는가?
- RQ2비지도 방식으로 한 환경 내에서 $\hat{Z}$ 의 불변성과 서로 다른 환경 간의 이질성을 어떻게 강제할 수 있는가?
- RQ3제안된 간섭 및 관계 헤드 메커니즘이 궤도 특화 노이즈의 영향을 줄이고 동적 일반화를 향상시키는가?
- RQ4기존 비지도 접근법에 비해 이 방법은 새로운 전이 동적 특성을 가진 환경에서 MBRL 에이전트의 제로샷 일반화 능력을 어느 정도 향상시키는가?
주요 결과
- CaDM 및 TMCL와 같은 기준 방법에 비해 제안된 방법은 새로운 테스트 환경에서 동적 예측 오차를 크게 줄였다.
- 간섭 모듈은 동일한 환경에서 유래한 $\hat{Z}$ 벡터들 간에 높은 유사도 점수를 할당하여 효과적인 비지도 클러스터링을 입증했다.
- RIA를 사용해 훈련한 모델 기반 RL 에이전트는 다른 비지도 방법을 사용한 경우보다 제로샷 테스트 환경에서 더 높은 평균 수익을 달성했다.
- 제거 실험 결과, 관계 헤드와 간섭 모듈 둘 다 필수적임을 확인했으며, 특히 부가 정보 감소 측면에서 성능 저하가 뚜렷했다.
- 진짜 환경 레이블을 사용해 $\hat{Z}$ 를 클러스터링하는 지도 기반 기준 성능과 유사한 성능을 달성하여 강력한 비지도 분리 능력을 보였다.
- 예측 오차 곡선은 훈련 기간 내내 일관된 향상을 보이며, 새로운 동적 특성을 가진 환경에서 낮은 일반화 오차를 기록하여 학습된 $\hat{Z}$ 의 강인성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.