[논문 리뷰] Conditional Mutual Information for Disentangled Representations in Reinforcement Learning
이 논문은 강화학습에서 인과적 요인이 상관관계가 있을 때조차도 분리된 표현을 학습할 수 있도록 조건부 상호정보량(CMID)을 제안한다. CMID는 잠재 특징 간의 조건부 상호정보량을 최소화하는 보조 학습 목표로, 연속 제어 환경에서 이미지 관측값을 사용할 때 상관관계 변화에 대한 훈련 성능 향상과 0-샷 일반화 성능을 평균 77% 향상시킨다.
Reinforcement Learning (RL) environments can produce training data with spurious correlations between features due to the amount of training data or its limited feature coverage. This can lead to RL agents encoding these misleading correlations in their latent representation, preventing the agent from generalising if the correlation changes within the environment or when deployed in the real world. Disentangled representations can improve robustness, but existing disentanglement techniques that minimise mutual information between features require independent features, thus they cannot disentangle correlated features. We propose an auxiliary task for RL algorithms that learns a disentangled representation of high-dimensional observations with correlated features by minimising the conditional mutual information between features in the representation. We demonstrate experimentally, using continuous control tasks, that our approach improves generalisation under correlation shifts, as well as improving the training performance of RL algorithms in the presence of correlated features.
연구 동기 및 목표
- 모수적 상관관계가 일반화 및 내성성에 악영향을 미치는 강화학습 환경의 문제를 해결하기 위해.
- 기존의 분리 표현 방법이 요인 간 독립을 전제로 하여 상관관계가 있을 경우 실패하는 한계를 극복하기 위해.
- 엄격한 독립이 아닌 조건부 독립을 기반으로 분리된 표현을 학습할 수 있는 방법을 개발하기 위해.
- 특징 상관관계가 배포 시 변화하거나 존재하지 않을 경우, RL 에이전트의 0-샷 일반화 및 훈련 안정성을 향상시키기 위해.
- SVEA, DrQ, CURL, TED와 같은 기존 강화학습 알고리즘과 호환되는 플러그인 보조 작업으로서 CMID의 효과를 입증하기 위해.
제안 방법
- CMID는 쌍별 잠재 특징 간의 조건부 상호정보량(CMI)을 최소화하는 보조 손실을 도입한다. 이 손실은 조건부 집합을 기반으로 한다.
- 조건부 집합은 마르코프 결정 과정(MDP)의 인과적 구조에서 유도되며, 가장 최근의 관측값을 사용하여 특징들이 조건부 독립이 되도록 한다.
- CMI 추정을 위해 k-최근접 이웃(kNN)을 사용하여 근사 확률 밀도의 곱을 추정함으로써 미분 가능한 훈련을 가능하게 한다.
- 기본 RL 알고리즘의 손실과 CMID 보조 손실을 조합하여 잠재 표현을 역전파를 통해 갱신한다.
- 원시 프레임이 아닌 시간에 따라 스택된 특징 표현을 사용함으로써 입력에 허구적 인과적 의존성을 도입하는 것을 방지한다.
- 이 방법은 온라인 RL 알고리즘과 호환되며, 주 정책 훈련 루프를 수정하지 않고 적용 가능하다.
실험 결과
연구 질문
- RQ1요인의 변동성이 상관관계가 있을 때, 분리된 표현을 학습할 수 있는가?
- RQ2잠재 특징 간의 조건부 상호정보량을 최소화함으로써 강화학습에서 상관관계 변화가 있을 경우 0-샷 일반화 성능이 향상되는가?
- RQ3DrQ, CURL, TED와 같은 최첨단 자기지도 기반 강화학습 방법과 비교해 CMID는 특징 상관관계 변화에 대해 얼마나 더 뛰어난 내성성을 보이는가?
- RQ4상관관계가 있는 특징이 존재하는 환경에서 CMID는 훈련 성능과 샘플 효율성을 향상시킬 수 있는가?
- RQ5기존 강화학습 알고리즘에 아키텍처 변경 없이 보조 작업으로 적용했을 때 CMID는 효과적인가?
주요 결과
- CMID는 테스트 시 미리 보지 않은 물체 색상에 대해 기본 SVEA 알고리즘 대비 평균 77% 향상된 0-샷 일반화 성능을 보였다.
- 카트폴 스윙업 태스크에서 CMID는 가장 좋은 미리보지 않은 색상에 대해 평균 수익 834.1 ± 105.8을 기록했고, SVEA는 588.7 ± 87.2를 기록하여 색상 상관관계 변화에 대한 뛰어난 내성성을 입증했다.
- 특징 상관관계가 학습에 악영향을 미치는 작업에서 CMID는 DrQ, CURL, TED와 같은 최첨단 기준 모델을 초월하여 일반화 성능을 높였다.
- SVEA의 훈련 성능이 향상되어, CMID가 상관관계가 있는 특징이 존재하는 환경에서 빠른 수렴과 더 안정적인 학습을 도와주는 것으로 나타났다.
- 잠재 특징이 함께 동역학을 예측하는 경우에도, CMID는 조건부 독립 특징을 학습함으로써 물체의 색상과 크기와 같은 상관관계가 있는 요인들을 성공적으로 분리했다.
- kNN 기반 CMI 추정으로 인해 CMID의 계산 비용은 평균 67% 증가했지만, 이는 일반화 및 내성성 향상의 큰 성과로 상쇄되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.