Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Disentanglement of Representations for Improved Generalisation in Reinforcement Learning

Mhairi Dunion, Trevor McInroe|arXiv (Cornell University)|2022. 07. 12.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 순차적 관측에서 시간적 일관성을 활용하여 강화학습에서 분리된 표현을 학습하는 자기지도 보조 과제인 시간 분리(TED)를 소개한다. TED는 배경 색상과 같은 임의의 작업 변수와 목표 위치와 같은 작업 관련 변수를 포함한 새로운 환경 변수로의 일반화를 향상시켜, 최신 기술보다 더 빠른 적응과 더 나은 성능 복구를 가능하게 한다. 특히 이미지 기반 강화학습 설정에서 뛰어난 성능을 발휘한다.

ABSTRACT

Reinforcement Learning (RL) agents are often unable to generalise well to environment variations in the state space that were not observed during training. This issue is especially problematic for image-based RL, where a change in just one variable, such as the background colour, can change many pixels in the image. The changed pixels can lead to drastic changes in the agent's latent representation of the image, causing the learned policy to fail. To learn more robust representations, we introduce TEmporal Disentanglement (TED), a self-supervised auxiliary task that leads to disentangled image representations exploiting the sequential nature of RL observations. We find empirically that RL algorithms utilising TED as an auxiliary task adapt more quickly to changes in environment variables with continued training compared to state-of-the-art representation learning methods. Since TED enforces a disentangled structure of the representation, our experiments also show that policies trained with TED generalise better to unseen values of variables irrelevant to the task (e.g. background colour) as well as unseen values of variables that affect the optimal policy (e.g. goal positions).

연구 동기 및 목표

  • 배경 색상이나 목표 위치와 같은 변화에 대해 이미지 기반 강화학습 에이전트의 일반화 능력이 열악한 문제를 해결한다.
  • 샘플 비효율성 또는 작업 관련 변수로의 일반화 실패로 인해 성능이 떨어지는 도메인 랜덤라이제이션 및 불변 표현 학습의 한계를 극복한다.
  • i.i.d. 데이터에 의존하지 않고 연속된 타임스텝에서의 시간 데이터를 활용해 분리된 표현을 학습하는 자기지도 온라인 방법을 개발한다.
  • 에이전트가 기존 환경 값 외의 새로운 환경 값에 대해 치명적인 잊힘 없이 신속히 적응할 수 있도록 수명 주기 학습을 가능하게 한다.
  • 잠재 표현에 분리된 구조를 강제하여 분포 이탈 후 회복력과 성능 복구 능력을 향상시킨다.

제안 방법

  • 시간적으로 인접한 관측의 표현을 대조함으로써 분리된 표현을 유도하는 자기지도 보조 손실인 TED를 제안한다.
  • 두 종류의 비시간적 샘플을 사용한다: (1) 동일 에피소드에서의 샘플(비정적 특징), (2) 다른 에피소드에서의 샘플(정적 특징)으로, 에이전트 제어 및 환경 제어 요소를 분리한다.
  • 에이전트 행동과 환경 변화로 인한 변화를 구분할 수 있도록 분리된 구조를 가진 대비 분류기를 학습한다.
  • 기존 강화학습 알고리즘(RAD, SAC, PPO 등)에 최소한의 아키텍처 변경으로 TED를 보조 손실로 통합하며, 복원기구가 필요 없도록 한다.
  • 하이퍼파라미터 α를 사용해 분리도와 정책 성능 간 균형을 조정하고, 최적의 일반화를 위해 경험적으로 α를 튜닝한다.
  • 요소-VAE 기반의 분리도 측정 지표를 사용해 학습된 표현의 품질을 평가하며, TED를 통해 분리도가 향상됨을 확인한다.

실험 결과

연구 질문

  • RQ1시간 일관성에 기반한 자기지도 보조 과제가 이미지 기반 강화학습에서 새로운 환경 변수 값으로의 일반화를 향상시킬 수 있는가?
  • RQ2시간 대비 학습을 통한 분리된 표현 학습이 분포 이탈 후 더 빠른 적응과 더 나은 성능 복구를 이끌 수 있는가?
  • RQ3작업 관련 및 작업 비관련 환경 변수 모두에 대해 TED는 최신 기술의 표현 학습 방법보다 일반화 성능에서 뛰어나게 되는가?
  • RQ4동일 에피소드 또는 다른 에피소드의 비시간적 샘플만 사용할 경우 일반화 성능에 어떤 영향을 미치는가?
  • RQ5표준 선형 분류기와 비교해 TED에서 분리된 분류기의 구조가 얼마나 중요한가?

주요 결과

  • TED는 RAD, SAC, PPO와 같은 세 가지 기본 강화학습 알고리즘의 환경 변수 값에 대한 일반화 능력을 크게 향상시켰으며, 배경 색상과 같은 비작업 요소와 목표 위치와 같은 작업 관련 요소 모두에 해당한다.
  • 계속 학습 중에 TED로 훈련된 에이전트는 새로운 환경 값에 더 빠르게 적응하며, 베이스라인 대비 최적의 정책 성능을 더 빨리 복구한다.
  • 제거 실험 결과, 동일 에피소드와 다른 에피소드의 비시간적 샘플을 모두 사용할 경우 일반화 성능이 가장 우수하며, 한 종류의 샘플만 사용한 경우보다 뛰어나다.
  • 분리된 분류기를 표준 선형 분류기로 대체하면 일반화 성능이 떨어지며, 이는 TED에서 분리된 구조의 중요성을 입증한다.
  • TED 손실 계수 α는 신중하게 튜닝되어야 하며, α=200일 때 최적의 성능을 달성하지만, α=50 또는 α=500일 경우 분리도가 부족하거나 과도하여 일반화 성능이 떨어진다.
  • factor-VAE 측정 지표에서 TED는 분리도 점수를 향상시켜, 명시적 지도 없이도 기존 베이스라인보다 더 분리된 표현을 학습함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.