Skip to main content
QUICK REVIEW

[논문 리뷰] Mutual Information Based Knowledge Transfer Under State-Action Dimension Mismatch

Michael Wan, Tanmay Gangwani|arXiv (Cornell University)|2020. 06. 12.
Reinforcement Learning in Robotics참고 문헌 27인용 수 5
한 줄 요약

이 논문은 상태공간과 행동공간이 다를 경우에도 강화학습에서 교사 정책에서 학생 정책으로 지식을 전달할 수 있는 상호정보 기반 지식 전달(MIKT)을 제안한다. 작업에 맞는 임bedding을 학습하고 정책 그래เดียน트 및 상호정보 손실을 함께 최적화함으로써, 복잡한 운동 제어 과제에서 효과적인 전달이 가능해지며, VPG 및 MLPP와 같은 기준선보다 샘플 효율성과 최종 성능에서 뚜렷이 뛰어나다.

ABSTRACT

Deep reinforcement learning (RL) algorithms have achieved great success on a wide variety of sequential decision-making tasks. However, many of these algorithms suffer from high sample complexity when learning from scratch using environmental rewards, due to issues such as credit-assignment and high-variance gradients, among others. Transfer learning, in which knowledge gained on a source task is applied to more efficiently learn a different but related target task, is a promising approach to improve the sample complexity in RL. Prior work has considered using pre-trained teacher policies to enhance the learning of the student policy, albeit with the constraint that the teacher and the student MDPs share the state-space or the action-space. In this paper, we propose a new framework for transfer learning where the teacher and the student can have arbitrarily different state- and action-spaces. To handle this mismatch, we produce embeddings which can systematically extract knowledge from the teacher policy and value networks, and blend it into the student networks. To train the embeddings, we use a task-aligned loss and show that the representations could be enriched further by adding a mutual information loss. Using a set of challenging simulated robotic locomotion tasks involving many-legged centipedes, we demonstrate successful transfer learning in situations when the teacher and student have different state- and action-spaces.

연구 동기 및 목표

  • 교사와 학생 에이전트의 상태공간과 행동공간이 다를 경우 지식 전달 문제를 해결하기 위해.
  • 다리가 많은 로봇의 운동 제어와 같은 복잡하고 고차원적인 제어 과제에서 효과적인 전이 학습을 가능하게 하기 위해.
  • 이전 방법들이 공유된 상태공간 또는 행동공간이 필요하거나 KL 발산 또는 고정된 레이어 수평 연결에 의존하는 제한점을 극복하기 위해.
  • 교수 네트워크에서 의미 있는 표현을 추출하고 학생 네트워크로 전달할 수 있는 프레임워크를 설계하기 위해.
  • 상호정보 정규화가 표현 품질과 전이 성능 향상에 기여함을 경험적으로 검증하기 위해.

제안 방법

  • 교사 및 학생 표현을 동일한 공간으로 매핑하기 위해 신경망 인코더를 통해 공유 임bedding 공간을 학습하기 위해.
  • PPO 기반 정책 그래디언트 손실과 상호정보 손실을 조합한 손실을 사용하여 인코더를 훈련하기 위해.
  • 최종 정책 헤드에서 학생 및 교사 표현의 가중 선형 조합을 사용하며, 가중치는 훈련 중에 동적으로 학습됨.
  • 인코더가 교사 정책 및 가치 네트워크의 작업 관련 정보를 유지하도록 상호정보 손실을 적용하기 위해.
  • 교사와 학생 레이어 간의 학습 가능한 변환 행렬을 피하기 위해 직접 임bedded 표현을 사용하기 위해.
  • 강화학습 정책 목표와 상호정보 목표의 그래디언트를 모두 사용하여 인코더를 최적화함으로써 표현 품질 향상시키기 위해.

실험 결과

연구 질문

  • RQ1상태공간과 행동공간이 다를 경우, 교사 정책에서 학생 정책으로 지식을 효과적으로 전달할 수 있는가?
  • RQ2학습 목표로 상호정보를 통합할 경우, 강화학습에서 전달된 표현의 품질이 향상되는가?
  • RQ3구조적 유사성은 있지만 상태/행동 차원이 다른 과제에서 MIKT의 성능은 표준 강화학습 및 이전 지식 정련 기준선과 어떻게 비교되는가?
  • RQ4전이 학습의 효과성이 교사와 학생의 과제 유사성에 얼마나 의존하는가?
  • RQ5특히 교사가 유사하지 않을 경우, 교사 및 학생 표현의 기여도는 훈련 중 어떻게 변화하는가?

주요 결과

  • 모든 테스트된 운동 제어 과제에서 MIKT는 VPG 및 MLPP 기준선보다 초기 훈련 샘플 효율성과 최종 에피소드 리워드 측면에서 뚜렷이 뛰어나다.
  • PPO 및 상호정보 손실을 모두 포함한 MIKT 모델은 각각 손실 성분이 없는 변종보다 더 높은 최종 성능과 더 빠른 학습 곡선을 기록한다.
  • 제거 실험 결과, 상호정보 손실을 제거할 경우 초기 훈련 성능이 열악해지며, 이는 표현 학습에서 상호정보 손실의 핵심적 역할을 확인한다.
  • 비유사한 교사(예: Hopper)를 사용할 경우, 학생 표현의 가중치가 급격히 증가함에 따라 모델이 빠르게 자신의 표현에 의존하는 것으로 나타나, 비유사 과제에서는 전이가 덜 효과적임을 확인한다.
  • 작업에 맞는 임bedding을 사용함으로써, 상태공간(139D 대비 97D)과 행동공간(16D 대비 10D)이 다를 경우에도 성공적인 전달이 가능함을 입증하며, 프레임워크의 강건성을 검증한다.
  • 거미 모양 로봇의 운동 제어 과제에 대한 경험적 결과는, 과제 간의 구조적 유사성이 존재할 경우, 다를 바 있는 다리 수가 있더라도 효과적인 지식 전달이 가능함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.