Skip to main content
QUICK REVIEW

[논문 리뷰] Value-of-Information based Arbitration between Model-based and Model-free Control

Krishn Bera, Yash Mandilwar|arXiv (Cornell University)|2019. 12. 08.
Receptor Mechanisms and Signaling인용 수 4
한 줄 요약

이 논문은 계산 효율성과 적응 가능성 사이의 균형을 이루기 위해 모델 기반 강화학습과 모델리스 강화학습 간을 동적으로 전환하는 밸류오브인포메이션(VoI) 기반의 조정 메커니즘을 제안한다. Q-값 분산의 불확실성에 기반한 VoI 신호를 사용함으로써, 에이전트는 불확실성이 높을 때는 모델 기반 계획을 우선시하고, 자신감이 증가함에 따라 효율적인 모델리스 학습으로 전환한다. 이는 스킬 습득 과제에서 표준 Q-러닝과 경험 재생 기반 Q-러닝을 능가하는 성능을 보인다.

ABSTRACT

There have been numerous attempts in explaining the general learning behaviours using model-based and model-free methods. While the model-based control is flexible yet computationally expensive in planning, the model-free control is quick but inflexible. The model-based control is therefore immune from reward devaluation and contingency degradation. Multiple arbitration schemes have been suggested to achieve the data efficiency and computational efficiency of model-based and model-free control respectively. In this context, we propose a quantitative 'value of information' based arbitration between both the controllers in order to establish a general computational framework for skill learning. The interacting model-based and model-free reinforcement learning processes are arbitrated using an uncertainty-based value of information. We further show that our algorithm performs better than Q-learning as well as Q-learning with experience replay.

연구 동기 및 목표

  • 스킬 습득 과정에서 모델 기반 계획의 계산 비용과 모델리스 학습의 샘플 비효율성 사이의 상충 관계를 해결하기 위해.
  • 정량적 비용-편익 분석을 기반으로 생물학적으로 타당한 동적 조정 메커니즘을 개발하여 모델 기반 및 모델리스 제어기 간의 조정을 가능하게 하기 위해.
  • 기민한 목표 지향적 계획에서 습관적인 신속한 실행으로 기술 숙련도가 향상됨에 따라 에이전트가 전환할 수 있도록 하기 위해.
  • 특히 푸이츠의 세 단계 학습 이론에 기반한 감각운동 스킬 학습의 행동 현상과의 일치성을 검증하기 위해.

제안 방법

  • 에이전트는 '계획'(모델 기반) 및 '실행'(모델리스)의 두 단계로 운영되며, 밸류오브인포메이션(VoI) 지표에 기반한 조정이 이루어진다.
  • VoI는 $ VoI(s,a) = C_{(s,a)} / ( au(s) + \rho) $ 로 계산되며, 여기서 $ C_{(s,a)} $ 는 상태-행동 쌍 $ (s,a) $ 의 Q-값 분산이고, $ \tau(s) $ 는 상태 $ s $ 에서 모든 행동에 대한 Q-값 분산이다.
  • 모델 기반 계획은 VoI가 임계값을 초과할 경우에만 활성화되며, 이는 높은 불확실성을 나타내며, 그렇지 않으면 모델리스 Q-러닝이 사용된다.
  • 모델 기반 계획은 깊이 제한된 값 반복과 전방 탐색을 사용하며, 깊이가 0이 되면 오프-폴리시 Q-러닝으로 전환된다.
  • 프레임워크는 초기 학습 동안 환경의 동역학(전이 확률)을 학습함으로써 보다 강건한 보상 저하 및 상황 변화에 대비할 수 있다.
  • 조정 메커니즘은 시간이 지남에 따라 진화한다: 모델 기반 제어가 초기에 지배적이다(200–300 에피소드), 이후 약 400 에피소드 후에 점차 모델리스 제어로 이양된다.

실험 결과

연구 질문

  • RQ1모델 기반 및 모델리스 강화학습 간의 동적 조정 메커니즘을 어떻게 설계할 수 있을까? 이는 계산 비용과 학습 효율성 사이의 균형을 이루는 데 기여할 수 있는가?
  • RQ2Q-값 분산에 기반한 밸류오브인포메이션(VoI) 지표가 계획 행동과 반응 행동 간 최적의 전환을 얼마나 잘 가능하게 하는가?
  • RQ3제안된 프레임워크는 행동 연구에서 관찰된 세 단계 습득 진행 과정(인지적, 연합적, 운동적 단계)을 재현할 수 있는가?
  • RQ4하이브리드 모델은 샘플 효율성과 수렴 속도 측면에서 표준 Q-러닝과 경험 재생 기반 Q-러닝을 능가할 수 있는가?

주요 결과

  • VoI 기반 조정 메커니즘은 약 400개의 학습 에피소드 동안 모델 기반에서 모델리스 제어로의 전환을 성공적으로 이끌었으며, 이는 푸이츠 이론의 목표 지향적 행동에서 습관적 행동으로의 전환을 반영한다.
  • 약 400 에피소드 후에 모델 기반 평가가 0으로 떨어지며, 이는 모델리스 제어기가 완전히 지배하게 되었음을 나타내며, 이는 계산적으로 효율적이며 숙련된 스킬 실행에 적합하다.
  • 표준 Q-러닝과 경험 재생 기반 Q-러닝보다 뛰어난 성능을 달성하여, 더 나은 학습 효율성과 수렴 성능을 보였다.
  • 프레임워크는 초기 학습 동안 전이 확률(세계 모델)을 학습하여 보상 저하 및 상황 변화에 대한 내성적 저항력을 확보했다.
  • VoI 지표는 학습 진행에 따라 증가하며, 이는 불확실성 감소를 반영하고, 자신감이 높을 때 더 빠른 모델리스 실행으로의 전환을 안내한다.
  • 모델 기반 제어기는 인지 단계(첫 200–300 에피소드) 동안 지배적이며, 불확실한 환경에서 데이터 효율적이고 적응 가능한 계획을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.