Skip to main content
QUICK REVIEW

[논문 리뷰] Active Hierarchical Exploration with Stable Subgoal Representation Learning

Siyuan Li, Jin Zhang|arXiv (Cornell University)|2021. 05. 31.
Mobile Crowdsensing and Crowdsourcing인용 수 7
한 줄 요약

이 논문은 장기적이고 보상이 희박한 연속 제어 작업에서 효율적이고 안정적인 고수준 정책 학습을 가능하게 하기 위해 상태별 정규화를 통한 하위목표 표현 학습의 안정성을 확보하는 새로운 활성 계층적 탐색 방법인 HESS를 제안한다. 정규화된 신선도 측도와 도달 가능성 기반 잠재 함수를 조합함으로써 내재 보상 없이도 유망한 하위목표를 능동적으로 선택하며, 도전적인 보상이 희박한 벤치마크에서 최신 기술 수준의 샘플 효율성과 성능을 달성한다.

ABSTRACT

Goal-conditioned hierarchical reinforcement learning (GCHRL) provides a promising approach to solving long-horizon tasks. Recently, its success has been extended to more general settings by concurrently learning hierarchical policies and subgoal representations. Although GCHRL possesses superior exploration ability by decomposing tasks via subgoals, existing GCHRL methods struggle in temporally extended tasks with sparse external rewards, since the high-level policy learning relies on external rewards. As the high-level policy selects subgoals in an online learned representation space, the dynamic change of the subgoal space severely hinders effective high-level exploration. In this paper, we propose a novel regularization that contributes to both stable and efficient subgoal representation learning. Building upon the stable representation, we design measures of novelty and potential for subgoals, and develop an active hierarchical exploration strategy that seeks out new promising subgoals and states without intrinsic rewards. Experimental results show that our approach significantly outperforms state-of-the-art baselines in continuous control tasks with sparse rewards.

연구 동기 및 목표

  • 장기적이고 보상이 희박한 작업에서 목표 조건화 계층적 강화 학습(GCHRL)에서 온라인으로 학습된 하위목표 표현의 불안정성을 해결함으로써 고수준 탐색의 안정성을 향상시키기 위해.
  • 신뢰할 수 있는 신선도 및 잠재 함수 추정을 지원하는 안정적인 하위목표 표현 공간을 설계하여 탐색 효율성을 향상시키기 위해.
  • 내재 보상에 의존하지 않고 높은 잠재력과 높은 신선도를 가진 하위목표를 능동적으로 선택하는 탐색 전략을 개발하여 직접적이고 효율적인 정책 학습을 가능하게 하기 위해.
  • 보상이 희박한 도전적인 연속 제어 환경에서 뛰어난 샘플 효율성과 성능을 달성하기 위해.

제안 방법

  • 기존 표현 목표를 충족하는 임베딩으로의 업데이트를 제약함으로써 하위목표 표현의 안정성을 높이는 상태별 정규화를 도입하여 학습 안정성과 효율성을 향상시킨다.
  • 이전 연구에서 영감을 얻어 잠재 공간에서 의미 있고 분리된 하위목표 임베딩을 학습하기 위해 대조 목표를 활용한다.
  • 하위목표 공간 내 방문 횟수를 기반으로 한 정규화된 신선도 측도를 설계하고, 이는 이웃 영역의 도달 가능성 평가를 위한 잠재 함수로 강화되어 탐색적 하위목표의 우선순위를 정한다.
  • Hinton(2007)의 우선순위 샘플링을 활용하여 손실이 높은 샘플에 집중함으로써 표현 학습 효율성을 향상시키되 안정성은 유지한다.
  • 내재 보상 최적화를 거치지 않고도 병합된 신선도와 잠재력을 기반으로 하위목표를 직접 선택하는 능동적 탐색 전략을 개발한다.
  • 정규화된 신선도 및 잠재 함수 점수를 사용하여 고수준 정책이 잠재 공간에서 하위목표를 선택함으로써 방문하지 않은 영역와 도달 가능한 영역를 타겟으로 한 탐색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1계층적 강화 학습에서 온라인으로 학습된 하위목표 표현의 안정성을 높이기 위한 정규화 메커니즘이 탐색 안정성을 향상시킬 수 있는가?
  • RQ2동적으로 변화하는 하위목표 공간에서 효과적으로 신선도와 잠재 함수를 측정하는 방법은 무엇인가? 이를 통해 고수준 탐색을 이끌 수 있는가?
  • RQ3정규화된 신선도와 잠재 함수 기반의 능동적 하위목표 선택이 내재 보상이 있는 반응형 탐색보다 보상이 희박한 환경에서 더 우수한 성능을 낼 수 있는가?
  • RQ4제안된 방법이 장기적이고 보상이 희박한 연속 제어 작업에서 샘플 효율성과 성능을 얼마나 향상시키는가?

주요 결과

  • HESS는 보상이 희박한 연속 제어 작업에서 최신 기술 수준의 베이스라인을 크게 능가하며, 뛰어난 샘플 효율성과 최종 성능을 보여준다.
  • 절단 실험을 통해 잠재 함수가 핵심적임을 확인하였다: 이가 없을 경우 하위목표는 저유용성 영역(예: 구석)에 집중되어 성공률이 낮아진다.
  • 스케일링 인자 α, 확장 거리 de, 안정 비율 k%의 다양한 값에 대해 안정적인 성능를 유지하여 일반화 가능성과 신뢰성을 입증한다.
  • 제안된 안정성 정규화는 안정성에 손상을 주지 않으면서 표현 학습 효율성을 향상시켜 효과적인 우선순위 샘플링을 가능하게 한다.
  • 내재 보상이 있는 반응형 방법보다 능동적 탐색 전략이 더 뛰어난 성능을 낸다. 이는 내재 보상 학습의 지연 없이 직접 유망한 하위목표를 타겟으로 하기 때문이다.
  • 단일 세트의 하이퍼파rameter로 Ant Maze 및 Ant Push(이미지)와 같은 다양한 작업에서 뛰어난 성능를 달성하여 일반화 가능성과 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.