Skip to main content
QUICK REVIEW

[논문 리뷰] Autonomous Extracting a Hierarchical Structure of Tasks in Reinforcement Learning and Multi-task Reinforcement Learning

Behzad Ghazanfari, Matthew E. Taylor|arXiv (Cornell University)|2017. 09. 14.
Reinforcement Learning in Robotics참고 문헌 16인용 수 13
한 줄 요약

이 논문은 강화학습(RL) 및 다중작업 강화학습에서 에이전트의 트레이젝터리에 연관 규칙 마이닝(ARM)을 적용하여 고차원적 작업 구조를 자동으로 추출하는 새로운 방법 ARM-HSTRL을 제안한다. 자주 방문되는 부분 목표와 그들의 순차적 관계를 식별함으로써, ARM-HSTRL은 환경의 동역학이나 분할된 MDP 구조에 대한 사전 지식 없이도 작업 계층을 구성하며, 학습 효율성을 크게 향상시키고 다양한 전이 및 보상 함수를 가진 작업 간에 견고한 지식 전이를 가능하게 한다.

ABSTRACT

Reinforcement learning (RL), while often powerful, can suffer from slow learning speeds, particularly in high dimensional spaces. The autonomous decomposition of tasks and use of hierarchical methods hold the potential to significantly speed up learning in such domains. This paper proposes a novel practical method that can autonomously decompose tasks, by leveraging association rule mining, which discovers hidden relationship among entities in data mining. We introduce a novel method called ARM-HSTRL (Association Rule Mining to extract Hierarchical Structure of Tasks in Reinforcement Learning). It extracts temporal and structural relationships of sub-goals in RL, and multi-task RL. In particular,it finds sub-goals and relationship among them. It is shown the significant efficiency and performance of the proposed method in two main topics of RL.

연구 동기 및 목표

  • 차원의 극복 문제로 인한 고차원 강화학습 환경에서의 느린 학습 문제를 해결하기 위해.
  • 전문가가 제공한 계층 구조 없이 의미 있는 부분 목표와 그들의 구조적 관계로 작업을 자동으로 분해할 수 있도록 하기 위해.
  • 원시 트레이젝터리에서 작업 특화된 고차원적 구조를 발견함으로써 다중작업 강화학습(MTRL)에서 샘플 효율성과 지식 전이를 향상시키기 위해.
  • 행동 모델, 분할된 MDP 가정, 또는 트레이젝터리 사전 처리가 필요 없는 실용적이고 확장 가능한 방법을 개발하기 위해.
  • ARM를 통해 추출된 계층적 구조가 복잡한 RL 환경에서 표준 Q-학습보다 빠른 수렴과 더 나은 성능을 보이는가를 입증하기 위해.

제안 방법

  • 강화학습 학습 동안 수집된 상태 트레이젝터리에 연관 규칙 마이닝(ARM)을 적용하여 자주 발생하는 상태 시퀀스를 발견한다.
  • ARM의 '빈번한 항목집합 생성' 단계를 사용하여 성공적인 트레이젝터리에 자주 나타나는 상태로 부분 목표를 식별한다.
  • 규칙 생성 단계에서 부분 목표 간의 순차적 관계를 추출하며, '만약 부분 목표 A이면 부분 목표 B' 형태의 함의 규칙로 표현한다.
  • 이러한 연관 규칙을 조합하여 부분 목표와 그 의존성의 트리 구조적 계층을 구성함으로써 작업의 계층적 구조를 수립한다.
  • 이 방법은 단일 작업 RL 및 다중작업 RL 모두에 적용되며, 작업 간의 구조 유사성에 기반한 부분 정책 공유를 가능하게 한다.
  • 환경의 전이 또는 보상 함수에 대한 사전 지식이 필요 없으며, 분할된 MDP 표현이나 트레이젝터리 정제에 의존하지도 않는다.

실험 결과

연구 질문

  • RQ1원시 RL 트레이젝터리에서 연관 규칙 마이닝을 효과적으로 사용하여 부분 목표와 그들의 순차적 관계를 발견할 수 있는가?
  • RQ2추출된 계층적 구조가 강화학습에서 학습 속도와 샘플 효율성을 크게 향상시킬 수 있는가?
  • RQ3다른 전이 및 보상 함수를 가진 다중작업 RL 환경에서 제안된 방법의 성능은 어떠한가?
  • RQ4이 방법은 자동으로 작업 간의 구조적 차이를 식별하고 처리하여 효과적인 지식 전이를 가능하게 하는가?
  • RQ5ARM에서 유도된 계층적 구조는 전이 학습에서 가치 함수 공유보다 더 견고하고 일반화 능력이 뛰어나다고 할 수 있는가?

주요 결과

  • ARM-HSTRL은 여러 실험에서 표준 Q-학습보다 학습 속도가 빠르며, 목표에 도달하기 위한 단계 수를 크게 감소시켰다.
  • 단일 작업 RL에서 ARM-HSTRL은 그림 7~10에서 보듯이 Q-학습보다 더 빠른 수렴과 더 높은 누적 보상을 달성했다.
  • 다중작업 RL에서 ARM-HSTRL은 전이 및 보상 함수가 다른 여러 작업을 성공적으로 학습하고 구분했으며, Q-학습은 동일한 조건에서 수렴하지 못했다.
  • 실험 3의 두 번째 테스트베드에서 ARM-HSTRL은 안정적인 학습 진전과 보상 축적을 유지했으며(그림 6, 11~12), 각 작업이 고유한 역학을 가진 상황에서도 견고한 성능을 보였다.
  • ARM를 통해 추출된 계층적 구조는 작업 특화 정책 학습을 효과적으로 가능하게 하였으며, 구조 유사성에 기반한 동적 학습 통합 또는 분리로 전이 가능성을 향상시켰다.
  • 이론적·실험적으로 이 방법이 계층 최적 정책에 이르게 하며, 특히 소스 도메인과 타겟 도메인이 동역학에서 다를 경우 가치 함수 전이보다 더 견고함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.