Skip to main content
QUICK REVIEW

[논문 리뷰] Sample-Efficient Multi-Objective Learning via Generalized Policy Improvement Prioritization

Lucas N. Alegre, Ana L. C. Bazzan|arXiv (Cornell University)|2023. 01. 18.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

이 논문은 일반화된 정책 개선(GPI)을 활용하여 학습 목표와 경험 재사용을 우선순위화함으로써 단조성 향상과 최적 또는 ε-최적 해수렴을 보장하는 샘플 효율적인 모델 기반 다목적 강화학습(MORL) 알고리즘을 제안한다. 이는 GPI 이론에 기반한 공식적으로 유도된 우선순위 부여 체계를 사용함으로써 이산 및 연속 제어 과제에서 최신 기법들을 능가한다.

ABSTRACT

Multi-objective reinforcement learning (MORL) algorithms tackle sequential decision problems where agents may have different preferences over (possibly conflicting) reward functions. Such algorithms often learn a set of policies (each optimized for a particular agent preference) that can later be used to solve problems with novel preferences. We introduce a novel algorithm that uses Generalized Policy Improvement (GPI) to define principled, formally-derived prioritization schemes that improve sample-efficient learning. They implement active-learning strategies by which the agent can (i) identify the most promising preferences/objectives to train on at each moment, to more rapidly solve a given MORL problem; and (ii) identify which previous experiences are most relevant when learning a policy for a particular agent preference, via a novel Dyna-style MORL method. We prove our algorithm is guaranteed to always converge to an optimal solution in a finite number of steps, or an $ε$-optimal solution (for a bounded $ε$) if the agent is limited and can only identify possibly sub-optimal policies. We also prove that our method monotonically improves the quality of its partial solutions while learning. Finally, we introduce a bound that characterizes the maximum utility loss (with respect to the optimal solution) incurred by the partial solutions computed by our method throughout learning. We empirically show that our method outperforms state-of-the-art MORL algorithms in challenging multi-objective tasks, both with discrete and continuous state and action spaces.

연구 동기 및 목표

  • 다목적 강화학습(MORL)에서 목표 간 무게 조정에 따른 다양한 정책 학습이 환경 상호작용을 광범위하게 요구하는 샘플 비효율성 문제를 해결하기 위해.
  • 각 학습 단계에서 어떤 선호 무게를 학습할지 결정하는 원리적이고 공식적으로 기반된 방법을 개발하여 수렴 속도와 해의 품질을 향상시키기 위해.
  • 새로운 다이나 스타일의 MORL 접근법을 통해 과거 경험 중 계획에 가장 관련성이 높은 것을 식별하고 효율적으로 재사용함으로써 과거 경험의 재사용을 최적화하기 위해.
  • 부분 해의 단조적 향상을 보장하고 학습 과정에서의 유틸리티 손실에 대한 이론적 경계를 제공하기 위해.
  • 기존의 표본 또는 이산 방법의 한계를 극복하기 위해 모델 기반 MORL을 연속 상태 및 동작 공간으로 확장하기 위해.

제안 방법

  • 알고리즘은 일반화된 정책 개선(GPI)을 사용하여 각 후보 선호 무게 벡터에 대해 성능 향상의 하한을 유도함으로써, 학습에 가장 유망한 목표를 우선순위로 정렬한다.
  • 과거 경험을 선택적으로 샘플링하고 재사용하는 다이나 스타일의 계획 기반 메커니즘을 도입하여 특정 선호 무게에 대한 정책 향상을 위한 잠재력을 고려한다.
  • 정책의 볼록 커버리지 세트(CCS)를 유지하고 점진적으로 향상시킴으로써, 정책이 부분적으로 최적일 경우에도 단조적 향상을 보장한다.
  • 각 학습 반복 단계에서 부분 해의 최대 유틸리티 손실을 공식적으로 경계하여, 학습 중 해의 품질에 대한 이론적 보장을 제공한다.
  • 이 알고리즘은 언제라도 유효한 해를 반환할 수 있도록 설계된 '언제라도 알고리즘'(anytime algorithm)으로, 지속적으로 CCS를 향상시킨다.
  • 연속 상태 및 동작 공간을 지원하여, 표본이나 이산 설정을 초월한 실제 복잡한 환경에 적용 가능하다.

실험 결과

연구 질문

  • RQ1선호 무게에 대한 GPI 기반 우선순위 체계는 MORL에서 수렴 속도 향상과 샘플 효율성 향상에 기여하는가?
  • RQ2과거 경험을 선택적으로 재사용하는 다이나 스타일의 계획 기반 메커니즘은 특정 에이전트 선호도에 대한 정책 학습을 가속화하는가?
  • RQ3제안된 알고리즘은 정책이 부분적으로 최적일 경우에도 학습 중 부분 해의 단조적 향상을 보장하는가?
  • RQ4이 방법은 학습 과정 전반에 걸쳐 일시적인 해에 의해 발생하는 최대 유틸리티 손실에 대한 공식적 경계를 제공하는가?
  • RQ5이 알고리즘은 이론적 보장과 샘플 효율성을 유지하면서 연속 상태 및 동작 공간으로 확장 가능한가?

주요 결과

  • 제안된 알고리즘은 이산 및 연속 제어 과제에서 최신 기법들을 능가하며, 더 적은 환경 상호작용 수로도 뛰어난 성능을 달성한다.
  • 연속 제어 벤치마크에서, 이 방법은 환경 상호작용 예산을 10분의 1로 줄였음에도 불구하고 경쟁하는 진화 알고리즘을 뛰어넘었다.
  • 알고리즘은 유한한 단계 내에 최적 해수렴을 보장하거나 자원 제약 하에 ε-최적 해수렴을 보장하며, 유틸리티 손실이 경계되어 있다.
  • 중간 정책이 부분적으로 최적일지라도 학습 전반에 걸쳐 볼록 커버리지 세트(CCS)의 품질이 단조롭게 향상된다.
  • 유틸리티 손실에 대한 이론적 경계는 각 반복 단계에서 해의 품질을 공식적으로 측정할 수 있게 하여 신뢰할 수 있는 진행 상황 모니터링을 가능하게 한다.
  • GPI 기반 우선순위 체계는 OLS와 같은 히우리스틱 기반 방법보다 더 정확하게 영향력이 큰 선호 무게를 식별하여 낭비된 계산을 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.