[논문 리뷰] APRIL: Active Preference-learning based Reinforcement Learning
APRIL는 선택의 근사 기대효용(AEUS) 기준을 사용하여 반복적으로 정책을 개선함으로써 전문가 피드백을 최소화하는 능동형 선호 기반 강화학습 프레임워크를 제안한다. 마운틴카 및 암 치료 과제에서 단지 12회의 전문가 비교만으로도 기존의 IRL 및 CMA-ES보다 샘플 효율성이 뛰어나며 최신 기술 수준의 성능을 달성한다.
This paper focuses on reinforcement learning (RL) with limited prior knowledge. In the domain of swarm robotics for instance, the expert can hardly design a reward function or demonstrate the target behavior, forbidding the use of both standard RL and inverse reinforcement learning. Although with a limited expertise, the human expert is still often able to emit preferences and rank the agent demonstrations. Earlier work has presented an iterative preference-based RL framework: expert preferences are exploited to learn an approximate policy return, thus enabling the agent to achieve direct policy search. Iteratively, the agent selects a new candidate policy and demonstrates it; the expert ranks the new demonstration comparatively to the previous best one; the expert's ranking feedback enables the agent to refine the approximate policy return, and the process is iterated. In this paper, preference-based reinforcement learning is combined with active ranking in order to decrease the number of ranking queries to the expert needed to yield a satisfactory policy. Experiments on the mountain car and the cancer treatment testbeds witness that a couple of dozen rankings enable to learn a competent policy.
연구 동기 및 목표
- 선호 기반 강화학습에서 필요로 하는 전문가 순위 쿼리 수를 줄이는 것.
- 보상 함수가 이용 불가능하고 시연가 실현 가능하지 않은 복잡한 도메인(예: 군집 로봇 공학)에서 효과적인 정책 학습을 가능하게 하는 것.
- 능동 학습과 선호 기반 정책 학습을 융합하여 유능한 정책에로의 수렴을 가속화하는 것.
- 고차원 공간에서 파arametric 정책 표현에 대해 비연속적인 정책 행동을 다루는 과제를 해결하는 것.
- 연속적이고 고차원적인 정책 공간에서 베이지안 능동 학습의 확장 가능한, 실용적인 대안을 개발하는 것.
제안 방법
- 선호 기반 정책 학습과 능동 순위를 융합한 능동형 선호 기반 강화학습(APRIL) 알고리즘을 도입한다.
- 가장 정보가 많은 정책을 전문가 평가를 위해 선택하기 위해 근사 기대효용의 선택(AEUS) 기준을 사용한다.
- 두 공간 프레임워크를 사용: 최적화를 위한 파arametric 정책 공간과 선호 모델링을 위한 행동 공간으로, 비연속적인 사상 Φ를 통해 연결된다.
- 고차원 공간에서 베이지안 스타일의 능동 학습을 가능하게 하기 위해 Φ⁻¹의 역함수를 접근 가능한 대체함수로 근사한다.
- 정책 경로 간의 쌍별 비교 형태의 전문가 피드백을 활용하여 정책 수익률 추정치를 개선한다.
- 베이지안 최적화를 모방한 접근 방식을 사용하여 기대 정보 수확량을 최대화하는 새로운 후보 정책을 선택한다.
실험 결과
연구 질문
- RQ1능동형 선호 학습은 강화학습에서 능력 있는 정책을 학습하기 위해 필요한 전문가 비교 수를 줄일 수 있는가?
- RQ2고차원 파arametric 정책 공간에서 비연속적인 정책 행동 사상에 대해 베이지안 능동 학습을 어떻게 적응시킬 수 있는가?
- RQ3몇 십 개의 전문가 비교로 IRL 또는 CMA-ES 수준의 성능을 달성할 수 있는가?
- RQ4보상 함수 설계가 불가능하고 시범이 실현 불가능한 환경에서 APRIL은 어떻게 성능을 발휘하는가?
- RQ5AEUS는 복잡한 강화학습 환경에서 정확한 선택 기대효용의 실용적인 대안을 제공할 수 있는가?
주요 결과
- APRIL는 마운틴카 과제에서 단지 15회의 전문가 비교만으로도 최신 기술 수준의 성능을 달성했으며, IRL 및 CMA-ES를 능가했다.
- 암 치료 시험 환경에서 APRIL는 20회 이내의 반복과 약 12회의 비교로 최적 성능에 도달했고, CMA-ES는 수렴하지 못했다.
- 마운틴카 환경에서 APRIL는 15회 반복 후 IRL 성능을 따라하거나 초월했으며, IRL의 시범 기반 접근 방식에 비해도 유사한 성능을 달성했다.
- 노이즈 수준이 σ_noise = 0.2 이하일 동안도 메서드는 안정적인 성능을 유지했으며, 101회의 실행에서 일관된 결과를 보였다.
- AEUS 기준은 효율적인 정책 선택을 가능하게 하여, 비능동 방법 대비 전문가 쿼리 수를 10배 줄였다.
- 실험 결과, 보상 형태 조정이나 시범 없이도 몇 십 비트의 선호 피드백(비교)만으로도 능력 있는 정책을 학습하는 데 충분함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.