Skip to main content
QUICK REVIEW

[논문 리뷰] Meta-Gradient Reinforcement Learning with an Objective Discovered Online

Zhongwen Xu, Hado van Hasselt|arXiv (Cornell University)|2020. 07. 16.
Reinforcement Learning in Robotics참고 문헌 39인용 수 35
한 줄 요약

이 논문은 FRODO를 소개합니다. 이는 RL 목표를 스스로 발견하고 업데이트하는 온라인 메타-그래디언트 프레임워크로, 온라인 적응과 작업 전반에 걸친 학습 효율성 향상을 가능하게 하며, Atari 게임을 포함한 다양한 작업에 적용됩니다.

ABSTRACT

Deep reinforcement learning includes a broad family of algorithms that parameterise an internal representation, such as a value function or policy, by a deep neural network. Each algorithm optimises its parameters with respect to an objective, such as Q-learning or policy gradient, that defines its semantics. In this work, we propose an algorithm based on meta-gradient descent that discovers its own objective, flexibly parameterised by a deep neural network, solely from interactive experience with its environment. Over time, this allows the agent to learn how to learn increasingly effectively. Furthermore, because the objective is discovered online, it can adapt to changes over time. We demonstrate that the algorithm discovers how to address several important issues in RL, such as bootstrapping, non-stationarity, and off-policy learning. On the Atari Learning Environment, the meta-gradient algorithm adapts over time to learn with greater efficiency, eventually outperforming the median score of a strong actor-critic baseline.

연구 동기 및 목표

  • 온라인 메타-그래디언트 디센트를 사용하여 수작업으로 설계된 RL 목표가 아니라 목표 자체를 학습하도록 동기를 부여합니다.
  • 경험으로부터 학습될 RL 업데이트 타깃을 매개화하는 메타 네트워크를 개발합니다.
  • 부트스트래핑, 비정상성 및 오프정책 학습을 다루기 위한 목표의 온라인 적응을 가능하게 합니다.
  • 온라인 목표 발견이 복잡한 환경에서 고정 베이스라인보다 성능이 우수함을 입증합니다.

제안 방법

  • 궤적을 스칼라 타깃으로 매핑하는 메타 네트워크 g_eta로 RL 업데이트 타깃 G를 매개화합니다.
  • 에이전트 매개변수 theta에 대한 M번의 내부 업데이트를 역전파하여 eta를 최적화하기 위한 메타-그래디언트 디센트를 적용합니다.
  • 검증 궤적에서 외부 손실 L_outer를 사용하여 eta에 대한 메타-그래디언트를 계산합니다.
  • 프레임워크를 FRODO (Flexible Reinforcement Objective Discovered Online)로 구현하고 예측, 가치 기반 제어 및 액터-크리틱 설정에 적용합니다.
  • 대규모 실험에서 G_eta를 시간-자기 일관성에 가까이 정규화하는 일관성 손실을 도입하고, 오프-정책 보정을 위해 VTrace를 사용합니다.

실험 결과

연구 질문

  • RQ1온라인 메타-그래디언트 접근법이 수작업으로 설계된 목표 없이도 유용한 RL 업데이트 타깃을 발견할 수 있는가?
  • RQ2온라인 목표 발견이 RL의 부트스트래핑과 비정상성에 어떻게 대응할 수 있는가?
  • RQ3다양한 작업에서 업데이트 타깃의 온라인 발견이 강력한 actor-critic 베이스라인보다 성능 향상을 가져오는가?
  • RQ4메타-그래디언트에서 목표를 학습된 타깃으로 표현하는 것과 학습된 손실로 표현하는 것의 차이는 무엇인가?

주요 결과

  • 토이 도메인에서 학습된 타깃은 부트스트래핑과 비정상성 처리를 가능하게 하며, 고정된 look-ahead 베이스라인보다 성능이 좋습니다.
  • 57개의 Atari 게임에서 메타-그래디언트 알고리즘은 충분한 학습 이후 강력한 actor-critic 베이스라인의 중앙값 점수를 능가합니다.
  • 학습된 타깃은 게임 간 VTrace 타깃과 다르게 발산되어, 서로 다른 온라인 목표의 발견을 시사합니다.
  • 타깃을 표현하는 쪽이 손실을 표현하는 것보다 온라인 학습의 안정성을 더 높입니다.
  • 수정적 일관성에 대한 규제(자기 일관성 방향의 정규화)를 포함한 보편적인 일관성 손실은 학습 속도를 크게 증가시키고 성능을 향상시키는 반면, 너무 강한 정규화는 결과에 해를 끼칩니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.