Skip to main content
QUICK REVIEW

[논문 리뷰] Action Robust Reinforcement Learning and Applications in Continuous Control

Chen Tessler, Yonathan Efroni|arXiv (Cornell University)|2019. 01. 26.
Adversarial Robustness in Machine Learning참고 문헌 43인용 수 65
한 줄 요약

논문은 RL에서 액션 불확실성에 대한 두 가지 행동-강건 기준(PR-MDP 및 NR-MDP)을 정식화하고, PR-MDP에 대한 이론적 보장을 제공하며, 딥 RL 확장과 AR-DDPG를 통해 연속 제어 과제에서 강건성과 성능 향상을 시연한다.

ABSTRACT

A policy is said to be robust if it maximizes the reward while considering a bad, or even adversarial, model. In this work we formalize two new criteria of robustness to action uncertainty. Specifically, we consider two scenarios in which the agent attempts to perform an action $a$, and (i) with probability $α$, an alternative adversarial action $\bar a$ is taken, or (ii) an adversary adds a perturbation to the selected action in the case of continuous action space. We show that our criteria are related to common forms of uncertainty in robotics domains, such as the occurrence of abrupt forces, and suggest algorithms in the tabular case. Building on the suggested algorithms, we generalize our approach to deep reinforcement learning (DRL) and provide extensive experiments in the various MuJoCo domains. Our experiments show that not only does our approach produce robust policies, but it also improves the performance in the absence of perturbations. This generalization indicates that action-robustness can be thought of as implicit regularization in RL problems.

연구 동기 및 목표

  • 실세계의 연속 제어 작업에 대한 RL의 액션 불확실성에 대한 강건성 동기를 부여한다.
  • 공격적이거나 교란된 행동을 모델링하는 두 가지 강건성 기준(PR-MDP 및 NR-MDP)을 도입한다.
  • PR-MDP 및 NR-MDP의 이론적 특성과 이중성을 확립하고 정책 반복 스킴을 도출한다.
  • 딥 RL로 확장하고 MuJoCo 실험을 통해 강건한 성능 및 일반화를 검증한다.

제안 방법

  • PR-MDP를 확률 α의 경우 상대가 더 나쁜 행동을 취하는 제로섬 게임으로 정의하고 최대-최소 목표를 도출한다.
  • NR-MDP를 정의하고 선택된 행동에 교란을 추가하는 적대자를 분석한다.
  • PR-MDP에 대해 결정적 정적 최적 정책의 존재 및 강한 이중성을 증명한다.
  • PR-MDP용 정책 반복 스킴(확률적 강건 PI 및 소프트 PR-PI)을 제안하고 수렴을 논의한다.
  • 연속 제어에서 행위자 네트워크와 적대자 네트워크를 통합하고 공동 행동에 대한 비평가를 포함한 AR-DDPG를 개발한다.
  • PR- 및 NR-MDP 설정에서 행위자와 적대자의 기울기 기반 업데이트 규칙을 제공한다(정리 5).

실험 결과

연구 질문

  • RQ1액션 불확실성을 RL에서 형식적으로 모델링하여 강건한 정책을 도출하는 방법은 무엇인가?
  • RQ2PR-MDP와 NR-MDP 프레임워크의 존재성, 이중성, 수렴성 등 이론적 특성은 무엇인가?
  • RQ3이 액션-강건 기준을 딥 RL로 확장해도 실제로 강건하거나 심지어 향상된 성능을 얻을 수 있는가?
  • RQ4MuJoCo 도메인 간에 액션 강건 방법이 일반화되고 다양한 교란 강도 하에서도 작동하는가?
  • RQ5확률적 액션 강건(PR-MDP)과 노이즈가 있는 액션 강건(NR-MDP) 사이의 실용적 거동 및 트레이드오프는 연속 제어에서 어떻게 나타나는가?

주요 결과

  • PR-MDP는 명확한 값이 존재하며 결정적 정적 최적 정책과 강한 이중성을 가진다.
  • NR-MDP는 일반적으로 최적을 위해 확률적 정책이 필요하며 결정적 정책 클래스에서 강한 이중성이 성립하지 않을 수 있다.
  • 소프트 PR-PI는 오류 없이 조건에서 내쉬 균형 값으로 수렴하고, PR-PI도 유사하게 수렴한다; 둘 다 에이전트와 적대자의 업데이트를 혼합하여 활용한다.
  • AR-DDPG는 DRL 구현으로 MuJoCo 도메인에서 강건한 정책을 학습할 수 있으며, 교란이 없어도 성능을 종종 향상시키는 경향이 있어 액션 강건성이 암묵적 정규화 효과로 작용한다.
  • 실증 결과는 하이퍼파라미터(예: α)가 강건성과 성능에 영향을 미치며, 많은 설정에서 PR-MDP가 NR-MDP보다 도메인 간 더 안정적인 행동을 보임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.