Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Policy Gradient against Strong Data Corruption

Xuezhou Zhang, Yiding Chen|arXiv (Cornell University)|2021. 02. 11.
Reinforcement Learning in Robotics참고 문헌 73인용 수 10
한 줄 요약

이 논문은 강력한 데이터 오염 상황에서 보상과 전이 모두에서 최대 $\varepsilon$-비율의 에피소드가 적대적으로 오염된 상황에서도 $O(\varepsilon^{1/4})$-최적 정책을 달성하는 강력한 강화학습 알고리즘인 필터링 정책 기울기(FPG)를 제안한다. FPG는 자연 정책 기울기 프레임워크 내에서 오염된 데이터를 거르는 필터링 메커니즘을 사용하여 무한대 보상 오염에 대한 저항성을 높이며, 선형 오염 예산 하에서 실패하는 이전 방법들보다 뛰어난 성능을 보인다.

ABSTRACT

We study the problem of robust reinforcement learning under adversarial corruption on both rewards and transitions. Our attack model assumes an extit{adaptive} adversary who can arbitrarily corrupt the reward and transition at every step within an episode, for at most $ε$-fraction of the learning episodes. Our attack model is strictly stronger than those considered in prior works. Our first result shows that no algorithm can find a better than $O(ε)$-optimal policy under our attack model. Next, we show that surprisingly the natural policy gradient (NPG) method retains a natural robustness property if the reward corruption is bounded, and can find an $O(\sqrtε)$-optimal policy. Consequently, we develop a Filtered Policy Gradient (FPG) algorithm that can tolerate even unbounded reward corruption and can find an $O(ε^{1/4})$-optimal policy. We emphasize that FPG is the first that can achieve a meaningful learning guarantee when a constant fraction of episodes are corrupted. Complimentary to the theoretical results, we show that a neural implementation of FPG achieves strong robust learning performance on the MuJoCo continuous control benchmarks.

연구 동기 및 목표

  • 보상과 전이 모두에서 강력하고 적응적인 데이터 오염 상황에서 정책 기울기 방법의 낮은 내성적 저항성 문제를 해결한다.
  • 일정 비율의 에피소드가 오염되어도 효과적으로 작동하는 알고리즘을 개발한다. 이는 이전 방법들이 실패하는 설정이다.
  • 오염 수준 $\varepsilon$를 사전에 알지 못해도 되는 조건에서 유한 및 무한 보상 오염 하에서의 내성적 저항성에 대한 이론적 보장을 제공한다.
  • MuJoCo 벤치마크에서 신경망 구현을 통해 실용적 적용 가능성을 입증한다.

제안 방법

  • 정책 기울기 업데이트 중에 오염된 데이터를 거르는 필터링 메커니즘을 적용하는 필터링 정책 기울기(FPG) 알고리즘을 제안한다.
  • 정책 $\pi$ 하에서 상태-행동 쌍과 수익 추정치를 수집하기 위해 $d_{\nu}^{\pi}$-샘플러와 $Q^{\pi}$-추정기를 사용한다. 이는 적대적 탈선 상황에서도 작동한다.
  • 가중치 벡터 $w$에 대해 유계 $\ell_2$-노름 제약 조건을 적용하여 가치 함수의 기울기를 선형 회귀로 추정한다.
  • 선형 회귀 단계 동안 오염된 에피소드를 식별하고 제거하는 필터링 단계를 도입하여 무한대 보상 오염에 대한 저항성을 향상시킨다.
  • 학습률 $\eta$를 사용한 자연 정책 기울기 업데이트를 적용하며, $\theta^{(t+1)} = \theta^{(t)} + \eta w^{(t)}$로 갱신한다.
  • 알고리즘이 오염 수준 $\varepsilon$에 적응적이며, $\varepsilon$를 사전에 알 필요 없이 작동하도록 보장한다.

실험 결과

연구 질문

  • RQ1보상과 전이 모두에서 강력하고 적응적인 오염이 발생하는 상황에서, $O(\varepsilon)$-최적 정책보다 나은 성능을 달성할 수 있는 알고리즘이 존재하는가?
  • RQ2자연 정책 기울기(NPG) 방법은 유한 보상 오염 하에서도 내성적 저항성을 유지하는가? 만약 그렇다면 어느 정도까지인가?
  • RQ3수정된 정책 기울기 방법은 무한대 보상 오염에도 견딜 수 있으며, 여전히 의미 있는 성능 보장을 달성할 수 있는가?
  • RQ4연속 제어 환경에서 높은 오염률 상황에서도 내성적 저항성을 유지할 수 있는 실용적이고 신경망 호환 알고리즘을 설계할 수 있는가?

주요 결과

  • 제안된 강력한 오염 모델 하에서 어떤 알고리즘도 $\Omega(\varepsilon)$-최적 정책을 보장할 수 없으며, 이는 이론적 하한을 설정한다.
  • 자연 정책 기울기(NPG)는 유한 보상 오염 하에서 $O(\sqrt{\varepsilon})$-최적성 달성으로 내재된 저항성을 입증한다.
  • 제안된 필터링 정책 기울기(FPG) 알고리즘은 무한대 보상 오염 하에서도 $O(\varepsilon^{1/4})$-최적성 달성으로, 일정 비율 오염 상황에서 처음으로 이러한 보장을 제공한다.
  • FPG는 오염 수준에 적응적이며, $\varepsilon$를 사전에 알 필요 없이 작동하므로 실세계 적용에 실용적이다.
  • FPG의 신경망 구현은 MuJoCo 연속 제어 벤치마크에서 뛰어난 내성적 학습 성능을 보이며 실용성을 입증한다.
  • 이론적 분석 결과, 유한 오염 하에서는 Q-가치 회귀의 추정 오차가 유계 유지되어 근사 최적 정책 수렴이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.