Skip to main content
QUICK REVIEW

[논문 리뷰] CROP: Certifying Robust Policies for Reinforcement Learning through Functional Smoothing

Fan Wu, Linyi Li|arXiv (Cornell University)|2021. 06. 17.
Adversarial Robustness in Machine Learning참고 문헌 70인용 수 4
한 줄 요약

CROP는 기능 스무딩을 통한 강화학습에서의 내성적 안정성 인증을 위한 처음으로 통합된 프레임워크를 제안하며, 각 상태별 행동 안정성과 누적 보상의 하한값이라는 두 가지 인증 기준을 도입한다. 국소적 및 전역적 스무딩 알고리즘을 활용하여 이론적으로 탄탄한 내성적 안정성 보장을 제공하며, 아타리, 하이웨이, 카트폴 환경을 포함한 다양한 환경과 알고리즘에서 날카로운 인증 성능을 입증한다. 이는 적대적 훈련 및 정규화된 강화학습 방법을 포함한다.

ABSTRACT

As reinforcement learning (RL) has achieved great success and been even adopted in safety-critical domains such as autonomous vehicles, a range of empirical studies have been conducted to improve its robustness against adversarial attacks. However, how to certify its robustness with theoretical guarantees still remains challenging. In this paper, we present the first unified framework CROP (Certifying Robust Policies for RL) to provide robustness certification on both action and reward levels. In particular, we propose two robustness certification criteria: robustness of per-state actions and lower bound of cumulative rewards. We then develop a local smoothing algorithm for policies derived from Q-functions to guarantee the robustness of actions taken along the trajectory; we also develop a global smoothing algorithm for certifying the lower bound of a finite-horizon cumulative reward, as well as a novel local smoothing algorithm to perform adaptive search in order to obtain tighter reward certification. Empirically, we apply CROP to evaluate several existing empirically robust RL algorithms, including adversarial training and different robust regularization, in four environments (two representative Atari games, Highway, and CartPole). Furthermore, by evaluating these algorithms against adversarial attacks, we demonstrate that our certification are often tight. All experiment results are available at website https://crop-leaderboard.github.io.

연구 동기 및 목표

  • 강화학습에서 이론적 내성적 안정성 인증의 부재, 특히 적대적 변형에 대한 순차적 의사결정 환경에서의 문제를 해결하기 위해.
  • 단일 스텝 예측을 넘어서 의미 있는 내성적 안정성 기준을 정의하기 위해, 행동 안정성과 누적 보상 내성성에 중점을 둔다.
  • Q-학습 기반 에이전트의 행동 및 보상 내성성에 대해 증명 가능한 보장을 제공하는 확장 가능하고 통합된 인증 프레임워크를 개발하기 위해.
  • 기존의 경험적으로 내성적인 강화학습 알고리즘의 인증된 내성성 수준을 적대적 공격 하에서 실증적으로 평가하고 비교하기 위해.
  • 인증이 상태 공간 내의 취약성 패턴을 드러내어 더 내성적인 정책 설계를 이끌 수 있음을 보여주기 위해.

제안 방법

  • 국소적 스무딩을 통한 각 상태별 행동 안정성과 전역적 및 국소적 스무딩을 통한 유한 수평의 누적 보상 하한값을 정의하는 두 가지 인증 기준을 제안한다.
  • 전체 트레이젝터리에 걸쳐 노이즈 시퀀스를 사용해 누적 보상의 기대치 또는 백분위수 하한값을 추정하는 전역 스무딩 방법인 CROP-GRe를 도입한다.
  • 행동 공간 내 반복적 탐색을 통해 날카로운 하한값 인증을 수행하는 적응형 국소 스무딩 알고리즘인 CROP-LoRe를 개발한다.
  • Q-함수에 랜덤화 스무딩을 적용해, 행동이 변경되지 않는 허용 가능한 편향 반경을 도출함으로써 상태 수준의 내성성 보장을 확보한다.
  • 기존 연구에서 사용된 결정론적 검증과 대비해 확률적 인증을 활용한 랜덤화 스무딩을 적용함으로써 더 넓은 적용 범위와 더 날카로운 하한값을 가능하게 한다.
  • CROP-LoRe에서 적응형 탐색을 활용해 누적 보상의 하한값을 정교화함으로써 전역 스무딩 기법 대비 더 날카로운 하한값을 확보한다.

실험 결과

연구 질문

  • RQ1제한된 변형 하에서 강화학습에서 행동과 누적 보상에 대한 공식적인 내성적 안정성 인증은 어떻게 수행할 수 있는가?
  • RQ2순차적 의사결정 환경에서 계산 효율성과 하한값의 날카로움 사이의 균형을 이루는 효과적인 인증 기법은 무엇인가?
  • RQ3기존의 경험적으로 내성적인 강화학습 알고리즘의 인증된 내성성은 다양한 환경과 정책 아키텍처에서 어떻게 달라지는가?
  • RQ4각 상태별 내성적 안정성 인증은 상태 공간 내 주기적 또는 구조적 취약성을 드러내어 표적 방어 개선에 기여할 수 있는가?
  • RQ5적대적 공격 하에서의 경험적 성능와 비교해, 누적 보상에 대한 인증된 하한값은 얼마나 날카로운가?

주요 결과

  • CROP는 강화학습에서 누적 보상 내성성 인증을 위한 첫 번째 프레임워크를 제공하며, 기존 전역 스무딩 기법보다 더 날카로운 새로운 하한값 인증 기법을 도입한다.
  • CROP-LoRe 알고리즘은 CROP-GRe에 비해 누적 보상에 대해 훨씬 더 날카로운 하한값을 확보하며, 적응형 국소 스무딩의 효과를 입증한다.
  • 프리웨이 환경에서 라디얼RL이 가장 높은 인증된 내성성 수준을 확보한 것으로 나타나, 인증이 방어 전략 비교에 실질적인 유용성을 지닌다는 점을 보여준다.
  • 각 상태별 인증은 페롱 환경에서 주기적인 내성성 패턴을 드러내어 일부 상태가 본질적으로 더 취약함을 확인함으로써 표적 방어 개선에 기여할 수 있음을 시사한다.
  • 적대적 공격 하에서의 실증 평가 결과, CROP의 인증된 하한값은 종종 경험적 성능과 유사한 수준의 날카로움을 보였으며, 이는 이론적 보장의 실용적 관련성을 검증한다.
  • 이 프레임워크는 네 가지 환경에서 아홉 개의 경험적으로 내성적인 강화학습 알고리즘을 성공적으로 평가하였으며, 인증된 내성성은 알고리즘 설계와 환경 역학 모두에 따라 달라진다는 점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.