Skip to main content
QUICK REVIEW

[논문 리뷰] Online Robustness Training for Deep Reinforcement Learning

M. L. Fischer, Matthew Mirman|arXiv (Cornell University)|2019. 11. 03.
Adversarial Robustness in Machine Learning참고 문헌 44인용 수 12
한 줄 요약

이 논문은 Q-네트워크 학습과 정책 네트워크(학생) 학습을 분리하여 온라인 내성 훈련을 가능하게 하는 새로운 딥 강화학습 프레임워크인 RS-DQN을 제안한다. Q-값을 학생 네트워크로 흡수함으로써 RS-DQN은 최신의 적대적 및 증명 가능 내성 훈련 방법을 통합하여, 아타리 게임에서 기울기 기반 공격(예: PGD)에 대해 강력한 내성을 확보하면서도 표준 DQN과 비교해도 성능을 유지한다.

ABSTRACT

In deep reinforcement learning (RL), adversarial attacks can trick an agent into unwanted states and disrupt training. We propose a system called Robust Student-DQN (RS-DQN), which permits online robustness training alongside Q networks, while preserving competitive performance. We show that RS-DQN can be combined with (i) state-of-the-art adversarial training and (ii) provably robust training to obtain an agent that is resilient to strong attacks during training and evaluation.

연구 동기 및 목표

  • 입력 상태가 변형되어 성능이 떨어지는 기울기 기반 적대적 공격으로부터 딥 강화학습 에이전트의 취약성을 해결하기 위해.
  • 이전에 지도학습에서 사용된 고급 내성 훈련 기법들을 딥 RL 훈련 파이프라인에 통합할 수 있도록 하기 위해.
  • 청정(공격되지 않은) 조건에서의 경쟁력 있는 성능를 유지하면서 동시에 적대적 변형 조건에서의 내성을 크게 향상시키기 위해.
  • 기호적 내성 훈련 방법을 사용하여 아타리 환경에서 픽셀 수준의 변형(예: ±1 픽셀)에 대해 증명 가능한 내성을 입증하기 위해.
  • Q-네트워크의 성능나 학습 역학에 영향을 주지 않고 정책 네트워크에 대한 방어적 훈련을 가능하게 하는 훈련 프레임워크를 설계하기 위해.

제안 방법

  • 표준 DQN을 가치 추정을 위한 Q-네트워크와 행동 선택을 위한 학생 정책 네트워크로 분해함으로써, 정책 네트워크를 별도로 내성 목표로 훈련시킬 수 있도록 한다.
  • 지식 흡수를 통해 Q-네트워크의 Q-값 예측을 학생 네트워크로 전달함으로써, 학생 네트워크가 최적의 정책을 학습하도록 보장한다.
  • PGD 기반의 적대적 상태를 사용하여 학생 네트워크에 대해 적대적 훈련을 적용함으로써, 최적의 행동 선택 확률을 최소화한다.
  • 기호적 간격 분석(DiffAI 사용)을 통한 증명 가능 내성 훈련을 적용하여, 각 상태 주변의 유한한 변형 영역 내에서 정확한 행동 선택을 보장한다.
  • 훈련 중에 내성 손실 가중치와 변형 반경을 점진적으로 감소시켜 정확도와 내성 간의 균형을 맞춘다.
  • Q-네트워크는 표준 DQN 훈련을 유지하면서도, 탐색과 행동 선택에는 학생 네트워크를 사용함으로써 훈련 안정성을 유지한다.

실험 결과

연구 질문

  • RQ1지도학습에서 사용된 최신의 적대적 훈련 방법이 딥 강화학습으로 효과적으로 이식되어 내성 정책 학습에 기여할 수 있는가?
  • RQ2증명 가능 내성 훈련이 DQN 프레임워크에 통합되어 RL 환경에서 유한한 입력 변형에 대해 내성을 보장할 수 있는가?
  • RQ3가치 네트워크 학습과 정책 학습을 분리함으로써 Q-네트워크 성능에 손상 없이 내성 훈련을 수행할 수 있는가?
  • RQ4DQN 에이전트가 청정 조건에서 성능를 유지하면서도 적대적 공격 조건에서 강력한 내성을 확보할 수 있는가?
  • RQ5아타리 게임에서 에이전트의 행동이 증명 가능하게 정확한 상태에 도달할 수 있는 최대 변형 반경(픽셀 강도 기준)은 얼마인가?

주요 결과

  • 청정 평가 조건에서 RS-DQN은 표준 DQN과 유사한 성능를 보이며, 평균 점수는 Freeway에서 32.53, Bank Heist에서 154.00, Boxing에서 90.47을 기록했고, 각각 DQN의 33.00, 222.00, 95.87보다 약간 낮다.
  • PGD 공격(k=4) 조건에서 DQN의 성능는 붕괴된다(예: Pong에서 5.13), 반면 RS-DQN은 Pong에서 5.13, Boxing에서 90.47을 기록하며 내성을 유지한다.
  • 증명 가능 내성 훈련을 통해 RS-DQN은 최소 증명 가능 내성 반경 ε_max = 2.028(255로 배율 조정됨)를 확보하여, Freeway에서 ±1 픽셀 변화에 대해 증명 가능한 내성을 확보했다.
  • Bank Heist에서는 RS-DQN이 ε_max = 1.373를 기록하여, ±1 픽셀 변형에 대해 보장된 행동 정확성을 확보했다.
  • 증명 가능 내성 RS-DQN 에이전트는 DQN(154.00 대비 222.00)에 비해 성능 격차를 유지하지만, 강력한 내성 보장을 고려하면 이는 수용 가능한 트레이드오프이다.
  • 메서드는 Q-네트워크의 학습에 손상 없이 온라인 내성 훈련을 성공적으로 가능하게 했으며, 테스트된 모든 아타리 환경에서 안정적인 훈련 및 평가 곡선을 통해 이를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.