Skip to main content
QUICK REVIEW

[논문 리뷰] Defense Against Reward Poisoning Attacks in Reinforcement Learning

Kiarash Banihashem, Adish Singla|arXiv (Cornell University)|2021. 02. 10.
Adversarial Robustness in Machine Learning참고 문헌 44인용 수 9
한 줄 요약

이 논문은 훈련 중에 오염된 보상 함수로부터 유추된 타당한 진짜 보상 함수 하에서 최악의 성능을 최대화함으로써 강화학습에서 보상 오염 공격에 대비하는 최적화 프레임워크를 제안한다. 이 방어 전략은 증명 가능한 성능 보장을 달성하며, 공격자의 목표 정책에 대한 기대 수익의 하한과 부분최적성의 상한을 포함한다. 실험적 검증은 시뮬레이션 환경에서 수행되었다.

ABSTRACT

We study defense strategies against reward poisoning attacks in reinforcement learning. As a threat model, we consider attacks that minimally alter rewards to make the attacker's target policy uniquely optimal under the poisoned rewards, with the optimality gap specified by an attack parameter. Our goal is to design agents that are robust against such attacks in terms of the worst-case utility w.r.t. the true, unpoisoned, rewards while computing their policies under the poisoned rewards. We propose an optimization framework for deriving optimal defense policies, both when the attack parameter is known and unknown. Moreover, we show that defense policies that are solutions to the proposed optimization problems have provable performance guarantees. In particular, we provide the following bounds with respect to the true, unpoisoned, rewards: a) lower bounds on the expected return of the defense policies, and b) upper bounds on how suboptimal these defense policies are compared to the attacker's target policy. We conclude the paper by illustrating the intuitions behind our formal results, and showing that the derived bounds are non-trivial.

연구 동기 및 목표

  • 훈련 중에 보상 오염 공격을 받더라도 진짜 보상 함수 하에서 높은 유용성을 유지할 수 있는 방어 전략을 설계하는 것.
  • 에이전트가 오염된 보상을 뿐만 아니라 진짜로 오염되지 않은 보상 함수 하에서도 잘 수행되어야 한다는 과제를 해결하는 것.
  • 보상 오염 공격의 구조적 제약—특히 최소한의 수정 비용—을 활용하여 타당한 진짜 보상 함수를 추론하는 것.
  • 증명 가능하게 강력한 방어 정책을 개발하여 기대 수익의 하한과 공격자의 목표 정책에 대한 부분최적성의 상한을 보장하는 것.

제안 방법

  • 오염된 보상과 공격 제약 조건과 일치하는 타당한 진짜 보상 함수의 집합에 대한 최적화 문제로 방어 문제를 수식화하는 것.
  • 상태-행동 점유도 측도를 사용하여 보상 변화가 정책 최적성에 미치는 영향을 기술함으로써, 타당한 진짜 보상 함수를 추론할 수 있도록 하는 것.
  • 모든 타당한 진짜 보상 함수에 대해 최악의 기대 수익을 최대화함으로써 방어 정책을 구성함으로써, 악성 보상 조작에 대한 강건성을 확보하는 것.
  • 알려진 공격 매개변수와 알려지지 않은 매개변수를 모두 고려하는 이중 최적화 프레임워크를 활용하여, 적응형 방어 전략을 가능하게 하는 것.
  • 공격자의 최적성 갭과 보상 오염 메커니즘의 구조를 이용하여 방어 성능에 대한 이론적 상한을 유도하는 것.
  • 사슬 MDP 환경에서의 시뮬레이션을 통해 접근법을 검증하여, 공격자의 목표 정책과 기준 방어 전략보다 향상된 성능을 보여주는 것.

실험 결과

연구 질문

  • RQ1오염된 보상을 뿐만 아니라 진짜 보상 함수 하에서 높은 기대 수익을 유지할 수 있는 방어 정책을 설계할 수 있는가?
  • RQ2최소한의 비용이라는 구조적 제약 조건을 활용하여, 보상 오염 공격에서 타당한 진짜 보상 함수를 어떻게 추론할 수 있는가?
  • RQ3모든 타당한 진짜 보상 함수에 대해 최악의 성능을 최대화하는 방어 정책에 대해 어떤 이론적 성능 보장을 제공할 수 있는가?
  • RQ4진짜 보상 함수 하에서 방어 정책의 성능은 공격자의 목표 정책에 비해 어떻게 비교되는가?
  • RQ5공격 매개변수(예: 최적성 갭)가 알려지지 않았을 때도 방어 전략을 효과적으로 최적화할 수 있는가?

주요 결과

  • 방어 정책은 진짜 보상 함수 하에서 기대 수익의 하한을 확보하여, 최소한의 기준 수준 이상의 성능을 보장한다.
  • 방어 정책은 진짜 보상 함수 하에서 최적 정책으로부터 유한한 거리 이내에 있으며, 부분최적성의 상한은 공격 매개변수의 함수로 상한이 존재한다.
  • 시뮬레이션 결과, 방어 정책은 진짜 보상 하에서 점수 0.03을 기록하여 공격자의 목표 정책(-0.42)보다 뚜렷이 뛰어난 성능을 보였다.
  • 진짜 보상 하에서 방어 정책의 성능는 항상 오염된 보상 하에서의 성능보다 높았으며, 이는 이론적 예측을 확인하는 데 기여했다.
  • 공격 영향력이 공격자 정책의 최소 1/(2+δ) 배에 해당하며 상수 C를 더한 것으로 나타나, 공격 심화에 대한 강건성을 입증했다.
  • 공격 매개변수가 알려지지 않았을 경우에도 타당한 공격 시나리오의 집합에 대해 최적화함으로써 프레임워크가 여전히 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.