Skip to main content
QUICK REVIEW

[논문 리뷰] Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments

Amin Rakhsha, Xuezhou Zhang|arXiv (Cornell University)|2021. 02. 16.
Adversarial Robustness in Machine Learning인용 수 16
한 줄 요약

이 논문은 환경이나 학습 알고리즘에 대한 사전 지식이 전혀 없는 상황에서도 작동하는 새로운 블랙박스 보상 훼손 공격인 U2를 제안한다. 최소한의 가정에도 불구하고 U2는 무작위 탐색 행동을 활용하여 화이트박스 공격에 근접한 성능를 달성하며, 환경이 완전히 알려지지 않은 상황에서도 효과적인 보상 훼손이 가능함을 보여준다.

ABSTRACT

We study black-box reward poisoning attacks against reinforcement learning (RL), in which an adversary aims to manipulate the rewards to mislead a sequence of RL agents with unknown algorithms to learn a nefarious policy in an environment unknown to the adversary a priori. That is, our attack makes minimum assumptions on the prior knowledge of the adversary: it has no initial knowledge of the environment or the learner, and neither does it observe the learner's internal mechanism except for its performed actions. We design a novel black-box attack, U2, that can provably achieve a near-matching performance to the state-of-the-art white-box attack, demonstrating the feasibility of reward poisoning even in the most challenging black-box setting.

연구 동기 및 목표

  • 공격자가 환경이나 강화학습 에이전트의 학습 알고리즘에 대해 전혀 알지 못하는 가장 현실적이고 도전적인 환경에서 보상 훼손 공격의 가능성을 탐구하는 것.
  • 에이전트의 행동만 관찰하고 내부 메커니즘을 알지 못하는 최소한의 가정 하에 작동하는 블랙박스 공격 전략을 설계하는 것.
  • 사전 지식이 전혀 없음에도 불구하고 정교하게 설계된 보상 조작을 통해 에이전트가 악성 정책을 학습하도록 유도할 수 있음을 보여주는 것.
  • 무작위 탐색이 보장되는 강화학습 알고리즘을 기반으로 하여 전체 상태-행동 공간을 효율적으로 탐색할 수 있는 새로운 탐색 서브루틴을 개발하는 것.

제안 방법

  • 에이전트의 행동만 관찰하고 학습 알고리즘이 무작위 탐색을 따르는 것으로 가정하는 블랙박스 보상 훼손 공격인 U2를 제안한다.
  • 모든 무작위 탐색 강화학습 알고리즘을 보상 없이, 작업에 종속되지 않는 학습자로 전환시킬 수 있는 탐색 서브루틴을 설계한다. 이는 전체 상태-행동 공간을 효율적으로 탐색할 수 있도록 한다.
  • 이중 단계 공격 전략을 사용한다: 첫 번째로, 모든 상태-행동 쌍에 걸쳐 데이터를 수집하기 위한 자기지도 탐색 단계; 두 번째로, 에이전트가 원하는 정책을 학습하도록 유도하기 위한 타겟팅된 훼손 단계.
  • 확률적 농도 경계와 부분최적성 분석을 활용하여 공격 비용을 제한함으로써, 최소한의 가정 하에 최적의 화이트박스 공격에 근접한 비용을 확보한다.
  • 무작위 탐색 학습 알고리즘이 본질적으로 탐색을 수행하므로, 공격자는 이를 활용하여 효과적인 훼손을 위해 충분한 데이터를 확보할 수 있다.
  • 보상 변형과 정책 이탈을 모두 고려하는 강건성 인식 비용 함수를 도입하여, 공격가가 침투성과 효과성을 유지할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1환경이나 강화학습 에이전트의 학습 알고리즘에 대한 사전 지식이 전혀 없는 블랙박스 환경에서도 효과적인 보상 훼손을 달성할 수 있는가?
  • RQ2무작위 탐색 강화학습 에이전트의 탐색 행동을 어떻게 활용하여 사전 지식 없이도 훼손을 위한 충분한 데이터를 확보할 수 있는가?
  • RQ3공격자가 진짜 환경 동역학이나 에이전트의 내부 파rameter에 접근할 수 없는 상황에서, 블랙박스 공격이 화이트박스 공격의 성능을 어느 정도 따라올 수 있는가?
  • RQ4알 수 없는 환경에서 효과적인 보상 훼손을 가능하게 하는 자기지도 탐색 서브루틴을 설계할 수 있는가?
  • RQ5최소한의 가정 하에 이러한 공격의 비용과 성공률에 대해 이론적으로 어떤 보장을 제공할 수 있는가?

주요 결과

  • U2는 환경이나 학습 알고리즘에 대한 사전 지식이 전혀 없음에도 불구하고, 최적의 화이트박스 공격 비용에 상수 요소 내에서 근접한 공격 비용을 달성한다.
  • 공격 비용은 목표 정책의 부분최적성에 비례하는 항목으로 제한되며, 이는 목표 정책이 에이전트의 행동과 완벽하게 일치하지 않더라도 공격 방법이 여전히 효과적임을 보여준다.
  • 탐색 서브루틴은 전체 상태-행동 공간의 커버리지 성공을 보장하며, 이는 공격의 성공에 필수적이며 향후 강화학습 작업에 독립적인 관심사로도 중요하다.
  • 확률적으로 매우 높은 수준(최소 1−4p 이상)에서 공격 비용이 유한하고 최적에 가깝게 유지되며, 이는 농도 부등식과 유니온 바운드를 사용하여 증명되었다.
  • 공격자가 진짜 환경 동역학이나 에이전트의 내부 정책을 관찰하지 못하는 상황에서도 공격이 효과를 유지함으로써, 현실적인 환경에서 블랙박스 보상 훼손의 가능성을 입증한다.
  • 이론적 분석을 통해 공격자가 최소한의 가정 하에 근접한 최적 성능를 달성할 수 있음을 확인하였으며, 이는 이전에 효과적인 공격를 위해 화이트박스 지식이 반드시 필요하다는 가정을 도전한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.