Skip to main content
QUICK REVIEW

[논문 리뷰] Non-Cooperative Inverse Reinforcement Learning

Xiangyuan Zhang, Kaiqing Zhang|arXiv (Cornell University)|2019. 11. 03.
Advancements in Semiconductor Devices and Circuit Design인용 수 15
한 줄 요약

이 논문은 한쪽의 정보가 불완전한 0-합 마르코프 게임인 비협력적 역강화학습(N-CIRL)을 소개한다. 여기서 수비자는 상호작용을 통해 공격자의 진짜 보상 함수를 학습하지만, 공격자는 의도적으로 자신의 목적을 은폐한다. 이 방법은 균형 전략을 위한 재귀 공식을 사용하며, 사이버 보안 시뮬레이션을 통해 N-CIRL이 MA-IRL보다 공격자 보상을 크게 낮춘다는 것을 보여주며, 상호작용과 행동을 병행하는 것이 전략적 속임수 상황에서 수비 성능을 향상시킨다는 것을 입증한다.

ABSTRACT

Making decisions in the presence of a strategic opponent requires one to take into account the opponent's ability to actively mask its intended objective. To describe such strategic situations, we introduce the non-cooperative inverse reinforcement learning (N-CIRL) formalism. The N-CIRL formalism consists of two agents with completely misaligned objectives, where only one of the agents knows the true objective function. Formally, we model the N-CIRL formalism as a zero-sum Markov game with one-sided incomplete information. Through interacting with the more informed player, the less informed player attempts to both infer, and act according to, the true objective function. As a result of the one-sided incomplete information, the multi-stage game can be decomposed into a sequence of single-stage games expressed by a recursive formula. Solving this recursive formula yields the value of the N-CIRL game and the more informed player's equilibrium strategy. Another recursive formula, constructed by forming an auxiliary game, termed the dual game, yields the less informed player's strategy. Building upon these two recursive formulas, we develop a computationally tractable algorithm to approximately solve for the equilibrium strategies. Finally, we demonstrate the benefits of our N-CIRL formalism over the existing multi-agent IRL formalism via extensive numerical simulation in a novel cyber security setting.

연구 동기 및 목표

  • 다중 에이전트 시스템에서 목적이 완전히 상충하는 상황, 특히 사이버 보안 환경에서의 가치 정렬 문제를 해결하기 위해.
  • 한 에이전트(공격자)가 진짜 보상 함수를 은폐하는 동안 다른 에이전트(수비자)가 관찰과 행동을 통해 이를 추론해야 하는 전략적 상호작용을 모델링하기 위해.
  • 한쪽의 정보가 불완전한 0-합 마르코프 게임에서 균형 전략 계산을 위한 계산적으로 실현 가능한 알고리즘을 개발하기 위해.
  • N-CIRL에서 학습과 실행을 병행하는 것이 균형 행동에서만 학습하는 것보다 수비 성과를 향상시키는지 경험적으로 입증하기 위해.
  • 비대칭 정보를 가진 확률적 게임에서 신호 전달과 신뢰도 조작의 이론적 기반을 제공하기 위해.

제안 방법

  • N-CIRL 문제를 한쪽(공격자)만 진짜 보상 함수를 알고 있는 0-합 마르코프 게임로 모델링한다.
  • 정보 구조에 기반하여 게임의 가치와 공격자의 균형 전략을 위한 재귀 공식을 유도한다.
  • 수비자의 균형 전략을 위한 재귀 공식을 도출하기 위해 쌍대 게임을 구성함으로써 최적의 학습 및 행동 정책 계산이 가능해진다.
  • 재귀 공식을 바탕으로 균형 전략을 효율적으로 계산할 수 있는 근사 알고리즘 NC-PBVI를 개발한다.
  • 공격 그래프를 사용한 새로운 사이버 보안 설정에 프레임워크를 적용하며, 악용은 상태 전이로 모델링하고 성공 확률을 부여한다.
  • 공격자가 새로운 시스템 상태를 활성화하는 데서 얻는 이득, 공격 비용, 그리고 수비 차단 행동을 고려한 보상 함수를 사용한다.

실험 결과

연구 질문

  • RQ10-합 설정에서 의도를 적극적으로 은폐하는 전략적 공격자의 진짜 목표를 수비자가 어떻게 학습할 수 있는가?
  • RQ2정보가 한쪽만 불완전하고 목적이 상충하는 마르코프 게임에서 균형 전략의 구조는 어떻게 되는가?
  • RQ3비협력적 IRL 프레임워크에서 학습과 행동을 병행하는 것이 정적 균형 행동에서만 학습하는 것보다 수비 성과를 어떻게 향상시키는가?
  • RQ4공격자가 행동을 통해 결국 자신의 의도를 드러내야 하는 상황에서 수비자는 얼마나 공격자의 행동을 활용할 수 있는가?
  • RQ5이러한 비협력적 역강화학습 문제를 해결하기 위한 계산적이고 이론적 기반은 무엇인가?

주요 결과

  • 모든 테스트된 그래프 크기에서 N-CIRL은 MA-IRL보다 공격자 평균 보상을 크게 낮추며, 더 큰 네트워크에서는 최대 40%의 상대적 감소를 보였다.
  • 공격자가 위장 전략을 사용할 수 있음에도 불구하고 N-CIRL의 수비자 전략은 MA-IRL보다 공격자 보상을 낮추며, 이는 공격자가 결국 자신의 진짜 의도를 행동으로 드러내야 하기 때문이다.
  • NC-PBVI 알고리즘은 합리적으로 스케일링되며, n=10인 그래프에 대해 평균 실행 시간이 10초 이내로 나타나 계산 가능성을 입증했다.
  • 게임의 재귀적 구조 덕분에 재귀 공식의 固定점 해를 통해 균형 전략을 계산하는 데 있어 처리 가능성이 확보되었다.
  • 경험 결과에 따르면, 수비자는 정적 균형 행동에서의 수동 학습보다 상호작용 학습에서 더 큰 이점을 얻었으며, 이는 N-CIRL이 MA-IRL보다 유리함을 검증한다.
  • 이론적 및 경험적 결과에 따르면 공격자는 완전히 비밀 정보를 활용할 수 없으며, 일부 정도는 드러내야 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.