Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Reinforcement Learning for Observer Design in Autonomous Systems under Cyber Attacks

Abhishek Gupta, Zhaoyuan Yang|arXiv (Cornell University)|2018. 09. 15.
Adversarial Robustness in Machine Learning참고 문헌 9인용 수 8
한 줄 요약

이 논문은 적대적 센서 공격을 탐지하고 수정하기 위해 적대적 딥 강화학습을 사용하여 모델 기반 관측기 설계를 제안한다. 최소화-최대화 프레임워크 내에서 신뢰 영역 정책 최적화(TRPO)를 통해 신경망 관측기를 훈련시킴으로써, 이론적 상태 다양체 위로 손상된 고차원 측정값을 복원하는 방법을 학습한다. 이는 유한한 적대적 노이즈 조건 하에서도 거의 최적의 제어 성능을 달성한다.

ABSTRACT

Complex autonomous control systems are subjected to sensor failures, cyber-attacks, sensor noise, communication channel failures, etc. that introduce errors in the measurements. The corrupted information, if used for making decisions, can lead to degraded performance. We develop a framework for using adversarial deep reinforcement learning to design observer strategies that are robust to adversarial errors in information channels. We further show through simulation studies that the learned observation strategies perform remarkably well when the adversary's injected errors are bounded in some sense. We use neural network as function approximator in our studies with the understanding that any other suitable function approximating class can be used within our framework.

연구 동기 및 목표

  • 정확한 시스템 모델이 가용하지 않은 상황에서 자율 시스템을 위한 강건한 관측기를 설계하는 데 도전한다.
  • 측정값을 손상시키는 적대적 센서 공격을 탐지하고 수정할 수 있는 모델 프리 프레임워크를 개발한다.
  • 오직 데이터만을 사용하여 손상된 고차원 측정값으로부터 진정한 시스템 상태를 복원할 수 있도록 관측기를 구현한다.
  • 시스템 성능을 악화시키기 위해 유한한 노이즈를 주입하는 전략적 적대자를 견딜 수 있도록 보장한다.
  • 적대적 강화학습이 고정 관측기나 항등 매핑 관측기보다 우수한 성능을 보이는 관측기를 훈련시키는 데서 효과를 입증한다.

제안 방법

  • 손상된 측정값에서 진정한 상태 다양체로의 사상 함수를 학습하기 위해 딥 신경망을 함수 근사기로 사용한다.
  • 관측기 설계를 두 명의 플레이어 간의 최소-최대 게임으로 설정한다: 관측기는 추정 오차를 최소화하고, 적대자는 이를 최대화한다.
  • 안정적이고 단조로운 향상을 위해 KL 발산 제약 조건을 포함한 신뢰 영역 정책 최적화(TRPO)를 적용하여 관측기 정책을 훈련시킨다.
  • 각 반복에서 15,000개의 시간 단위 동안 적대자와 관측기 간에 번갈아가며 또는 동시에 업데이트하는 가짜 플레이(fictitious play)를 구현한다.
  • 적대적 노이즈의 범위를 ±2σ, ±4σ, 및 ±8σ로 정의하여 공격 강도가 증가함에 따라의 강건성 평가를 수행한다.
  • 측정값(cosθ, sinθ)이 단위 원 위에 위치하여 2차원 공간 내에서 1차원 비선형 다양체를 이룬다. 이를 테스트 베드로 사용한다.

실험 결과

연구 질문

  • RQ1적대적 강화학습을 통해 훈련된 데이터 기반 관측기가 시스템 모델의 사전 지식 없이도 손상된 센서 측정값으로부터 진정한 상태를 효과적으로 복원할 수 있는가?
  • RQ2적대적 노이즈의 크기가 훈련 범위를 초월할수록 관측기의 성능은 어떻게 저하되는가?
  • RQ3적응형 적대자를 포함한 최소-최대 설정에서 훈련된 관측기가 공격 상황에서 고정 관측기나 항등 매핑 관측기보다 우수한 성능을 보이는가?
  • RQ4적대자가 유한하고 전략적인 노이즈를 주입할 경우, 관측기가 얼마나 near-optimal 제어 성능을 복원할 수 있는가?
  • RQ5가짜 플레이에서 순차적 업데이트와 동시에 업데이트가 관측기-적대자 훈련 과정의 수렴성과 안정성에 어떤 영향을 미치는가?

주요 결과

  • 적대적 노이즈가 ±2σ 이내로 제한된 경우, 관측기는 손상된 측정값을 진정한 상태 다양체로 효과적으로 복원하여 거의 최적의 제어 성능을 회복한다.
  • 관측기가 훈련된 후, 1000개의 시간 단위 동안 누적 보상이 약 80에 도달한다—최대 가능한 보상에 매우 가까운 수준이며, 이는 상태 복원의 효과를 시사한다.
  • 훈련된 관측기가 없는 상황에서는 적대자가 빠르게 성능을 악화시키며 보상이 약 -80에 도달하여, 무방비 공격이 미치는 심각한 영향을 보여준다.
  • 더 큰 노이즈 범위(±8σ)에서는 관측기가 손상된 상태를 복원하지 못해 성능이 저하되며, 이는 이 방법의 강건성에 한계가 있음을 시사한다.
  • 관측기는 정확한 손상되지 않은 상태를 계산할 필요가 없으며, 오직 제어기가 손상되지 않은 경우와 동일한 조치를 취하게 하는 추정치를 생성하기만 하면 된다.
  • 훈련 중 수익 곡선의 급격한 변화는 한 쪽 플레이어가 강력한 최적 반응 전략을 학습했음을 나타내며, 최소-최대 게임 내에서의 동적 적응을 암시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.