Skip to main content
QUICK REVIEW

[논문 리뷰] The Feasibility and Inevitability of Stealth Attacks

Ivan Tyukin, Desmond J. Higham|arXiv (Cornell University)|2021. 06. 26.
Adversarial Robustness in Machine Learning참고 문헌 34인용 수 5
한 줄 요약

이 논문은 기존 검증 데이터에서 성능이 변화하지 않도록 AI 모델의 가중치를 수정하는 스텔스 공격이 단지 가능할 뿐 아니라 현대 딥러닝 시스템에서 점점 더 피할 수 없게 되어 있음을 입증한다. 과다 매개변수화와 고차원 잠재 공간을 이용해, 단일 뉴런 수정만으로도 특정 트리거에 대해 모델 출력을 완전히 제어할 수 있으며, 약간의 가정 하에 거의 확실한 성공을 이룰 수 있음을 보여주며, 모델 공유 및 배포 파이프라인에 심각한 취약점을 드러낸다.

ABSTRACT

We develop and study new adversarial perturbations that enable an attacker to gain control over decisions in generic Artificial Intelligence (AI) systems including deep learning neural networks. In contrast to adversarial data modification, the attack mechanism we consider here involves alterations to the AI system itself. Such a stealth attack could be conducted by a mischievous, corrupt or disgruntled member of a software development team. It could also be made by those wishing to exploit a ``democratization of AI'' agenda, where network architectures and trained parameter sets are shared publicly. We develop a range of new implementable attack strategies with accompanying analysis, showing that with high probability a stealth attack can be made transparent, in the sense that system performance is unchanged on a fixed validation set which is unknown to the attacker, while evoking any desired output on a trigger input of interest. The attacker only needs to have estimates of the size of the validation set and the spread of the AI's relevant latent space. In the case of deep learning neural networks, we show that a one neuron attack is possible - a modification to the weights and bias associated with a single neuron - revealing a vulnerability arising from over-parameterization. We illustrate these concepts using state of the art architectures on two standard image data sets. Guided by the theory and computational results, we also propose strategies to guard against stealth attacks.

연구 동기 및 목표

  • 검증 데이터에서 성능이 떨어지지 않는 방식으로 AI 모델의 매개변수를 수정하는 스텔스 공격의 가능성과 필연성을 조사하는 것.
  • 고정된, 알려지지 않은 검증 세트에서 탐지되지 않도록 특정 트리거에서의 모델 동작을 조작하는 구현 가능한 공격 전략을 개발하는 것.
  • 모델 구조, 트리거 설계, 공격 정확도에 대한 다양한 제약 조건 하에서 이러한 공격의 이론적 성공 확률을 분석하는 것.
  • 특히 과다 매개변수화된 아키텍처에서 이러한 공격을 가능하게 하는 설계 수준의 취약점을 규명하는 것.
  • 모델 아키텍처, 프루닝, 해싱 기반의 실용적 방어 전략을 제안하여 이러한 스텔스적 위협의 위험을 완화하는 것.

제안 방법

  • 저자들은 공격자가 모델 매개변수(예: 가중치 및 편향)를 수정하여 트리거 입력에서 원하는 출력을 유도하면서도 고정된, 알려지지 않은 검증 세트에서의 성능을 유지하는 일반적인 오픈박스 스텔스 공격 프레임워크를 도입한다.
  • 세 가지 알고리즘 전략을 개발한다: (1) 검증 세트 표현을 포함하는 구내에서의 트리거 설계; (2) 잠재 표현을 일치시켜 실제 데이터와 유사하게 보이게 하는 트리거의 은폐; (3) 잠재 공간의 저차원 부분공간 내에서의 제약된 공격.
  • 이론적 분석은 고차원에서의 측도 집중 현상에 기반하며, 잠재 공간 차원이 증가함에 따라 공격 성공 확률이 1에 수렴함을 보여준다. 이는 미미한 변형으로도 성립한다.
  • 핵심 이론적 한계(정리 1–3)는 모델 차원성, 공격 정확도(파라미터 α로 표현됨), 그리고 도달 가능성 조건에 따라 성공 가능성의 정도를 정량화한다.
  • 한 뉴런 공격 전략이 포함되어 있으며, 이는 단 한 개의 뉴런의 가중치와 편향을 수정하기만 해도 트리거 입력에서 모델 출력을 완전히 제어할 수 있음을 증명한다.
  • 실증적 검증은 CIFAR-10과 ImageNet을 사용한 최신 이미지 분류 모델(예: ResNet, DenseNet)을 대상으로 수행되었으며, 한 뉴런 공격의 높은 가능성과 실현 가능성을 입증한다.
Figure 1: General schemes of adversarial (panel A), data poisoning (panel B), and stealth attacks (panel C).
Figure 1: General schemes of adversarial (panel A), data poisoning (panel B), and stealth attacks (panel C).

실험 결과

연구 질문

  • RQ1공격자가 딥러닝 모델의 매개변수를 수정하여 특정 트리거 입력에서 임의의 출력을 유도하면서도, 알려지지 않은 검증 세트에서 동일한 성능을 유지할 수 있는가?
  • RQ2이러한 스텔스 공격의 이론적 성공 가능성은 무엇이며, 모델의 잠재 공간의 차원에 어떻게 의존하는가?
  • RQ3잠재 표현을 실제 데이터 샘플의 표현과 일치시킴으로써 트리거를 합리적으로 보이게 하는 방법은 무엇인가?
  • RQ4특히 저차원 부분공간에서, 트리거 생성 정확도가 낮더라도 스텔스 공격이 어느 정도 성공할 수 있는가?
  • RQ5어떤 모델 설계 및 배포 관행이 이러한 스텔스적 위협의 위험을 효과적으로 완화할 수 있는가?

주요 결과

  • 모델의 잠재 공간 차원이 증가함에 따라 스텔스 공격의 성공 확률은 1에 수렴하며, 이는 미미한 변형으로도 성립함을 보여주며, 고차원 모델에서는 이러한 공격이 필연적임을 입증한다.
  • 한 뉴런 공격은 이론적으로나 실증적으로 모두 가능하다: 단 한 개의 뉴런의 가중치와 편향만 수정해도 트리거 입력에서 모델 출력을 완전히 제어할 수 있으며, 검증 세트에서의 성능은 유지된다.
  • 공격자가 트리거 설계에 대해 제한된 제어권을 가질 경우에도, 트리거의 잠재 표현이 검증 세트 표현을 포함하는 구내 안에 있을 경우 공격 성공 확률이 매우 높다.
  • 잠재 표현이 실제 데이터 포인트 근처에 있는 '은폐된 트리거'는 알고리즘 2를 사용해 성공적으로 구성할 수 있으며, 이는 스텔스적 백도어 배포를 가능하게 한다.
  • 이론적 한계(정리 1 및 2)는 트리거 생성의 중간 정도의 정확도 오차에도 불구하고 성공 가능성 확률이 높다는 것을 보여주며, 특히 고차원 공간에서 강건하다.
  • 과다 매개변수화와 잠재 공간의 고내재 차원성은 스텔스 공격을 가능하게 하는 핵심 요소이며, 이는 모델 프루닝과 차원 축소가 효과적인 방어 전략이 되게 한다.
Figure 2: Stealth attack implementation patterns. Red open circles indicate changes. In Scenarios $1$ and $3$ neuron(s) are added. In Scenario $2$ , a one neuron attack, the weights and biases of an existing neuron are replaced with new values. Grey boxes show a part of the network modelled by the m
Figure 2: Stealth attack implementation patterns. Red open circles indicate changes. In Scenarios $1$ and $3$ neuron(s) are added. In Scenario $2$ , a one neuron attack, the weights and biases of an existing neuron are replaced with new values. Grey boxes show a part of the network modelled by the m

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.