Skip to main content
QUICK REVIEW

[논문 리뷰] A Formalization of Robustness for Deep Neural Networks

Tommaso Dreossi, Shromona Ghosh|arXiv (Cornell University)|2019. 03. 24.
Adversarial Robustness in Machine Learning참고 문헌 34인용 수 16
한 줄 요약

이 논문은 형식적 방법을 사용하여 딥 네ural 네트워크의 강건성에 대한 통합적 형식화를 제안하며, 공격자 입력 생성을 시스템, 환경, 사양 구성 요소를 가진 검증 문제로 프레임워크화한다. 이는 거리 및 행동 술어를 통해 공격 목표, 변형 제약 조건, 목표 행동을 포괄하는 공통 프레임워크 내에서 다양한 공격 기법을 체계적으로 비교할 수 있도록 한다.

ABSTRACT

Deep neural networks have been shown to lack robustness to small input perturbations. The process of generating the perturbations that expose the lack of robustness of neural networks is known as adversarial input generation. This process depends on the goals and capabilities of the adversary, In this paper, we propose a unifying formalization of the adversarial input generation process from a formal methods perspective. We provide a definition of robustness that is general enough to capture different formulations. The expressiveness of our formalization is shown by modeling and comparing a variety of adversarial attack techniques.

연구 동기 및 목표

  • 다양한 공격 기법 간에 딥 네ural 네트워크의 강건성 정의에 대한 합의 부족 문제를 해결하기 위해.
  • 시스템, 환경, 사양 구성 요소를 명확히 분리한 채로 공격자 입력 생성을 검증 문제로 형식화하기 위해.
  • 화이트박스, 블랙박스, 의미 수준 공격을 포함한 다양한 강건성 정의를 포괄하는 일반적이고 확장 가능한 프레임워크를 제공하기 위해.
  • 형식적 방법과 최적화 기반 접근법 간의 원리를 통합하여 적대적 기계 학습에서의 기초 원리를 통합하기 위해.
  • 공통 형식 언어를 통해 기존의 적대적 공격 방법을 체계적으로 비교하고 분석할 수 있도록 하기 위해.

제안 방법

  • 세 가지 제약 조건(편미네이션 입력의 허용성, 원본 입력으로부터의 거리(측도 μ를 통한)), 목표 행동 변화(술어 A를 통한))를 가진 决定 문제로 강건성을 형식화한다.
  • 두 가지 최적화 변형을 정의한다: 편미네이션 최소화(예: ℓp 노름) 및 손실 최대화(예: 잘못 분류된 신뢰도), 모두 세 가지 제약 조건을 충족해야 한다.
  • 일반 사양 φ를 사용하여 시스템 수준의 정확성을 표현하여, 강건성을 모델 예측뿐만 아니라 고수준의 시스템 행동에 대해서도 평가할 수 있도록 한다.
  • 공격을 형식적 검증 작업 S∥E⊨φ로 모델링하며, S는 DNN, E는 공격자, φ는 강건성 사양이다.
  • ℓp-노름 제약이 있는 변형, 의미 전환(예: 가림, 밝기 변화), 분포 강건성 등 다양한 공격 유형을 모델링한다.
  • 의미 강건성에 대해 추상 공간 모델링(예: 렌더러 R 및 시스템 모델 M를 통해)을 도입하여 원시 픽셀이 아닌 시나리오 표현에서의 공격를 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥 네ural 네트워크의 강건성을 다양한 적대적 공격 기법을 통합할 수 있는 방식으로 어떻게 형식화할 수 있는가?
  • RQ2적대적 입력 생성의 핵심 구성 요소는 무엇이며, 이를 일반적인 형식적 검증 프레임워크로 추상화할 수 있는가?
  • RQ3예를 들어 오분류, 표적 공격, 커버리지 최대화 등의 다양한 적대적 목표를 단일 형식 사양 내에서 어떻게 포괄할 수 있는가?
  • RQ4의미적 및 구조적 변형(예: 가림, 회전)을 기존 ℓp-노름 공격와 동일한 형식론 내에서 어떻게 모델링할 수 있는가?
  • RQ5시스템 수준의 강건성(M 및 φ를 통해)은 모델 수준의 강건성과 어떻게 다를 수 있으며, 어떤 이점을 제공하는가?

주요 결과

  • 제안된 형식화는 Szegedy 등(2013), Goodfellow(2014), Carlini & Wagner(2017), DeepXplore(Pei 등, 2017) 등의 14가지의 다양한 적대적 공격 기법을 하나의 프레임워크 내에서 포괄한다.
  • 프레임워크는 추상 세계 공간 S에서 작동함으로써 의미 강건성을 모델링할 수 있으며, 여기서 변형은 픽셀 수준의 거리가 아닌 의미 유사도 μ를 기준으로 측정된다.
  • 분포 강건성(예: Athalye 등, 2018b)을 통한 적대적 예제는 점별 변형을 변환 T에 대한 기대 거리 제약 조건으로 대체함으로써 포괄된다.
  • 프레임워크는 국소 강건성(각 입력 기반)과 시스템 수준 강건성(M 및 φ를 통해)을 모두 지원하여 종단 간 시스템 행동 검증이 가능하다.
  • DeepXplore에서 뉴런 커버리지(fₙ(x))를 목표 행동 제약 조건으로 사용하는 것은 fₙ(x*)를 입력 제약 조건 하에 최대화하는 것으로 형식화되어, 일반 프레임워크와의 일치를 보여준다.
  • 형식화는 공격 기법의 핵심 적대적 목표, 제약 조건, 사양 의미를 분리함으로써 공격 기법 간의 체계적 비교를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.