Skip to main content
QUICK REVIEW

[논문 리뷰] Can Domain Knowledge Alleviate Adversarial Attacks in Multi-Label Classifiers?

Stefano Melacci, Gabriele Ciravegna|arXiv (Cornell University)|2020. 10. 19.
Adversarial Robustness in Machine Learning참고 문헌 47인용 수 9
한 줄 요약

이 논문은 적대적 공격에 대한 강건성을 향상시키기 위해 일阶 논리 지식을 제약 조건으로 삽입하는 준지도 학습 다중 레이블 분류 프레임워크를 제안한다. 도메인 지식을 근사 분포에 강제 적용함으로써, 일반적으로 적대적 예측을 나타내는 일관성 없는 예측을 탐지하고 거부함으로써, 공격에 대한 사전 지식 없이도 강력한 방어 능력을 보여준다.

ABSTRACT

Adversarial attacks on machine learning-based classifiers, along with defense mechanisms, have been widely studied in the context of single-label classification problems. In this paper, we shift the attention to multi-label classification, where the availability of domain knowledge on the relationships among the considered classes may offer a natural way to spot incoherent predictions, i.e., predictions associated to adversarial examples lying outside of the training data distribution. We explore this intuition in a framework in which first-order logic knowledge is converted into constraints and injected into a semi-supervised learning problem. Within this setting, the constrained classifier learns to fulfill the domain knowledge over the marginal distribution, and can naturally reject samples with incoherent predictions. Even though our method does not exploit any knowledge of attacks during training, our experimental analysis surprisingly unveils that domain-knowledge constraints can help detect adversarial examples effectively, especially if such constraints are not known to the attacker. While we also show that an adaptive attack exploiting knowledge of the constraints may still deceive our classifier, it remains an open issue to understand how hard for an attacker would be to infer such constraints in practical cases. For this reason, we believe that our approach may provide a significant step towards designing robust multi-label classifiers.

연구 동기 및 목표

  • 도메인 지식이 다중 레이블 분류기의 적대적 공격에 대한 강건성 향상에 기여할 수 있는지 조사하기.
  • 분포 이탈로 인해 예측이 일관성 없어질 수 있는 다중 레이블 환경에서 적대적 예측을 탐지하는 과제 해결하기.
  • 기존 알려진 도메인 관계와 일관성을 유지하기 위해 일阶 논리 제약 조건을 통합한 준지도 학습 프레임워크 개발하기.
  • 이러한 제약 조건이 명시적 적대적 훈련 없이도 적대적 입력을 자연스럽게 거부할 수 있는지 평가하기.
  • 제약 조건을 안다는 공격자의 지식을 악용할 수 있는 공격에 대한 방법의 내성 강도 평가하기.

제안 방법

  • 클래스 간 관계에 대한 도메인 지식을 표현하는 일阶 논리 규칙을 모델 훈련을 위한 미분 가능 제약 조건으로 변환한다.
  • 분류기가 레이블의 근사 분포를 따라 이러한 제약 조건을 만족하도록 최적화되는 준지도 학습 프레임워크를 활용한다.
  • 모델은 논리적 제약 조건을 위반하는 예측을 거부하도록 학습하며, 이는 일반적으로 훈련 데이터 분포 외부에 위치한 적대적 입력과 일치한다.
  • 훈련 중에 적대적 예측을 필요로 하지 않으며, 대신 도메인 제약 조건 하에서 적대적 예측의 본질적 일관성 부족에 의존한다.
  • 훈련 및 추론 모두에서 제약 조건을 적용하여 알려진 도메인 관계와의 일관성을 보장한다.
  • 비적대적 공격과 적대적 공격 상황에서 모두 프레임워크를 평가하여 강건성 테스트를 수행한다.

실험 결과

연구 질문

  • RQ1준지도 학습 프레임워크에서 도메인 지식 제약 조건이 다중 레이블 분류에서 적대적 예측을 효과적으로 탐지할 수 있는가?
  • RQ2공격자가 제약 조건을 모른다면, 이 방법이 적대적 예측 탐지에 얼마나 효과적인가?
  • RQ3적응형 공격자가 제약 조건을 학습함으로써 방어를 우회할 수 있는 정도는 어느 정도인가?
  • RQ4적대적 데이터 없이도 논리적 제약 조건 통합이 강건성을 향상시킬 수 있는가?
  • RQ5제약 조건 구조를 공격하는 적응형 공격에 노출되었을 때 모델 성능은 얼마나 떨어지는가?

주요 결과

  • 제안된 방법은 도메인 지식 제약 조건 위반으로 인해 일관성 없게 되는 예측을 식별함으로써 다중 레이블 분류에서 적대적 예측을 효과적으로 탐지한다.
  • 훈련 중에 적대적 예측에 노출된 바 없이도 모델은 강력한 방어 성능을 달성하며, 특히 공격자가 제약 조건을 모를 경우에 특히 두드러진다.
  • 제약 조건을 안다는 적응형 공격자는 여전히 성공적인 공격을 수행할 수 있으며, 제약 조건 지식이 취약점임을 시사한다.
  • 공격자가 전체 제약 조건 세트를 유추할 가능성이 낮은 실용적 상황에서도 방법은 강건성을 유지한다.
  • 준지도 학습에 논리적 제약 조건을 통합함으로써, 분포 외부의 적대적 예측을 자연스럽게 거부할 수 있는 메커니즘이 제공된다.
  • 결과적으로 도메인 지식은 다중 레이블 환경에서 유망하고 경량의 방어 메커니즘이 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.