Skip to main content
QUICK REVIEW

[논문 리뷰] Not All Datasets Are Born Equal: On Heterogeneous Data and Adversarial Examples

Yael Mathov, Eden Levy|arXiv (Cornell University)|2020. 10. 07.
Adversarial Robustness in Machine Learning참고 문헌 43인용 수 10
한 줄 요약

이 논문은 이질적 표본 데이터에서 최소 크기의 유효한 적대적 예제를 생성하기 위한 일반적인 최적화 프레임워크를 제안한다. 이는 특성들을 연속적인 잠복 공간에 매핑하고 분포 인식 제약 조건을 적용함으로써 이루어진다. 연구 결과, 이러한 데이터에서의 모델들은 동종 데이터에서의 모델들과 마찬가지로 적대적 공격에 동일하게 취약하며, 세 가지 실세계 데이터셋에서 낮은 ℓ₀ 변형을 사용하여 최대 99.8%의 높은 성공률을 달성한다.

ABSTRACT

Recent work on adversarial learning has focused mainly on neural networks and domains where those networks excel, such as computer vision, or audio processing. The data in these domains is typically homogeneous, whereas heterogeneous tabular datasets domains remain underexplored despite their prevalence. When searching for adversarial patterns within heterogeneous input spaces, an attacker must simultaneously preserve the complex domain-specific validity rules of the data, as well as the adversarial nature of the identified samples. As such, applying adversarial manipulations to heterogeneous datasets has proved to be a challenging task, and no generic attack method was suggested thus far. We, however, argue that machine learning models trained on heterogeneous tabular data are as susceptible to adversarial manipulations as those trained on continuous or homogeneous data such as images. To support our claim, we introduce a generic optimization framework for identifying adversarial perturbations in heterogeneous input spaces. We define distribution-aware constraints for preserving the consistency of the adversarial examples and incorporate them by embedding the heterogeneous input into a continuous latent space. Due to the nature of the underlying datasets We focus on $\ell_0$ perturbations, and demonstrate their applicability in real life. We demonstrate the effectiveness of our approach using three datasets from different content domains. Our results demonstrate that despite the constraints imposed on input validity in heterogeneous datasets, machine learning models trained using such data are still equally susceptible to adversarial examples.

연구 동기 및 목표

  • 이질적 표본 데이터에서의 적대적 예제에 대한 연구가 부족한 점을 해결하기 위해, 실세계 응용에서 널리 퍼져 있음에도 불구하고 여전히 탐색이 부족한 분야를 다루기 위해.
  • 특성 간 상관관계, 도메인 전용 제약 조건, 변경 불가능한 특성과 같은 복잡한 데이터 유효성 규칙을 유지하는 적대적 예제를 생성하는 데 도전하는 데에.
  • 실생활 적용 가능성과 최소한의 특성 수정을 보장하기 위해 ℓ₀ 변형에 중점을 두어 일반적이고 모델에 종속되지 않는 공격 방법을 개발하기 위해.
  • 나무 기반 모델(예: GBM, 랜덤 포레스트 등)을 포함한 다양한 모델 간의 적대적 예제의 이식 가능성을 평가하기 위해.
  • 엄격한 데이터 이질성 제약 조건이 존재하더라도, 표본 데이터 기반의 머신러닝 모델이 적대적 조작에 여전히 매우 취약하다는 것을 입증하기 위해.

제안 방법

  • 특성 간 상관관계를 유지하고 변경 불가능한 특성을 존중하는 분포 인식 제약 조건을 통해 데이터 유효성을 정형화하기 위해.
  • 기울기 기반 최적화를 가능하게 하기 위해, 이식 가능 변환 함수를 사용하여 이질적 표본 입력을 연속적인 잠복 공간에 매핑하기 위해.
  • 대체 모델의 기울기(또는 대상 모델의 특성 중요도)를 기반으로 한 반복적 특성 선택 전략을 사용하여 최소한의 ℓ₀ 변형을 유도하는 데 영향을 미치는 특성들을 식별하기 위해.
  • 제약 조건이 있는 최적화를 통해 변형이 의미적으로 유효하고 원본 데이터 분포와 일관성을 유지하도록 적대적 예제를 최적화하기 위해.
  • 실생활 적용 가능성과 일치하기 위해 수정되는 특성 수를 최소화하기 위해 ℓ₀ 기반 공격 공식을 적용하기 위해.
  • 이식 가능성을 평가하기 위해 대체 모델에서 적대적 예제를 생성하고, 다양한 대상 모델(나무 기반 학습기 포함)에서 성공률을 테스트하기 위해.

실험 결과

연구 질문

  • RQ1이질적 표본 데이터에서 데이터 유효성과 실생활 적용 가능성은 유지하면서도 적대적 예제를 효과적으로 생성할 수 있는가?
  • RQ2실생활 적용에서 특성 수정 수를 최소화하는 데 있어 ℓ₀ 변형은 다른 거리 측정 기준과 비교해 어떻게 성능을 발휘하는가?
  • RQ3대체 모델에서 제작된 적대적 예제가 GBM, 랜덤 포레스트, 결정 트리와 같은 나무 기반 모델로의 이식 가능성은 어느 정도인가?
  • RQ4분포 인식 제약 조건은 이질적 입력 공간에서 최적화 과정과 생성된 적대적 예제의 유효성에 어떤 영향을 미치는가?
  • RQ5이질적 표본 데이터 기반 모델의 적대적 공격에 대한 취약성은 이미지나 오디오와 같은 동종 데이터 기반 모델과 비교해 유사한가?

주요 결과

  • 제안된 방법은 데이터 유효성을 유지하면서도 낮은 ℓ₀ 변형(예: HCDR에서 1.60, Airbnb에서 4.33)을 사용하여 적대적 예제를 성공적으로 생성하였으며, 공격 성공률도 매우 높았다(예: HCDR에서 98.20%, Airbnb에서 99.80%).
  • 나무 기반 모델로의 적대적 예제 이식 가능성은 상당히 높았으며, 기본 기준은 14.42%에서 38.29% 사이였고, 대상 모델의 특성 중요도에 따라 특성 선택 전략을 조정함으로써 최대 60.53%까지 향상되었다.
  • 이 공격 프레임워크는 의료(예: HCDR), 중환자실(ICU), 부동산(Airbnb) 등 다양한 분야에서 효과적이었으며, 광범위한 적용 가능성을 입증했다.
  • 변경 불가능한 특성과 특성 간 상호작용과 같은 복잡한 제약 조건이 존재하더라도, 이 방법은 높은 성공률를 유지하였으며, 이는 표본 데이터 기반 모델이 동종 데이터 기반 모델과 마찬가지로 취약하다는 것을 증명한다.
  • 잠복 공간 매핑을 통해 이질적 입력 공간에서 효과적인 기울기 기반 최적화가 가능해졌으며, 혼합된 데이터 유형과 비연속적 특성 공간의 과제를 극복하였다.
  • 이 연구는 표본 데이터의 적대적 취약성이 모델 아키텍처의 산물이 아니라 데이터 이질성과 모델 민감성에 뿌리를 두고 있는 체계적인 문제임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.