Skip to main content
QUICK REVIEW

[논문 리뷰] URET: Universal Robustness Evaluation Toolkit (for Evasion)

Kevin Eykholt, Taesung Lee|arXiv (Cornell University)|2023. 08. 03.
Adversarial Robustness in Machine LearningComputer Science인용 수 3
한 줄 요약

URET는 도메인 특화 기능 유지를 위한 변환을 기반으로 하여 다양한 AI 시스템 모odal리티에서 의미적으로 정확하고 기능적으로 유효한 적대적 입력을 생성하기 위한 유니버설 프레임워크이다. 이는 적대적 예제 생성을 도메인 특화 변환에 기반한 그래프 탐색 문제로 모델링함으로써, 이미지 외부 입력(예: 악성 소프트웨어 바이너리)에 대한 효과적인 회피 공격을 가능하게 하며, VirusTotal에서 평균 58%의 검출률을 기록하여 이미지 기반 공격을 초월한 이행성과 실제 영향력을 입증한다.

ABSTRACT

Machine learning models are known to be vulnerable to adversarial evasion attacks as illustrated by image classification models. Thoroughly understanding such attacks is critical in order to ensure the safety and robustness of critical AI tasks. However, most evasion attacks are difficult to deploy against a majority of AI systems because they have focused on image domain with only few constraints. An image is composed of homogeneous, numerical, continuous, and independent features, unlike many other input types to AI systems used in practice. Furthermore, some input types include additional semantic and functional constraints that must be observed to generate realistic adversarial inputs. In this work, we propose a new framework to enable the generation of adversarial inputs irrespective of the input type and task domain. Given an input and a set of pre-defined input transformations, our framework discovers a sequence of transformations that result in a semantically correct and functional adversarial input. We demonstrate the generality of our approach on several diverse machine learning tasks with various input representations. We also show the importance of generating adversarial examples as they enable the deployment of mitigation techniques.

연구 동기 및 목표

  • 복잡한 입력 구조를 가진 비이미지 AI 시스템에 대해 일반화 가능한 적대적 공격 프레임워크의 부족을 해결한다.
  • 이미지에서 흔히 볼 수 있는 미분 가능하고 연속적이며 독립적인 특징에 의존하는 기울기 기반 공격의 한계를 극복한다. 이러한 특징은 바이너리나 표 형태 데이터와 같은 실제 세계의 데이터에서는 흔하지 않다.
  • 다양한 도메인에서 의미적으로 정확하고 기능적으로 유효한 적대적 입력을 생성함으로써 안전이 중요한 AI 시스템에 대한 실질적인 적대적 테스트를 가능하게 한다.
  • 사용자 정의 변환을 지원하고 평가 및 방어 파이프라인에 통합 가능한 재사용 가능하고 확장 가능한 툴킷을 제공함으로써 강력한 AI 개발을 지원한다.
  • 실제 검출 시스템(예: VirusTotal)에서의 적대적 이행성의 효과를 입증함으로써 실제 위험을 부각하고 강력한 방어 전략의 필요성을 강조한다.

제안 방법

  • 입력을 노드로, 도메인 특화 변환을 간선으로 하는 그래프 탐색 문제로 적대적 입력 생성을 모델링한다.
  • 일반적인 데이터 유형(예: 이미지, 텍스트, 바이너리, 표 형태 데이터)에 대해 사전 설정된 기능 및 의미 유지 변환 집합을 정의한다.
  • 도메인 전문 지식을 활용하여 지원되지 않는 데이터 유형에 대한 사용자 정의 변환을 정의할 수 있도록 플러그인 가능한 변환 인터페이스를 제공한다.
  • 적대적 성공률을 극대화하면서도 입력 유효성을 유지하는 변환 시퀀스를 탐색하기 위해 가변 깊이와 너비를 가진 비트 서치를 사용한다.
  • 다양한 모델과 검출 시스템에서 평가하여 일반화 능력과 실제 영향을 평가함으로써 적대적 이행성을 활용한다.
  • 구성 파일을 통해 저수준 구현 세부 정보를 추상화함으로써 다양한 머신러닝 작업과 입력 표현 방식에서의 사용자 맞춤 설정을 용이하게 한다.
Figure 1 : A typical model pipeline. Traditional adversarial attacks, which use loss gradients, are limited to generate adversarial feature vectors. Our framework can generate adversarial input objects or adversarial features using the classifier loss scoring function. Furthermore, our framework rem
Figure 1 : A typical model pipeline. Traditional adversarial attacks, which use loss gradients, are limited to generate adversarial feature vectors. Our framework can generate adversarial input objects or adversarial features using the classifier loss scoring function. Furthermore, our framework rem

실험 결과

연구 질문

  • RQ1유니버설 프레임워크는 이미지 외부의 다양한 AI 입력 모달리티에서 의미적으로 정확하고 기능적으로 유효한 적대적 입력을 생성할 수 있는가?
  • RQ2변환 시퀀스의 그래프 기반 탐색은 실세계 시스템에서 검출을 회피하는 데 효과적인 적대적 예제를 생성하는 데 얼마나 효과적인가?
  • RQ3URET가 생성한 적대적 예제는 VirusTotal과 같은 다양한 검출 모델 간에 얼마나 이행되는가?
  • RQ4이미지 기반 적대적 특징에 기반한 적대적 훈련과 URET가 생성한 기능적으로 유효한 적대적 입력에 기반한 훈련 간에 강건성 측면에서 어떤 차이가 있는가?
  • RQ5기본 툴킷의 변경 없이 사용자 정의 변환을 통해 새로운 데이터 유형으로의 확장이 가능한가?

주요 결과

  • URET는 비트 너비 5와 깊이 3를 사용하여 38개의 적대적 악성 바이너리를 성공적으로 생성하여 복잡한 바이너리 입력 공간에서의 가능성을 입증했다.
  • VirusTotal에서 적대적 악성 바이너리의 평균 검출률은 원본의 82%에서 58%로 감소했으며, 한 검출기에서는 오직 6%만 악성으로 표시했다.
  • 6개의 익명화된 VirusTotal 스캐너에서 정밀도와 재현율 지표가 심각하게 악화되었으며, 일부 검출기에서는 재현율이 100%에서 최소 28%로 떨어졌다.
  • 이미지 기반 적대적 특징에 기반한 적대적 훈련은 URET가 생성한 기능적으로 유효한 적대적 입력에 대해 효과적이지 않았으며, 이는 현재 방어 전략의 한계를 드러냈다.
  • 최소한의 구성 변경으로 악성 바이너리 검출, HMDA 신용 리스크 예측, 이미지 분류 등 다양한 작업에서 높은 효과를 달성했다.
  • URET가 생성한 적대적 예제는 강력한 이행성을 보였으며, 여러 검출 시스템을 성공적으로 회피하여 이러한 공격의 실제 세계에서의 위협성을 입증했다.
Figure 2 : An illustration of graph exploration.
Figure 2 : An illustration of graph exploration.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.