Skip to main content
QUICK REVIEW

[논문 리뷰] RS-Del: Edit Distance Robustness Certificates for Sequence Classifiers via Randomized Deletion

Zhuoqun Huang, Neil G. Marchant|arXiv (Cornell University)|2023. 01. 31.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 편집 거리로 제한된 적대적 공격에 대해 시퀀스 분류기의 강건성을 인증하기 위해 오직 랜덤 삭제만을 사용하는 랜덤 스무딩 방법인 RS-Del을 소개한다. 이는 치환, 삽입, 삭제를 포함한 공격을 모두 다루며, MalConv에서 편집 거리 반경 128바이트에서 91%의 인증된 정확도를 달성한다. 기존의 네이먼-피어슨 프레임워크 대신 최장 공통 부분수열 기반의 새로운 증명을 사용한다.

ABSTRACT

Randomized smoothing is a leading approach for constructing classifiers that are certifiably robust against adversarial examples. Existing work on randomized smoothing has focused on classifiers with continuous inputs, such as images, where $\ell_p$-norm bounded adversaries are commonly studied. However, there has been limited work for classifiers with discrete or variable-size inputs, such as for source code, which require different threat models and smoothing mechanisms. In this work, we adapt randomized smoothing for discrete sequence classifiers to provide certified robustness against edit distance-bounded adversaries. Our proposed smoothing mechanism randomized deletion (RS-Del) applies random deletion edits, which are (perhaps surprisingly) sufficient to confer robustness against adversarial deletion, insertion and substitution edits. Our proof of certification deviates from the established Neyman-Pearson approach, which is intractable in our setting, and is instead organized around longest common subsequences. We present a case study on malware detection--a binary classification problem on byte sequences where classifier evasion is a well-established threat model. When applied to the popular MalConv malware detection model, our smoothing mechanism RS-Del achieves a certified accuracy of 91% at an edit distance radius of 128 bytes.

연구 동기 및 목표

  • 소스 코드나 바이너리 실행 파일과 같은 이산적이고 길이가 변하는 시퀀스 입력에 대해 인증된 강건성 방법이 부족한 문제를 해결하기 위해.
  • 삽입, 삭제, 치환을 포함한 편집 거리로 제한된 적대적 공격을 위한 강건성 인증 프레임워크를 개발하기 위해.
  • 스무딩 메커니즘과 분석을 단순화하기 위해 오직 랜덤 삭제만을 사용하여 효율적이고 타당한 인증을 가능하게 하기 위해.
  • 특히 악성 소프트웨are 탐지와 같은 고위험 설정에서 강건성과 정확도의 균형을 맞추기 위해 조정 가능한 결정 임계값을 허용하기 위해.
  • 기본 분류기의 오라클 쿼리 액세스를 통해 임의의 기본 분류기와 호환 가능한 확장 가능하고 실용적인 인증 방법을 제공하기 위해.

제안 방법

  • 입력 시퀀스에 랜덤 삭제를 적용하여 스무딩 분류기를 구축하는 랜덤 스무딩 메커니즘인 RS-Del을 제안한다.
  • 스무딩 공간에서 신뢰도 점수를 제한하기 위해, 입력과 그 변형된 버전 간의 최장 공통 부분수열(LCS)을 기준점으로 사용한다.
  • 변형에 걸쳐 LCS가 일관되게 유지될 확률에 기반한 인증 경계를 유도하여 강건성 보장을 가능하게 한다.
  • 이 설정에서 구현이 불가능한 기존의 네이먼-피어슨 프레임워크를 대체하기 위해, LCS 기반의 신뢰도 경계에 중심을 둔 새로운 증명 구조를 제안한다.
  • 주어진 입력과 신뢰도 임계값에 대해 최대 인증 가능한 편집 거리 반경을 효율적으로 계산하기 위해 이진 탐색을 사용한다.
  • 강건성 반경과 오분류율 간의 균형 조정을 가능하게 하는 조정 가능한 결정 임계값을 지원하며, 특히 악성 샘플을 잘못 분류하려는 강력한 동기를 가진 적대적 환경에서 유용하다.

실험 결과

연구 질문

  • RQ1오직 랜덤 삭제만을 기반으로 하는 스무딩 메커니즘이 시퀀스 분류기의 삽입, 삭제, 치환을 포함한 적대적 편집 공격에 대해 인증된 강건성을 제공할 수 있는가?
  • RQ2표준 네이먼-피어슨 프레임워크에 의존하지 않고도 편집 거리 강건성에 대해 실용적인 인증 방법을 도출할 수 있는가?
  • RQ3RS-Del의 성능은 랜덤 아블레이션과 비교해 볼 때 인증 반경과 신뢰도 경계 측면에서 어떻게 다른가?
  • RQ4RS-Del은 악성 소프트웨어 탐지와 같이 높은 실용적 정확도가 요구되는 실제 시퀀스 분류 작업에 얼마나 널리 적용될 수 있는가?
  • RQ5최장 공통 부분수열의 사용이 기존 히든-거리 기반 접근 방식보다 더 날카운 신뢰도 인증을 가능하게 할 수 있는가?

주요 결과

  • RS-Del은 MalConv 악성 소프트웨어 탐지 모델에서 편집 거리 반경 128바이트에서 91%의 인증된 정확도를 달성한다.
  • 이 방법은 스무딩 과정에서 오직 랜덤 삭제만을 사용함에도 불구하고, 치환, 삽입, 삭제의 세 가지 유형의 편집 작동 모두에 대해 인증된 강건성을 제공한다.
  • 최장 공통 부분수열 기반의 인증 증명은 기존의 네이먼-피어슨 접근 방식보다 더 날카운 신뢰도 경계를 가능하게 하며, 이는 이 설정에서는 구현이 불가능하다.
  • 논문에서 공식적으로 비교한 결과, RS-Del은 랜덤 아블레이션보다 인증의 날카움을 뛰어넘는다.
  • 이 방법은 효율적이고 실용적이며, 기본 분류기의 오라클 액세스만 필요로 하며, 긴 시퀀스에 대한 확장 가능한 인증을 가능하게 한다.
  • 조정 가능한 결정 임계값의 사용은 특히 고위험 분류 작업에서 강건성과 정확도 간의 효과적인 균형 조정을 가능하게 하며, 유용하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.