Skip to main content
QUICK REVIEW

[논문 리뷰] Bad Characters: Imperceptible NLP Attacks

Nicholas Boucher, Ilia Shumailov|arXiv (Cornell University)|2021. 06. 18.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 시각적 탐지에 회피 가능한 텍스트 기반 공격을 체계적으로 분석하며, 비시각적 문자, 유사문자, 재정렬, 삭제 공격 등을 포함한다. 이 공격들은 외관상 변화 없이도 모델 출력을 조작한다. 이에 대해 OCR 기반 방어 기법을 제안하여 비시각적 문자, 재정렬, 삭제 공격의 100%를 차단하고, 유사문자 공격의 성공률을 크게 감소시키며, BLEU 점수에 6.2%의 손실만 발생시켜, 모델 재학습 없이도 저비용으로 적용 가능한 방어 기법을 제공한다.

ABSTRACT

Several years of research have shown that machine-learning systems are vulnerable to adversarial examples, both in theory and in practice. Until now, such attacks have primarily targeted visual models, exploiting the gap between human and machine perception. Although text-based models have also been attacked with adversarial examples, such attacks struggled to preserve semantic meaning and indistinguishability. In this paper, we explore a large class of adversarial examples that can be used to attack text-based models in a black-box setting without making any human-perceptible visual modification to inputs. We use encoding-specific perturbations that are imperceptible to the human eye to manipulate the outputs of a wide range of Natural Language Processing (NLP) systems from neural machine-translation pipelines to web search engines. We find that with a single imperceptible encoding injection -- representing one invisible character, homoglyph, reordering, or deletion -- an attacker can significantly reduce the performance of vulnerable models, and with three injections most models can be functionally broken. Our attacks work against currently-deployed commercial systems, including those produced by Microsoft and Google, in addition to open source models published by Facebook, IBM, and HuggingFace. This novel series of attacks presents a significant threat to many language processing systems: an attacker can affect systems in a targeted manner without any assumptions about the underlying model. We conclude that text-based NLP systems require careful input sanitization, just like conventional applications, and that given such systems are now being deployed rapidly at scale, the urgent attention of architects and operators is required.

연구 동기 및 목표

  • Unicode 제어 문자와 유사문자를 활용해 외관상 변화 없이도 NLP 모델 출력을 조작하는 비시각적 텍스트 기반 공격를 식별하고 분류하는 것.
  • 이러한 공격이 기계 번역, 감성 분석, 유해 콘텐츠 탐지와 같은 핵심 과제에서 기존 NLP 시스템을 우회할 수 있음을 보여주는 것.
  • 특히 OCR 기반 및 Bidi 알고리즘 기반 솔루션을 포함한 실용적이고 후행 적용 가능한 방어 기법을 개발하고 평가하여, 공격을 차단하면서도 성능 저하를 최소화하는 것.
  • 생산용 NLP 시스템에 이러한 방어 기법을 통합하여 대규모로 악성 변형에 대한 강건성을 확보할 것을 주장하는 것.

제안 방법

  • 텍스트 인코딩 특성에 기반한 비시각적 공격의 분류 체계를 제안: 비시각적 문자, 유사문자, 이중방향(Bidi) 제어 문자, 소프트/하드 삭제 문자.
  • 비슷해 보이지만 의미적으로 다른 문자(예: 유사문자)를 시각적으로 동일한 문자로 매핑하기 위해 광학 문자 인식(OCR)을 활용하여 공격 표면을 줄이는 것.
  • 논리적 텍스트 순서를 복원하기 위해 유니코드 이중방향 알고리즘을 적용하여, 렌더링 순서와 논리적 순서의 불일치를 악용하는 재정렬 공격를 방지하는 것.
  • 가능한 한도에서 삭제 문자 및 Bidi 제어 문자를 제거하거나 경고를 표시함으로써 입력 정제를 수행하는 것.
  • 방어 기법의 성능 영향을 평가하기 위해 BLEU 점수를 사용하며, 특히 정상 텍스트와 유사문자로 변형된 텍스트에 대해 평가한다.
  • 기계 번역, 감성 분석, NER, 텍스트 함의성 분석, 유해 콘텐츠 탐지 등 다양한 NLP 과제에서 방어 기법을 평가하는 것.

실험 결과

연구 질문

  • RQ1비시각적 텍스트 기반 공격는 어떻게 Unicode 제어 문자와 유사문자를 활용하여 외관상 변화 없이도 NLP 모델 출력을 조작하는가?
  • RQ2OCR 기반 전처리는 NLP 추론 파이프라인에서 유사문자 및 비시각적 문자를 포함한 공격를 얼마나 효과적으로 완화할 수 있는가?
  • RQ3실제 NLP 시스템에 OCR 또는 Bidi 해석을 적용할 경우, 방어 효과성과 모델 성능 간의 상호 교환 관계는 어떠한가?
  • RQ4모델 재학습 없이도 일반적인 비재학습 기반 방어 기법이 넓은 범위의 NLP 공격에 효과적으로 작용할 수 있는가?
  • RQ5특히 Bidi 제어 문자 처리 측면에서, 그래픽 사용자 인터페이스가 있는 시스템과 없는 시스템에 대해 어떤 방어 전략이 가장 적합한가?

주요 결과

  • OCR 기반 방어 기법은 추론 이전에 텍스트를 정규화함으로써 비시각적 문자, 재정렬, 삭제 공격의 100%를 성공적으로 차단한다.
  • 유사문자 공격의 성공률은 유의미하게 감소하지만, 희귀하거나 모호한 유사문자를 OCR이 완벽하게 인식하지 못함으로써 완전한 방어는 이루어지지 않는다.
  • 방어 기법은 정상 텍스트에서 OCR 오류와 유사문자에 대한 높은 오인식률로 인해 기준 BLEU 점수에 6.2%의 감소를 초래한다.
  • Bidi 알고리즘 해석은 논리적 텍스트 순서를 렌더링 순서와 일치시켜 재정렬 공격를 효과적으로 방지한다.
  • 제안된 방어 기법은 기계 번역, 감성 분석, 유해 콘텐츠 탐지 등 다양한 NLP 과제에서 효과적이다.
  • 저자들은 OCR 기반 전처리가 모델 재학습 없이도 저비용으로 적용 가능하고, 강건성을 향상시키는 효과적인 후행 적용 가능한 솔루션임을 결론 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.