Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring the Robustness of NMT Systems to Nonsensical Inputs

Akshay Chaturvedi, Abijith Kp|arXiv (Cornell University)|2019. 08. 03.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 11
한 줄 요약

이 논문은 소프트 어텐션 기반의 적대적 공격 기법을 제안하여 다수의 단어 교체를 통해 비논리적인 원천 문장을 생성하면서도 NMT 시스템의 번역 출력을 유지한다. 이 방법은 HotFlip 및 무작위 기반 베이스라인보다 유의미하게 뛰어난 성능을 보이며, 최신 NMT 모델이 단어 수준의 변형에 대해 의미적 불변성에 취약함을 입증함으로써 높은 BLEU 점수에도 불구하고 의미 이해 능력이 떨어짐을 드러낸다.

ABSTRACT

Neural machine translation (NMT) systems have been shown to give undesirable translation when a small change is made in the source sentence. In this paper, we study the behaviour of NMT systems when multiple changes are made to the source sentence. In particular, we ask the following question "Is it possible for an NMT system to predict same translation even when multiple words in the source sentence have been replaced?". To this end, we propose a soft-attention based technique to make the aforementioned word replacements. The experiments are conducted on two language pairs: English-German (en-de) and English-French (en-fr) and two state-of-the-art NMT systems: BLSTM-based encoder-decoder with attention and Transformer. The proposed soft-attention based technique achieves high success rate and outperforms existing methods like HotFlip by a significant margin for all the conducted experiments. The results demonstrate that state-of-the-art NMT systems are unable to capture the semantics of the source language. The proposed soft-attention based technique is an invariance-based adversarial attack on NMT systems. To better evaluate such attacks, we propose an alternate metric and argue its benefits in comparison with success rate.

연구 동기 및 목표

  • 다수의 단어 교체 후 의미적으로 다른 원천 문장들에 대해 NMT 시스템이 동일한 번역을 생성할 수 있는지 조사하는 것.
  • 높은 성공률을 보이는 강건한 소프트 어텐션 기반 방법을 개발하여 이러한 적대적 예제를 생성하는 것.
  • 성공률 외의 관점에서 불변성 기반 공격의 효과를 평가하고, 더 나은 평가를 위한 새로운 BLEU 기반 지표를 제안하는 것.
  • 특히 Transformer와 BLSTM-attention 모델을 포함한 최신 NMT 모델들이 의미적 강건성에 빈도를 보이는 결함을暴露하는 것.
  • 적대적 예제에 대한 골드 표준 번역이 부족하여 강건한 훈련 전략 개발이 어려운 점을 강조하는 것.

제안 방법

  • 적대적 단어 교체를 두 가지 하위 문제로 분해한다: 교체 위치 식별 및 적절한 대체어 선택.
  • 원천 문장에서 단어 교체에 가장 영향을 미치는 위치를 식별하기 위해 Min-Gradient (Min-Grad)를 사용한다.
  • 어텐션 가중치를 활용하여 관련성을 확보함으로써 소프트 어텐션 기반 메커니즘을 도입하여 단어 치환을 안내한다.
  • 서브워드 토크나이제이션으로 인해 발생하는 서브워드를 의미적으로 관련 없는 단어로 교체하면서도 모델의 출력 번역을 유지한다.
  • 영어-독어 및 영어-프랑스어 번역 쌍에 대해 BLSTM-attention 및 Transformer 기반 NMT 시스템에 공격을 적용한다.
  • 공격 효과를 평가하기 위해 성공률 외에 더 세밀한 측정을 제공하는 새로운 BLEU 기반 지표를 제안한다.

실험 결과

연구 질문

  • RQ1다수의 단어 교체로 인해 의미적으로 다른 두 원천 문장에 대해 NMT 시스템이 동일한 번역을 생성할 수 있는가?
  • RQ2HotFlip과 같은 기존 방법과 비교해 소프트 어텐션 기반 방법이 이러한 적대적 예제를 생성하는 데 얼마나 효과적인가?
  • RQ3정지어, 명사, 주제어 등 어떤 종류의 단어가 번역을 변경하지 않고도 교체에 가장 취약한가?
  • RQ4최신 NMT 모델이 단어 수준의 변형에 대해 의미를 제대로 포착하지 못하는 정도는 어느 정도인가?
  • RQ5성공률 외에 BLEU 기반 지표가 불변성 기반 적대적 공격의 평가에 더 신뢰할 수 있는가?

주요 결과

  • 제안된 Min-Grad+Soft-Att 방법은 en-de 및 en-fr 쌍 전반에서 HotFlip 및 무작위 기반 베이스라인보다 유의미하게 높은 성공률을 기록한다.
  • 이 방법은 다수의 단어를 의미적으로 관련 없는 단어로 교체한 후에도 NMT 시스템이 동일한 번역을 생성하는 적대적 예제를 성공적으로 생성한다.
  • 높은 주제적 관련성의 단어나 명사체계 단어조차도 번역을 변경하지 않고 교체되며, 이는 NMT 모델 내에서 깊은 의미적 불변성이 존재함을 시사한다.
  • 연구는 높은 BLEU 점수와 의미적 강건성 간에 상관관계가 없음을 드러내며, 모델이 비논리적인 입력을 탐지하지 못함을 입증한다.
  • 제안된 BLEU 기반 지표는 성공률만으로 평가하는 것보다 공격 효과 평가에 더 정보적인 측면을 제공하며, 특히 변형에 따른 번역 품질을 보다 잘 반영한다.
  • 적대적 예제에 대한 골드 표준 번역이 부족하여 강건한 훈련 전략 개발이 어려운 점은 향후 연구의 주요 장벽임을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.