Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Explanation Methods for Neural Machine Translation

Jierui Li, Lemao Liu|arXiv (Cornell University)|2020. 05. 04.
Topic Modeling참고 문헌 34인용 수 4
한 줄 요약

이 논문은 신경 기계 번역(NMT)의 설명 방법을 평가하기 위해 충실도 기반 지표를 제안한다. 이 지표는 설명 방법이 추출한 가장 관련성이 높은 소스 단어들이 NMT 모델의 예측 행동을 얼마나 잘 재구성하는지 측정한다. 이 방법은 인간의 주석 없이도 충실도를 추정하기 위해 근사 최적화 접근법을 사용하며, 실험 결과 예측 차이(Pd)가 주어진 여섯 개 번역 작업 전반에서 주의, 기울기 노름, 가중 기울기 방법보다 충실도에서 뛰어난 성능을 보였다.

ABSTRACT

Recently many efforts have been devoted to interpreting the black-box NMT models, but little progress has been made on metrics to evaluate explanation methods. Word Alignment Error Rate can be used as such a metric that matches human understanding, however, it can not measure explanation methods on those target words that are not aligned to any source word. This paper thereby makes an initial attempt to evaluate explanation methods from an alternative viewpoint. To this end, it proposes a principled metric based on fidelity in regard to the predictive behavior of the NMT model. As the exact computation for this metric is intractable, we employ an efficient approach as its approximation. On six standard translation tasks, we quantitatively evaluate several explanation methods in terms of the proposed metric and we reveal some valuable findings for these explanation methods in our experiments.

연구 동기 및 목표

  • 신경 기계 번역(NMT)에서 설명 방법을 평가하기 위한 원칙적이고 자동화된 지표의 부족을 해결하기 위해.
  • 인간 주석된 대응 관계에 의존하지 않고, NMT 모델의 예측 행동에 대한 충실도를 기반으로 설명 방법을 평가하기 위해.
  • 모든 대상 단어, 특히 인간 주석에서 대응되지 않은 단어들까지도 적용 가능한 확장 가능한 근사 기반 방법을 개발하기 위해.
  • 주의, 기울기 노름, 가중 기울기, 예측 차이와 같은 다수의 설명 방법을 그들이 NMT 모델의 행동을 얼마나 잘 반영하는지 정량적으로 비교하기 위해.

제안 방법

  • 가장 관련성이 높은 소스 단어들에 기반해 훈련된 대체 모델이 NMT 모델의 예측과 얼마나 일치하는지 측정하는 충실도 기반의 원칙적인 평가 지표를 제안한다.
  • NMT 모델과 선택된 소스 단어들로부터 구축된 대체 모델 간의 기대 불일치를 최소화하는 최적화 문제로 지표를 정의한다.
  • 정확한 계산이 불가능한 문제를 해결하기 위해 두 단계의 기계 학습 전략을 사용하여 근사를 도입한다: 경험적 위험 최소화 후 검증용 분리 테스트 세트에서의 검증.
  • 각 설명 방법이 식별한 상위-k개의 관련 단어들을 사용하여 다양한 대체 모델 아키텍처를 구축하고, 근사 지표를 계산한다.
  • 통계적 학습 이론을 활용하여 최적화 문제를 표준 학습 문제로 변환함으로써 효율적이고 확장 가능한 평가를 가능하게 한다.
  • 모델 일치도의 Proxy로 퍼즐리티를 사용하며, 낮은 퍼즐리티가 높은 충실도를 의미한다.

실험 결과

연구 질문

  • RQ1인간 주석된 대응 관계가 아닌 NMT 모델의 예측 행동에 대한 충실도 기반으로 NMT 설명 방법을 어떻게 평가할 수 있는가?
  • RQ2모든 대상 단어, 특히 어떤 소스 단어와도 대응되지 않는 단어들까지 평가할 수 있는 지표를 개발할 수 있는가?
  • RQ3주의, 기울기 노름, 가중 기울기, 예측 차이와 같은 다양한 설명 방법들이 NMT 모델의 행동에 대해 충실도 측면에서 어떻게 비교될 수 있는가?
  • RQ4인간 주석 없이도 설명 방법을 비교하는 데 효과적이고 신뢰할 수 있는 근사 지표가 제안된 것인가?

주요 결과

  • 예측 차이(Pd) 방법이 평가된 모든 설명 방법 중에서 가장 높은 충실도를 달성했으며, 주의, 기울기 노름, 가중 기울기 방법을 모두 앞서 갔다.
  • 기울기 노름(Ngrad)과 예측 차이(Pd)는 모두 강력한 설명 방법이지만, Pd가 NMT 모델의 예측을 재구성하는 데서 뚜렷이 뛰어난 성능을 보였다.
  • 제안된 충실도 기반 지표는 인간의 단어 대응이 없는 대상 단어들에 대해서도 고품질의 설명 방법을 성공적으로 식별했으며, 이는 AER가 평가할 수 없는 영역이다.
  • 제안된 지표(SA)에 의한 설명 방법 순위는 인간 주석이 없는 세 가지 다른 번역 작업 전반에서 일관되게 유지되었으며, AER는 높은 작업 의존성을 보였다.
  • 평가 결과는 충실도가 인간의 판단이나 작업 특화된 가정에 의존하지 않는 신뢰할 수 있고 객관적인 설명 방법 비교 지표임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.