Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Token-Level Explanations for Natural Language Inference

James Thorne, Andreas Vlachos|arXiv (Cornell University)|2019. 04. 24.
Topic Modeling참고 문헌 18인용 수 5
한 줄 요약

이 논문은 신경망 모델의 attention 분포를 정규화함으로써 자연어 추론(NLI)에 대한 토큰 수준의 설명을 생성하기 위해 Multiple Instance Learning(MIL)을 사용하는 화이트박스 방법을 제안한다. 단순한 attention 임계값 처리 방식과는 달리, 이 MIL 접근법은 인간이 애너테이션한 설명과의 일치도를 향상시켜 가설 설명의 정밀도에서 6.68% 향상되고 재현율에서 28.05% 향상되었으며, LIME나 Anchor와 같은_BLK-박스 방법보다 수개의 주기수 빠르게 작동한다.

ABSTRACT

The task of Natural Language Inference (NLI) is widely modeled as supervised sentence pair classification. While there has been a lot of work recently on generating explanations of the predictions of classifiers on a single piece of text, there have been no attempts to generate explanations of classifiers operating on pairs of sentences. In this paper, we show that it is possible to generate token-level explanations for NLI without the need for training data explicitly annotated for this purpose. We use a simple LSTM architecture and evaluate both LIME and Anchor explanations for this task. We compare these to a Multiple Instance Learning (MIL) method that uses thresholded attention make token-level predictions. The approach we present in this paper is a novel extension of zero-shot single-sentence tagging to sentence pairs for NLI. We conduct our experiments on the well-studied SNLI dataset that was recently augmented with manually annotation of the tokens that explain the entailment relation. We find that our white-box MIL-based method, while orders of magnitude faster, does not reach the same accuracy as the black-box methods.

연구 동기 및 목표

  • 설명 생성을 위한 애너테이션 없이 NLI 모델에 대한 토큰 수준의 설명을 생성하기 위해.
  • attention 기반 설명이 추론에서 중요한 토큰으로 간주되는 인간의 판단과 얼마나 일치하는지 평가하기 위해.
  • BLK-박스 방법(LIME, Anchor)과 비교하여 화이트박스 MIL 기반 attention 정규화 방법을 평가하기 위해.
  • NLI 설명 생성에서 설명 품질과 계산 효율성 간의 상호 상충 관계를 평가하기 위해.
  • attention 메커니즘이 단독으로 문장 쌍의 추론에 대해 신뢰할 수 있고 인간과 일치하는 설명을 생성할 수 있는지 조사하기 위해.

제안 방법

  • 독립적인 문장 인코딩과 교차 문장 attention을 사용하는 단순한 LSTM 기반 NLI 모델을 사용한다.
  • 임계값 처리된 attention을 사용하여 기준 토큰 수준의 설명을 생성한다.
  • 인간이 애너테이션한 강조 토큰을 향해 attention 분포를 정규화하기 위해 새로운 화이트박스 방법을 도입한다.
  • 각 문장 쌍을 토큰의 백으로 간주하여 attention이 관련 토큰에 집중하도록 유도하는 MIL 목적함수를 사용한다.
  • LIME와 Anchor와 같은 BLK-박스 설명 기법을 사용하여 MIL 방법을 비교한다. 이들 방법은 입력을 변형하고 서rogate 모델을 학습한다.
  • 모든 방법을 인간이 애너테이션한 토큰 강조를 제공하는 e-SNLI 데이터셋에서 평가한다.

실험 결과

연구 질문

  • RQ1설명 생성을 위한 명시적 지도 학습 없이도 NLI 모델의 attention 기반 설명이 인간이 애너테이션한 중요 토큰과 더 잘 일치하도록 개선할 수 있는가?
  • RQ2LIME나 Anchor와 같은 BLK-박스 방법과 비교해보았을 때, MIL 정규화된 attention은 인간의 판단과의 일치도에서 어떤가?
  • RQ3제안된 화이트박스 방법은 계산 효율성을 유지하면서도 단순한 attention 임계값 처리보다 더 높은 설명 품질을 달성하는가?
  • RQ4왜 NLI 모델의 attention 메커니즘은 종종 인간이 중요하게 여기는 토큰을 강조하지 못하는가?
  • RQ5전제와 가설의 인코딩이 독립적으로 이루어지는 아키텍처의 특성으로 인해 attention 기반 설명의 품질이 제한되는 정도는 어느 정도인가?

주요 결과

  • 간단한 attention 임계값 처리 대비 MIL 정규화된 attention 방법은 가설 문장 설명에서 정밀도 6.68% 향상되고 재현율 28.05% 향상되어 F1 점수를 개선했다.
  • BLK-박스 방법(LIME, Anchor)은 인간의 판단과의 일치도에서 모든 attention 기반 접근법을 앞서며, LIME가 가장 높은 F1 점수를 기록했다.
  • 완전히 지도 학습된 기준 모델은 높은 정밀도를 보였지만 재현율은 낮았으며, 'man', 'woman', 'dog'와 같은 일반 단어를 선호하면서도 맥락에 특화된, 레이블과 관련된 토큰은 간과했다.
  • attention 기반 설명은 BLK-박스 방법보다 훨씬 신뢰도가 낮았으며, LIME와 Anchor가 더 높은 F1 점수를 기록함으로써 attention과 특성 중요도 사이의 대응관계가 약하다는 것을 시사했다.
  • BLK-박스 설명 방법은 화이트박스 MIL 방법(1회 인스턴스당 0.01초)에 비해 수개의 주기수 느린 64초(1회 인스턴스당)로 계산 효율성에서 뚜렷한 우위를 보였다.
  • 전제 문장에서 attention의 성능이 열악한 것은 모델의 전제와 가설을 별도로 인코딩하는 아키텍처의 특성으로 인해, 동의어나 추론 패턴과 같은 쌍별 의미적 관계를 포착하지 못하기 때문으로 분석되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.