Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Hierarchical Explanations on Text Classification via Feature Interaction Detection

Hanjie Chen, Guangtao Zheng|arXiv (Cornell University)|2020. 04. 04.
Explainable Artificial Intelligence (XAI)참고 문헌 40인용 수 11
한 줄 요약

이 논문은 텍스트 분류에서 다중 해상도에서의 특징 상호작용을 탐지함으로써 계층적 설명을 생성하는 모델에 종속되지 않는 방법인 Hedge를 제안한다. 상호작용 강도에 따라 텍스트 스펙트럼을 반복적으로 식별하고 분할함으로써 Hedge는 모델 예측에 영향을 미치는 단어와 어구가 어떻게 조합되는지를 드러내는 충실하고 해석 가능한 설명을 생성한다. LSTM, CNN, BERT 모델에서 자동 평가와 인간 평가 모두에서 기존 방법들을 능가한다.

ABSTRACT

Generating explanations for neural networks has become crucial for their applications in real-world with respect to reliability and trustworthiness. In natural language processing, existing methods usually provide important features which are words or phrases selected from an input text as an explanation, but ignore the interactions between them. It poses challenges for humans to interpret an explanation and connect it to model prediction. In this work, we build hierarchical explanations by detecting feature interactions. Such explanations visualize how words and phrases are combined at different levels of the hierarchy, which can help users understand the decision-making of black-box models. The proposed method is evaluated with three neural text classifiers (LSTM, CNN, and BERT) on two benchmark datasets, via both automatic and human evaluations. Experiments show the effectiveness of the proposed method in providing explanations that are both faithful to models and interpretable to humans.

연구 동기 및 목표

  • 기존 설명 방법이 결정 과정에서 상호작용을 고려하지 않고 개별 단어나 어구에만 집중하는 한계를 해결하기 위해.
  • 모델 예측에 영향을 미치는 특징의 계층적 구성 원리를 드러내는 모델에 종속되지 않는 접근법을 개발하기 위해.
  • 다중 해상도에서 단어와 어구의 조합이 예측에 기여하는 방식을 시각화함으로써 인간의 해석 가능성 향상을 위해.
  • 자동화된 지표와 인간 평가를 통해 설명의 충실도와 이해 가능성 평가를 위해.

제안 방법

  • Hedge는 검출된 특징 상호작용에 기반해 상향식으로 분할하는 방식으로 반복적으로 텍스트 스펙트럼을 분할한다.
  • 모델의 예측에 각 텍스트 스펙트럼이 기여하는 정도를 측정하기 위해 편향과 예측 변화를 기반으로 한 점수 함수를 사용한다.
  • 각 단계에서 가장 약한 상호작용을 탐지하고 해당 스펙트럼을 분할함으로써 특징 상호작용의 계층적 트리를 구축한다.
  • 이 계층은 전체 문장에서부터 개별 단어까지의 거친 해상도에서부터 세밀한 해상도로의 상호작용을 포괄한다.
  • 이 방법은 모델에 종속되지 않으며, 입력 텍스트와 모델 예측만 필요하므로 어떤 블랙박스 분류기에도 적용 가능하다.
  • 사용자 평가를 위해 설명 길이를 제한하기 위해 최대 5개 토큰까지 상위 기여 특징을 선택함으로써 사용성 향상.

실험 결과

연구 질문

  • RQ1특징 상호작용 탐지가 텍스트 분류에서 설명의 충실도와 해석 가능성 향상에 기여할 수 있는가?
  • RQ2평탄한 단어 수준의 설명과 비교해 계층적 설명 구조가 모델 예측의 조합 논리성을 얼마나 잘 드러내는가?
  • RQ3제안된 방법이 인간 평가에서 기존의 모델에 종속되지 않는 설명 기법보다 뛰어난가?
  • RQ4LSTM, CNN, BERT와 같은 다양한 신경망 아키텍처에서 이 방법의 성능은 어떠한가?
  • RQ5특히 BERT와 같이 높은 성능을 보이는 모델에서는 모델 정확도와 설명의 일관성 사이에 상충 관계가 존재하는가?

주요 결과

  • LSTM 모델을 사용한 IMDB 데이터셋에서 Hedge는 0.89의 최고 일관성 점수를 기록하여 LIME(0.85)와 SampleShapley(0.78)를 포함한 모든 기준 방법들을 능가했다.
  • BERT에서는 높은 정확도(0.97)를 기록했음에도 불구하고 Hedge는 0.75의 강력한 성능을 유지하여 정확도와 해석 가능성 사이의 잠재적 트레이드오���을 시사했다.
  • 인간 평가자들은 Hedge가 생성한 설명에서 다른 방법보다 모델의 예측을 더 정확히 추측할 가능성이 뚜렷하게 높았다. 이는 해석 가능성 향상을 확인한 것이다.
  • Hedge는 BERT에서 부정의 복합 상호작용(예: 'not a bad')을 성공적으로 탐지하여 LSTM이 실패한 경우에도 정확한 예측을 내릴 수 있었던 이유를 설명했다.
  • 계층적 구조는 'good'과 같은 단어가 더 강한 상호작용(예: 'waste of good')에 의해 지배당함을 드러내어 평탄한 설명보다 모델의 추론 과정에 대한 깊이 있는 통찰을 제공했다.
  • SST 및 IMDB 데이터셋에서의 실험을 통해 Hedge의 설명이 모델 행동에 충실하고 인간에게 이해 가능하다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.