Skip to main content
QUICK REVIEW

[논문 리뷰] The Irrationality of Neural Rationale Models

Yiming Zheng, Serena Booth|arXiv (Cornell University)|2021. 10. 14.
Explainable Artificial Intelligence (XAI)인용 수 5
한 줄 요약

이 논문은 신경망 추론 모델이 본질적으로 해석 가능하다는 가정을 도전하며, 의미를 유지하는 최소한의 변형에 대해서도 그 추론 선택 과정이 불안정하다는 것을 보여줍니다. 자동 분석과 사용자 연구를 통해 저자들은 추론 선택기와 사용자 모두가 추론 변화를 이해하는 데 어려움을 겪음을 입증하여, 특히 CR과 같은 고정확도 모델에서 추론이 신뢰할 수 있는 설명으로 기능한다는 주장에 의문을 제기합니다.

ABSTRACT

Neural rationale models are popular for interpretable predictions of NLP tasks. In these, a selector extracts segments of the input text, called rationales, and passes these segments to a classifier for prediction. Since the rationale is the only information accessible to the classifier, it is plausibly defined as the explanation. Is such a characterization unconditionally correct? In this paper, we argue to the contrary, with both philosophical perspectives and empirical evidence suggesting that rationale models are, perhaps, less rational and interpretable than expected. We call for more rigorous and comprehensive evaluations of these models to ensure desired properties of interpretability are indeed achieved. The code can be found at https://github.com/yimingz89/Neural-Rationale-Analysis.

연구 동기 및 목표

  • 신경망 추론 모델이 병목 구조를 지닌다는 이유로 본질적으로 해석 가능하다는 널리 퍼진 믿음을 도전하기 위해.
  • 이러한 모델에서 추론 선택 과정이 최소한의 의미 유지 변형에 대해 안정적이고 이해 가능할지 조사하기 위해.
  • 기계 학습 전문가를 포함한 사용자들이 소량의 입력 수정 후에도 추론 변화를 신뢰성 있게 이해하거나 예측할 수 있는지 평가하기 위해.
  • 선택기가 투명하지 않은 신호를 캐릭터화하여 모델의 해석 가능성에 해를 끼치는 잠재적 실패 모드를 폭 드러내기 위해.
  • 신경망 추론 모델의 해석 가능성 주장에 대해 더 철저하고 체계적인 평가를 촉구하기 위해.

제안 방법

  • Stanford Sentiment Treebank (SST) 데이터셋에 비적대적이고 의미를 유지하는 문장 변형을 가하여 추론 안정성 테스트를 수행합니다.
  • 연속적 리파라미터라이제이션(CR) 모델과 정책 기반 기반(PG) 모델을 사용하여 변형이 추론 선택에 미치는 영향을 분석합니다.
  • 자동 분석에는 변형과 관련된 추론 변화의 빈도와 위치, 변화된 단어의 품사(POS) 구성 등을 추적하는 것이 포함됩니다.
  • 기계 학습 석사 과정 학생들을 대상으로 사용자 연구를 수행하여, 입력-출력 예시를 바탕으로 변형 전후의 추론 패턴을 매칭할 수 있는 능력을 평가합니다.
  • 각 문장에서 얼마나 많은 변형이 추론 변화를 유도하는지 세어 문장 간 안정성 수준을 측정합니다.
  • 선택기가 눈에 띄지 않는 신호를 통해 예측을 캐릭터화할 수 있음을 보여주는 반례를 제시합니다.

실험 결과

연구 질문

  • RQ1최소한의 의미 유지 변형이 신경망 추론 모델의 추론 선택에 중대하고 예측 불가능한 변화를 일으킬 수 있는가?
  • RQ2소량의 입력 수정 후 사용자, 특히 전문가들이 추론 변화를 얼마나 이해하거나 예측할 수 있는가?
  • RQ3성능-해석 가능성 트레이드오프가 추론 모델에 나타나는가? 즉, 고정확도 모델일수록 해석 가능성은 떨어지는가?
  • RQ4추론 선택 과정에 해석이 불투명한 숨겨진 신호가 존재하여 모델의 설명 가능성에 해를 끼치는가?
  • RQ5병목 구조만으로도 추론이 충실하고 해석 가능한 설명으로 기능할 수 있는가?

주요 결과

  • CR 모델은 품사가 '명사'인 단어에서 37.1%의 추론 변화를 보였고, PG 모델은 같은 카테고리에서 42.7%의 변화 빈도를 보여, 두 모델 간의 불안정성을 확인했습니다.
  • CR 모델의 경우 70% 이상의 추론 변화가 변형된 단어 외의 단어 교체로 인한 것으로 나타나, 간접적이고 예측 불가능한 영향을 받음을 시사합니다.
  • PG 모델의 78.3%의 추론 변화가 변형된 단어 위치에서 발생했지만, 동일한 위치에서의 변화는 CR 모델에서도 29.6%에 달해 광범위한 영향을 받음을 보여줍니다.
  • 사용자 연구 결과, 참가자들이 80개의 추론 쌍 중 45개만 정확히 매칭하여, 기계 학습 전문가임에도 불구하고 무작위 추측 수준의 성능을 보였습니다.
  • 추론 변화는 문장 간에 균일하게 분포되어 있었으며, 대부분의 불안정성 원인이 특정 소수의 문장에 집중되어 있지 않아, 문제의 성격이 국소적이 아니라 체계적임을 시사합니다.
  • 더 높은 정확도를 달성한 CR 모델은 모든 지표에서 더 나쁜 안정성과 해석 가능성 성능를 보여, 성능-해석 가능성 트레이드오프를 뒷받침합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.