Skip to main content
QUICK REVIEW

[논문 리뷰] LS-Tree: Model Interpretation When the Data Are Linguistic

Jianbo Chen, Michael I. Jordan|arXiv (Cornell University)|2019. 02. 11.
Topic Modeling참고 문헌 25인용 수 5
한 줄 요약

LS-Tree는 문법적 분석 트리 구조를 활용하여 NLP 모델에 대한 모델에 종속되지 않는 설명 방법을 제안한다. 이 방법은 최소 제곱 기반 중요도 점수를 단어에 할당하며, 이를 협력 게임 이론의 Banzhaf 값과 연결한다. 이는 단어 간 상호작용 탐지 및 비선형성, 반대 관계, 과적합 진단을 BERT, LSTM, CNN, 선형 모델 등 다양한 모델에서 가능하게 한다.

ABSTRACT

We study the problem of interpreting trained classification models in the setting of linguistic data sets. Leveraging a parse tree, we propose to assign least-squares based importance scores to each word of an instance by exploiting syntactic constituency structure. We establish an axiomatic characterization of these importance scores by relating them to the Banzhaf value in coalitional game theory. Based on these importance scores, we develop a principled method for detecting and quantifying interactions between words in a sentence. We demonstrate that the proposed method can aid in interpretability and diagnostics for several widely-used language models.

연구 동기 및 목표

  • 문자 구조를 활용하여 NLP 모델의 해석 가능성 향상을 위한 모델에 종속되지 않는 설명 방법 개발.
  • 협력 게임 이론에 기반하여 분석 트리 노드에 대해 최소 제곱을 적용하여 단어 수준의 중요도 점수를 정량화.
  • 선형 회귀에서 Cook의 거리 적용을 통해 분석 트리의 형제 노드 간 상호작용을 정량화.
  • 상호작용 점수를 활용하여 비선형성, 악성 단어에 대한 민감도, 과적합과 같은 모델 행동 진단.
  • 학습 및 테스트 세트 간 상호작용 점수의 분산 차이를 기반으로 한 과적합 진단 도구 제공.

제안 방법

  • 각 분석 트리 내 단어 부분집합 S에 대해 특성 함수 v(S) = f(S) - f(∅)를 구성하여, 단어 부분집합이 모델 출력에 기여하는 정도를 표현.
  • 모든 분석 트리 부분집합 S에 대해 ∑[v(S) - ∑_{i∈S} ψ_i]² 를 최소화하는 최소 제곱 최적화 문제를 풀어 단어 중요도 점수 ψ를 도출.
  • 이 최소 제곱 문제의 해를 LS-Tree 값으로 정의하며, 이를 협력 게임 이론의 Banzhaf 값과 공식적으로 연결.
  • 선형 회귀에서 Cook의 거리를 활용하여 분석 트리의 형제 노드 간 상호작용을 정량화하고 영향력 있는 단어 쌍 식별.
  • 학습 및 테스트 세트 간 상호작용 점수 분산에 대한 순열 검정을 수행하여 과적합 탐지.
  • 세 가지 데이터셋(SST, IMDB, Yelp)에서 선형 모델, CNN, LSTM, BERT 등 네 가지 모델에 대해 본 방법을 평가하여 해석 가능성 및 진단 능력 평가.

실험 결과

연구 질문

  • RQ1문자 구성 구조를 활용하여 모델에 종속되지 않는 설명 방법이 효과적으로 단어 중요도 점수를 할당할 수 있는가?
  • RQ2분석 트리 구조와 회귀 분석 진단을 통해 문장 내 단어 간 상호작용을 체계적으로 정량화할 수 있는가?
  • RQ3LS-Tree는 BERT, LSTM, CNN과 같은 딥 러닝 모델의 비선형성 정도를 어느 정도 탐지할 수 있는가?
  • RQ4다양한 모델은 문맥에서 반대 관계(예: 'not', 'while')를 어떻게 처리하는가? 그리고 LS-Tree는 이러한 민감도를 정량화할 수 있는가?
  • RQ5학습 및 테스트 세트 간 LS-Tree 상호작용 점수의 분산 차이가 과적합 진단에 신뢰할 수 있는 기준이 될 수 있는가?

주요 결과

  • 모든 데이터셋에서 BERT는 평균 상호작용 점수를 가장 높게 할당하여 다른 모델보다 단어 간 상호작용에 더 민감한 것으로 나타났다.
  • SST 및 IMDB 데이터셋에서 BERT는 다른 모델보다 반대 관계를 더 잘 포착하며, 이는 대규모 텍스트에서의 사전 훈련 덕분으로 보인다.
  • 더 많은 학습 데이터를 가진 Yelp 데이터셋에서는 CNN 및 LSTM 모델이 BERT와 유사한 수준으로 반대 관계 탐지 성능을 보였다.
  • 'while'에 대해 상호작용 점수는 반대 의미를 지닐 경우에 유의미하게 높아졌으며, BERT에서 가장 명확한 구분이 이루어졌다.
  • 과적합된 모델은 테스트 데이터에서 학습 데이터보다 상호작용 점수의 평균 분산이 더 큰 경향을 보였으며, CNN, LSTM, BERT 모두에서 동일한 패tern을 보였다.
  • 학습 및 테스트 세트 간 상호작용 점수 분산에 대한 순열 검정 결과 과적합 단계에서는 p-값이 0.05 이하로 나타나, 이는 조기 정지 기준으로 활용될 수 있음을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.