[논문 리뷰] Building Interpretable Interaction Trees for Deep NLP Models
이 논문은 Shapley 값으로 상호작용 기여도를 정량화하여 훈련된 자연어 처리(NLP)용 깊이 신경망(DNN) 내 계층적 단어 상호작용을 추출하고 시각화하기 위한 사후(post-hoc) 방법을 제안한다. BERT, ELMo, LSTM, CNN, Transformer 모델 전반에 걸쳐 유의미하고 덧셈이 아닌 단어 상호작용을 드러내는 해석 가능한 상호작용 트리(interaction tree)를 구축하며, DNN가 문법적 구조와는 다를 수 있는 논리적 구조를 학습한다는 것을 입증한다.
This paper proposes a method to disentangle and quantify interactions among words that are encoded inside a DNN for natural language processing. We construct a tree to encode salient interactions extracted by the DNN. Six metrics are proposed to analyze properties of interactions between constituents in a sentence. The interaction is defined based on Shapley values of words, which are considered as an unbiased estimation of word contributions to the network prediction. Our method is used to quantify word interactions encoded inside the BERT, ELMo, LSTM, CNN, and Transformer networks. Experimental results have provided a new perspective to understand these DNNs, and have demonstrated the effectiveness of our method.
연구 동기 및 목표
- 모델 아키텍처나 성능을 변경하지 않고 훈련된 DNN을 설명하기 위해.
- 개별 단어 기여도를 넘어서 깊이 네트워크에 인코딩된 단어 간 상호작용을 객관적으로 정량화하기 위해.
- 핵심 상호작용을 시각화하는 계층적 트리 구조를 구축하기 위해.
- 내부 구성요소 간 및 구성요소 간 상호작용 패턴을 진단하기 위한 메트릭을 개발하기 위해.
- 최신 NLP 모델 내 신호 처리 방식을 이해하기 위한 일반적이고 사후 진단 도구를 제공하기 위해.
제안 방법
- 모델 예측에 대한 공정하고 일관된 기여도를 보장하기 위해 Shapley 값을 사용해 단어 기여도를 무편향으로 계산한다.
- 상호작용 기여도를 연합 기여도와 개별 기여도 합의 차이로 정의한다: $ B = \phi_{\text{all}} - \sum_{i=1}^{m} \phi_i $.
- 유의미한 상호작용 기여도를 가지는 구성요소를 나타내는 비엽자 노드로 구성된 이진 트리를 구축하며, 높은 상호작용 강도를 가진 하위 구성요소를 연결한다.
- 상호작용 기여도가 가장 높은 구성요소 쌍을 반복적으로 병합함으로써 근사 알고리즘을 적용해 트리를 구축한다.
- 내부 구성요소 간 및 구성요소 간 상호작용 정량화 및 상호작용 모델링 비율을 포함한 6개의 메트릭을 도입한다.
- Shapley 값 추정을 위해 2000회 샘플링을 사용하여 SST-2 및 CoLA 데이터셋에서 BERT, ELMo, LSTM, CNN, Transformer 모델에 이 방법을 적용한다.
실험 결과
연구 질문
- RQ1딥 네트워크 내부 표현에서 다수의 단어 간 상호작용을 객관적으로 정량화할 수 있는 방법은 무엇인가?
- RQ2DNN가 NLP 작업에서 문법적 구조와 다를 수 있는 상호작용을 얼마나 학습하는가?
- RQ3계층적 트리 구조가 다양한 DNN 아키텍처에 인코딩된 핵심 단어 상호작용을 효과적으로 표현할 수 있는가?
- RQ4BERT, ELMo, LSTM, CNN, Transformer와 같은 모델 간 상호작용 패턴은 어떻게 다를 수 있는가?
- RQ5딥 NLP 모델 내 단어 상호작용의 본질을 효과적으로 진단하고 분리하기 위해 어떤 메트릭이 유용한가?
주요 결과
- 상호작용 트리는 'inconsistent'와 'emotional' 간의 부정적 상호작용과 같이 의미 있는 덧셈이 아닌 상호작용을 성공적으로 포착했으며, 이는 'emotional'의 감정을 긍정에서 부정으로 뒤바꿔 놓는 결과를 낳았다.
- BERT 및 Transformer 모델은 일반적으로 순차적이고 계층적인 상호작용 패턴을 형성한 반면, CNN은 '주어-동사-구' 구조를 선호했다.
- CoLA 데이터셋에서 BERT는 추출된 상호작용 트리와 문법적 트리 간의 피트니스 스코어 36.06(비라벨링 F1)를 기록하여 문법적 구조와의 정렬 정도가 중간 수준임을 시사했다.
- SST-2 데이터셋에서 Transformer 모델은 피트니스 스코어 23.49를 기록해 다른 모델보다 더 구조화된 상호작용 패턴을 인코딩하고 있음을 시사했다.
- 이 방법은 인간이 애너테이션한 문법적 구조와 일치하지 않는 상호작용을 DNN가 모델링하고 있음을 입증했으며, 이는 다양한 모델에서 평균 피트니스 스코어가 낮게 나타남으로써 확인되었다.
- 이 방법은 BERT, ELMo, LSTM, CNN, Transformer 등 다양한 아키텍처에 걸쳐 뛰어난 내구성을 보였으며, 일반 적용 가능성의 타당성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.