Skip to main content
QUICK REVIEW

[논문 리뷰] On Explaining Your Explanations of BERT: An Empirical Study with Sequence Classification

Zhengxuan Wu, Desmond C. Ong|arXiv (Cornell University)|2021. 01. 01.
Topic Modeling참고 문헌 29인용 수 15
한 줄 요약

이 논문은 감성 분석 데이터셋에서 BERT의 결정을 설명하기 위해 Gradient Sensitivity(GS), Gradient×Input(GI), Layerwise Relevance Propagation(LRP), 그리고 Attention를 통한 LRP(LAT)의 네 가지 소스 기반 해석 방법을 평가한다. GS, GI, LRP는 감성 분석 데이터셋 전반에서 신뢰할 수 있고 강건하며 의미적으로 유의미한 해석을 제공하는 것으로 나타났으며, LAT는 성능이 열 劣하다. 특히 모든 방법이 의미적으로 유사한 작업 간에 관련 점수의 강력한 일반화를 보여준다.

ABSTRACT

BERT, as one of the pretrianed language models, attracts the most attention in recent years for creating new benchmarks across GLUE tasks via fine-tuning. One pressing issue is to open up the blackbox and explain the decision makings of BERT. A number of attribution techniques have been proposed to explain BERT models, but are often limited to sequence to sequence tasks. In this paper, we adapt existing attribution methods on explaining decision makings of BERT in sequence classification tasks. We conduct extensive analyses of four existing attribution methods by applying them to four different datasets in sentiment analysis. We compare the reliability and robustness of each method via various ablation studies. Furthermore, we test whether attribution methods explain generalized semantics across semantically similar tasks. Our work provides solid guidance for using attribution methods to explain decision makings of BERT for downstream classification tasks.

연구 동기 및 목표

  • BERT의 시퀀스 분류 결정을 설명하는 데 있어 네 가지 소스 기반 해석 방법—GS, GI, LRP, LAT의 신뢰성과 강건성을 평가하는 것.
  • 소스 기반 해석 방법이 감성 분석의 의미적으로 유사한 후행 작업 간에 일반화 가능한 해석을 제공하는지 조사하는 것.
  • 微조정된 BERT 모델에서 무작위 가중치 초기화에 따른 소스 기반 점수의 민감도를 평가하는 것.
  • 분류 작업에서 BERT의 의사결정을 탐색할 때 소스 기반 해석 방법을 선택하는 데 있어 경험적 지침을 제공하는 것.

제안 방법

  • 분류 헤드가 있는 BERT 모델에 대해 Gradient Sensitivity(GS), Gradient×Input(GI), Layerwise Relevance Propagation(LRP), LRP with Attention(LAT)의 네 가지 소스 기반 해석 방법을 적응 적용함.
  • SST-5, SemEval, IMDb, Yelp의 네 가지 감성 분류 데이터셋에서 입력 시퀀스의 토큰 수준 관련 점수를 계산하기 위해 이 방법들을 적용함.
  • 신뢰도 평가를 위해 관련 점수가 높은 토큰을 내림차순으로 순차적으로 제거하는 탈락 실험을 수행함.
  • 강건성 평가를 위해 서로 다른 무작위 가중치 초기화로부터 유도된 관련 점수 간 피어슨 상관계수를 계산함.
  • 공통된 어휘를 가진 단어의 관련 점수 간 데이터셋 간 상관관계를 측정하여 의미적 일반화 여부를 테스트함.
  • 기울기 기반 방법에는 L2 노름을, LRP에는 절대합을 사용하여 관련 점수를 계산함. 구현 코드는 공개적으로 배포됨.

실험 결과

연구 질문

  • RQ1GS, GI, LRP, LAT는 다수의 감성 분석 데이터셋에서 BERT의 분류 결정에 중요한 토큰을 얼마나 신뢰성 있게 식별하는가?
  • RQ2BERT의 미세조정 과정에서 무작위 가중치 초기화에 따라 소스 기반 점수는 얼마나 강건한가?
  • RQ3소스 기반 해석 방법은 영화 리뷰나 트윗과 같은 의미적으로 유사한 작업 간에 어느 정도 일반화되는가?
  • RQ4공통된 의미를 가진 데이터셋 간에 서로 다른 소스 기반 해석 방법으로부터 유도된 관련 점수는 의미적으로 유의미한 상관관계를 가지는가?

주요 결과

  • GS, GI, LRP는 높은 관련 점수를 가진 토큰을 탈락시키면 일관되고 강력한 성능 저하를 보이며, 이는 모델 결정과의 강한 일치를 시사함.
  • LAT는 탈락 실험에서 성능이 열 劣하며, 무작위 단어 제거와 유사한 성능 저하 패턴을 보여, 의미 있는 특징을 식별하지 못함을 시사함.
  • 네 가지 소스 기반 해석 방법 모두 공통 어휘 간 관련 점수에 대해 강한 피어슨 상관계수(r > 0.7)를 보이며, 의미적으로 유사한 작업 간 일반화가 이루어짐을 시사함.
  • 무작위 가중치 초기화는 관련 점수에 영향을 미치지만, 그 영향은 제한적임—특히 짧은 시퀀스에서는 일관성이 더 높음.
  • LRP는 GS와 GI보다 더 다양한 관련 점수를 생성하며 의미적으로 풍부한 해석을 제공함. 특히 강한 정서적 의미를 지닌 단어를 더 효과적으로 강조함.
  • 결과는 BERT의 내부 표현이 작업에 특화된 것뿐만 아니라 유사한 의미 영역 간에도 일반화된다는 것을 시사하며, 이는 일관된 소스 기반 해석 패턴을 반영함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.