Skip to main content
QUICK REVIEW

[논문 리뷰] Discretized Integrated Gradients for Explaining Language Models

Soumya Sanyal, Xiang Ren|arXiv (Cornell University)|2021. 08. 31.
Explainable Artificial Intelligence (XAI)참고 문헌 26인용 수 4
한 줄 요약

이 논문은 NLP에서 속성 설명 가능성을 향상시키기 위해 통합 기울기에서 사용하는 선형 보간 경로를 단어 임베딩 공간 내 비선형이고 이산적인 경로로 대체하는 Discretized Integrated Gradients (DIG)를 제안한다. DIG는 실제 어휘에 가까운 앵커 단어를 선택하기 위해 Greedy 및 MaxCount 두 가지 전략을 사용하며, 이는 보간된 점들이 실제 데이터를 대표하게 하여 더 충실한 기울기를 생성하고, BERT, DistilBERT, RoBERTa 모델에서 감성 분류 작업에서 뛰어난 성능을 발휘한다.

ABSTRACT

As a prominent attribution-based explanation algorithm, Integrated Gradients (IG) is widely adopted due to its desirable explanation axioms and the ease of gradient computation. It measures feature importance by averaging the model's output gradient interpolated along a straight-line path in the input data space. However, such straight-line interpolated points are not representative of text data due to the inherent discreteness of the word embedding space. This questions the faithfulness of the gradients computed at the interpolated points and consequently, the quality of the generated explanations. Here we propose Discretized Integrated Gradients (DIG), which allows effective attribution along non-linear interpolation paths. We develop two interpolation strategies for the discrete word embedding space that generates interpolation points that lie close to actual words in the embedding space, yielding more faithful gradient computation. We demonstrate the effectiveness of DIG over IG through experimental and human evaluations on multiple sentiment classification datasets. We provide the source code of DIG to encourage reproducible research.

연구 동기 및 목표

  • 직선 경로를 따라 생성되는 비대표적이고 분포 외의 보간된 점들로 인해 이산적인 텍스트 데이터에서 통합 기울기(IG)의 한계를 해결하기 위해.
  • 임베딩 공간 내 보간된 점들이 어휘 내 실제 단어에 가까워지도록 보장하여 기울기 기반 속성 설명의 충실도를 향상시키기 위해.
  • 입력과 기준 임베딩 사이를 실질적인 단어 앵커를 사용해 단조롭게 보간하는 두 가지 보간 전략인 DIG-Greedy와 DIG-MaxCount를 개발하기 위해.
  • 여러 사전 학습된 언어 모델과 감성 데이터셋에서 DIG가 IG 및 기타 기울기 기반 기준보다 더 자연스럽고 정확한 설명을 제공함을 입증하기 위해.
  • 사용자 평가를 통해 DIG가 생성한 설명이 인간의 신뢰를 더 잘 끌어내어 모델 예측에 대한 신뢰도를 향상시키기 위해.

제안 방법

  • 표준 통합 기울기에서 사용하는 직선 경로 대신 이산적인 단어 임베딩 공간 내 비선형 보간 경로를 제안한다.
  • DIG-Greedy는 각 입력 단어의 단조적 투영에 가장 가까운 실질적인 단어를 앵커로 선택하여 단조적 경로로부터의 거리를 최소화한다.
  • DIG-MaxCount는 입력에서 기준으로 향하는 방향과 일치하는 차원 수가 가장 많은 단어를 앵커로 선택하고, 비단조적 차원을 수정하여 단조성을 확보한다.
  • 선택된 앵커 단어를 사용해 각 점이 입력과 기준 임베딩 사이에서 단조롭게 위치하도록 보간 경로를 구성함으로써 표현력 향상.
  • 경로의 밀도를 높이고 적분 근사 오차를 줄이기 위해 요소 수를 요소 수를 f 배수로 증가시키되, 계산 비용을 크게 증가시키지 않는다.
  • 표준 통합 기울기 공식을 사용하지만, 비선형 경로 상의 이산적이고 데이터에 대표되는 점들에서만 기울기를 계산함으로써 기울기의 정밀도 향상.

실험 결과

연구 질문

  • RQ1단어 임베딩 공간 내 비선형적이고 이산적인 보간 경로가 선형 보간보다 텍스트 데이터에서 더 충실한 기울기를 제공할 수 있는가?
  • RQ2DIG-Greedy와 DIG-MaxCount는 감성 분류 작업에서 표준 통합 기울기와 비교해 속성 설명 품질 측면에서 어떻게 다른가?
  • RQ3DIG가 생성한 설명은 IG 및 기타 기준 대비 인간이 모델의 정당성에 대해 얼마나 더 잘 수용하는가?
  • RQ4초기화 매개변수 m(앵커 수)와 f(업샘플링 요소 수)가 DIG의 근사 오차와 성능에 어떤 영향을 미치는가?
  • RQ5DIG에서 경로를 업샘플링하는 것이 계산 비용을 크게 증가시키지 않으면서도 적분 근사 오차를 효과적으로 줄이는가?

주요 결과

  • BERT, DistilBERT, RoBERTa 세 가지 사전 학습된 언어 모델과 SST2, IMDB, Rotten Tomatoes 세 가지 감성 데이터셋에서 총 아홉 가지 실험 설정 중 여덟 곳에서 DIG가 통합 기울기 및 기타 기울기 기반 기준보다 뛰어난 성능을 보였다.
  • DIG의 Delta % 오차는 업샘플링 요소 수 f가 증가할수록 일관되게 감소하며, 이는 적분 근사가 향상되었음을 시사한다. 반면 WAE는 안정된 편이다.
  • 업샘플링 요소 수 f=0일 때 앵커 수 m을 증가시키면 DIG의 Delta % 오차가 증가함을 확인했으며, 이는 더 긴 경로일수록 근사가 더 어려워짐을 의미한다.
  • 사용자 평가 결과, DIG가 생성한 설명은 IG 및 기타 기준 대비 더 자연스럽고 신뢰할 수 있다고 평가되었다.
  • DIG-MaxCount는 평균적으로 모든 지표에서 뛰어난 성능을 보였으며, 특히 근사 오차를 최소화하고 충실도를 향상시키는 데 뛰어났다.
  • 업샘플링 전략은 WAE를 크게 증가시키지 않으면서도 근사 오차를 효과적으로 줄여, m을 늘리는 것에 대한 확장 가능한 대안으로서의 역할을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.