Skip to main content
QUICK REVIEW

[논문 리뷰] The elephant in the interpretability room: Why use attention as explanation when we have saliency methods?

Jasmijn Bastings, Katja Filippova|arXiv (Cornell University)|2020. 10. 12.
Explainable Artificial Intelligence (XAI)참고 문헌 24인용 수 4
한 줄 요약

이 논문은 모델 개발자가 충실도 있고 토큰 수준의 관련성 점수를 필요로 할 때, 입력 시각화 방법이 주의 메커니즘보다 모델 예측을 설명하는 데 더 우수하다고 주장한다. 주의 메커니즘은 추출이 용이하지만, 입력 토큰 중 가장 영향력 있는 요소를 식별하는 목적을 충족시키는 데 시각화 방법이 더 낫고, 저자들은 해석 가능성 연구에서 주의 메커니즘에서 시각화 방법으로의 전환을 촉구한다.

ABSTRACT

There is a recent surge of interest in using attention as explanation of model predictions, with mixed evidence on whether attention can be used as such. While attention conveniently gives us one weight per input token and is easily extracted, it is often unclear toward what goal it is used as explanation. We find that often that goal, whether explicitly stated or not, is to find out what input tokens are the most relevant to a prediction, and that the implied user for the explanation is a model developer. For this goal and user, we argue that input saliency methods are better suited, and that there are no compelling reasons to use attention, despite the coincidence that it provides a weight for each input. With this position paper, we hope to shift some of the recent focus on attention to saliency methods, and for authors to clearly state the goal and user for their explanations.

연구 동기 및 목표

  • NLP에서 주의 메커니즘이 설명으로 널리 사용되고 있는 것을 도전하고자 하며, 특히 시각화 방법이 동일한 목적을 이미 수행하고 있음에도 불구하고 그렇다.
  • 주의 메커니즘을 설명으로 사용할 때의 암묵적 목표를 특정하고자 하며, 예측에 가장 관련성이 높은 입력 토큰을 식별하는 것이다.
  • 이러한 설명의 주된 사용자가 일반적으로 모델 개발자임을 명확히 하여, 충실도가 매우 중요하다는 점을 강조하고자 한다.
  • 충실도 있는 토큰 수준의 관련성 할당을 달성하는 데에 시각화 방법이 주의 메커니즘보다 더 적합하다고 주장하고자 한다.
  • 연구자들이 설명의 목표와 사용자를 명시적으로 정의하여 해석 가능성 연구의 질을 향상시키기를 촉구하고자 한다.

제안 방법

  • 주의 메커니즘을 설명으로 사용할 때의 암묵적 목표를 분석한다: 특히 모델 개발자를 대상으로 하여 예측에 가장 중요한 입력 토큰을 식별하는 것이다.
  • 모델 행동에 대한 충실도 측면에서 주의 가중치와 기울기 기반 시각화 방법(예: 통합 기울기, Grad-CAM)을 비교한다.
  • 주의 메커니즘을 기존의 시각화 기준과 비교하여, 시각화 방법이 입력 관련성 할당을 위해 특별히 설계되어 있음을 평가한다.
  • 주의 메커니즘이 기울기 기반 중요도 측정과 빈번히 낮은 상관관계를 보이며, 악성 공격에 취약하다는 경험적 증거를 검토한다.
  • 시각화 방법은 단일 정방향 및 역방향 전파만으로도 수행 가능하므로 계산적으로 효율적이며, 주의 메커니즘과 유사하다는 점을 강조한다.
  • 주저서 주의 메커니즘을 시각화의 대체 수단으로 사용해서는 안 된다고 제안한다. 비록 토큰별 가중치를 제공하는 데 편리하지만 말이다.

실험 결과

연구 질문

  • RQ1왜 시각화 방법이 동일한 목적을 수행하고 있음에도 불구하고 주의 메커니즘이 일반적으로 설명으로 사용되는가?
  • RQ2실제로 주의 메커니즘을 설명으로 사용할 때의 진정한 목표는 무엇이며, 그 대상 사용자는 누구인가?
  • RQ3주의 가중치의 충실도가 입력 토큰의 관련성 식별에 있어 기존의 시각화 방법과 비교하여 어떻게 되는가?
  • RQ4입력 관련성 설명에 있어 주의 메커니즘을 시각화 방법보다 선호할 만한 설득력 있는 이유가 있는가?
  • RQ5톆크 수준의 시각화를 넘어서 다양한 해석 가능성 목표를 더 잘 충족시킬 수 있는 대안적 설명 방법은 무엇인가?

주요 결과

  • 주의 메커니즘을 설명으로 사용할 때의 주요 목표는 예측에 가장 관련성이 높은 입력 토큰을 식별하는 것으로, 이는 시각화 방법이 명시적으로 다루는 과제이다.
  • 경험적 연구 결과에 따르면 주의 가중치는 기울기 기반 중요도 측정과 자주 낮은 상관관계를 보이며, 이는 충실도가 낮다는 것을 시사한다.
  • 주의 메커니즘은 모델이 여전히 정확한 예측을 내릴 수 있음에도 불구하고, 입력 토큰에 대한 모델 의존도를 잘못 반영하는 위장된 가중치를 생성할 수 있다.
  • 통합 기울기 및 Grad-CAM과 같은 시각화 방법은 예측에 중요한 입력 특징을 더 신뢰성 있고 충실도 있게 식별하는 데에 더 유용하다.
  • 주의 메커니즘의 계산적 편의성에도 불구하고, 시각화 방법은 동일하게 효율적이며 단일 정방향 및 역방향 전파만으로도 가능하므로, 더 복잡하게 구현되지 않는다.
  • 주의 메커니즘을 설명으로 사용할 때는 일반적으로 인과적 정의를 가정하지만, 주의 메커니즘이 인과적 영향을 반영하지 못한다는 점을 강조한다. 주의 메커니즘은 계산의 한 지점에서의 주의를 반영할 뿐이며, 인과적 영향은 아니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.