Skip to main content
QUICK REVIEW

[논문 리뷰] Explaining Deep Neural Networks

Oana-Maria Camburu|arXiv (Cornell University)|2020. 10. 04.
Explainable Artificial Intelligence (XAI)참고 문헌 128인용 수 22
한 줄 요약

이 박사학위 논문은 딥 뉴럴 네트워크를 설명하기 위한 두 가지 핵심 방향을 조사한다: 특징 기반 사후 설명 방법과 자연어 설명을 생성하는 자기설명형 모델. 연구는 사후 설명 방법의 신뢰성 검증을 위한 프레임워크를 제안하고, 57만 건의 인간이 작성한 설명을 포함하는 e-SNLI 데이터셋을 구축하며, 일관되지 않은 자연어 설명을 탐지하기 위한 적대적 프레임워크를 제안하여 현재 모델에 심각한 결함이 있음을 드러낸다.

ABSTRACT

Deep neural networks are becoming more and more popular due to their revolutionary success in diverse areas, such as computer vision, natural language processing, and speech recognition. However, the decision-making processes of these models are generally not interpretable to users. In various domains, such as healthcare, finance, or law, it is critical to know the reasons behind a decision made by an artificial intelligence system. Therefore, several directions for explaining neural models have recently been explored. In this thesis, I investigate two major directions for explaining deep neural networks. The first direction consists of feature-based post-hoc explanatory methods, that is, methods that aim to explain an already trained and fixed model (post-hoc), and that provide explanations in terms of input features, such as tokens for text and superpixels for images (feature-based). The second direction consists of self-explanatory neural models that generate natural language explanations, that is, models that have a built-in module that generates explanations for the predictions of the model.

연구 동기 및 목표

  • 특징 기반 사후 설명 방법이 모델의 결정을 충실하게 반영하는 데에 한계가 있는지 조사하기 위해.
  • 모델 해석 가능성 통찰을 활용하여 다양한 작업 및 모델에 대해 사후 설명 방법의 신뢰성 검증을 위한 일반적인 프레임워크를 개발하기 위해.
  • 자연어 추론을 위한 인간이 작성한 자연어 설명의 대규모 데이터셋을 수집하고 분석하기 위해.
  • 자기설명형 신경망이 생성하는 일관되지 않은 자연어 설명을 식별하고 탐지하기 위해.
  • 일련의 일관되지 않은 설명을 정확하게 유도하는 순서 기반 적대적 프레임워크를 제안하기 위해.

제안 방법

  • 특정 유형의 해석 가능한 모델을 사용하여 사전 결정 과정을 정확히 반영하는지 검증하는 사후 설명 방법의 신뢰성 검증 프레임워크를 제안한다.
  • 감성 분석 작업에 이 검증 프레임워크를 적용하여, 세 가지 유명한 설명 방법(예: Grad-CAM, LIME, LRP)을 평가하기 위해 단순성 테스트를 실시한다.
  • SNLI 데이터셋에 대해 약 57만 건의 인간이 작성한 자연어 설명을 수집하여 e-SNLI 데이터셋을 구축하며, 설명 템플릿도 함께 제공한다.
  • 적대적 테스트를 위해 재사용 가능한 설명 템플릿(함의, 중립, 모순)을 식별하여 일관되지 않은 설명 쌍을 체계적으로 생성한다.
  • 일관되지 않은 설명을 유도하기 위해 정확한 목표 시퀀스를 생성하는 적대적 공격 프레임워크를 설계한다(예: 동일한 이미지에 대해 '개가 있다'와 '개가 없다'는 설명).
  • e-SNLI에서 최신 기술 모델에 이 적대적 프레임워크를 적용하여, 상당수의 일관되지 않은 설명을 생성할 수 있음을 입증한다.

실험 결과

연구 질문

  • RQ1단일 예측에 대해 여러 가지 타당한 기초 특징 기반 설명이 존재하는가? 그리고 현재의 사후 설명 방법들이 암묵적으로 다른 유형의 설명을 타겟으로 삼고 있는가?
  • RQ2다양한 작업과 모델에 걸쳐 사후 설명 방법의 신뢰성 검증을 위한 일반적이고 즉시 사용 가능한 프레임워크를 개발할 수 있는가?
  • RQ3신경망 모델이 자신의 예측에 대해 정확하고 일관된 자연어 설명을 얼마나 잘 생성할 수 있는가?
  • RQ4학습 시점의 자연어 설명은 테스트 시점에서 모델이 충실한 설명을 생성하는 능력에 어떤 영향을 미치는가?
  • RQ5정확하고 일관되지 않은 자연어 설명을 생성하도록 설계된 적대적 공격를 설계할 수 있으며, 이러한 일관성 결함은 최신 기술 모델에서 얼마나 퍼진 편인가?

주요 결과

  • 사후 설명 방법들은 명시적인 인식 없이 다른 유형의 기초 설명을 타겟으로 삼는 경향이 있으며, 단일 설명은 모델의 결정 과정을 완전히 반영하지 못한다.
  • 제안된 검증 프레임워크는 유명한 설명 방법의 신뢰성 문제를 성공적으로 식별하였으며, 단순성 테스트는 https://github.com/OanaMariaCamburu/CanITrustTheExplainer 에서 이용 가능하다.
  • 공개된 e-SNLI 데이터셋은 https://github.com/OanaMariaCamburu/e-SNLI 에서 확보 가능하며, SNLI 데이터셋에 대해 약 57만 건의 인간이 작성한 자연어 설명을 제공한다.
  • 실험 결과 현재의 자기설명형 모델이 일관되지 않은 설명을 생성할 수 있음을 보여주며, 동일한 이미지에서 객체의 존재와 부재를 동시에 주장하는 경우가 있다.
  • 적대적 프레임워크는 최신 기술 모델에서 상당수의 일관되지 않은 설명을 탐지하여 이러한 결함이 퍼져 있으며 검출 가능하다는 것을 입증한다.
  • 연구 결과는 설명 지도 학습을 거친 모델조차도 모순되는 설명을 생성할 수 있음을 드러내며, 설명 생성의 신뢰성 확보를 위한 강력한 검증 절차가 필요하다는 점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.