Skip to main content
QUICK REVIEW

[논문 리뷰] B-cos Alignment for Inherently Interpretable CNNs and Vision Transformers

Moritz Böhle, Navdeeppal Singh|arXiv (Cornell University)|2023. 06. 19.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 CNN 및 비전 트랜스포머에서 선형 레이어의 즉각적인 대체로, 학습 중에 가중치-입력 일치를 촉진하여 본질적으로 해석 가능한 모델을 만드는 B-cos 변환을 소개한다. 이 방법은 단일 선형 변환을 통해 전체 네트워크를 요약함으로써 충실하고 인간이 이해할 수 있는 설명을 가능하게 하며, ImageNet의 top-1 정확도가 80% 이상을 유지하면서도 최신 기준 수준의 설명 품질을 달성한다.

ABSTRACT

We present a new direction for increasing the interpretability of deep neural networks (DNNs) by promoting weight-input alignment during training. For this, we propose to replace the linear transformations in DNNs by our novel B-cos transformation. As we show, a sequence (network) of such transformations induces a single linear transformation that faithfully summarises the full model computations. Moreover, the B-cos transformation is designed such that the weights align with relevant signals during optimisation. As a result, those induced linear transformations become highly interpretable and highlight task-relevant features. Importantly, the B-cos transformation is designed to be compatible with existing architectures and we show that it can easily be integrated into virtually all of the latest state of the art models for computer vision - e.g. ResNets, DenseNets, ConvNext models, as well as Vision Transformers - by combining the B-cos-based explanations with normalisation and attention layers, all whilst maintaining similar accuracy on ImageNet. Finally, we show that the resulting explanations are of high visual quality and perform well under quantitative interpretability metrics.

연구 동기 및 목표

  • 후행 해석 방법에 의존하지 않고 딥 네트워크를 본질적으로 해석 가능하게 만드는 데 도전하는 것.
  • 학습 중에 네트워크 가중치와 임무 관련 입력 신호 간의 일치를 촉진하는 신경망 레이어를 설계하는 것.
  • 결과적으로 도출된 모델 설명이 내부 계산의 충실한 요약이자 인간이 시각적으로 이해할 수 있는 것임을 보장하는 것.
  • 해석 가능성의 향상과 함께 높은 모델 정확도를 유지하는 것 — 특히 합성곱 및 어텐션 기반 아키텍처 모두에 대해.

제안 방법

  • 표준 선형 변환의 새로운 대체로, 최적화 과정에서 입력에 따라 가변하는 가중치-입력 일치를 유도하도록 설계된 B-cos 변환을 제안한다.
  • B-cos 변환은 이러한 레이어의 임의의 시퀀스가 주어진 입력에 대해 모델의 내부 계산을 충실하게 반영하는 단일 선형 변환으로 요약될 수 있음을 보장한다.
  • 해설에서 임의의 가장자리나 모서리 아티팩트를 방지하기 위해 명시적인 편향 항목(b(x) = 0)을 명시적으로 회피함으로써 해석 가능성 향상.
  • 최적화 목표를 수정하여 배치 정규화 및 어텐션 메커니즘과 B-cos 레이어를 통합함으로써, 해석 가능성은 유지하면서도 학습 안정성을 확보한다.
  • 모델이 양성 클래스 점수를 위해 객체 특징을 사용하도록 유도하기 위해 재매개변수화된 타깃 인코딩을 사용한 수정된 교차 엔트로피 손실을 활용한다. 이는 음성 편향 보정에 대한 의존도를 감소시킨다.
  • 평균 보정된 로짓과 해설을 사용하여 모델 출력의 특이성과 인간 해석 가능성의 평가 및 향상.

실험 결과

연구 질문

  • RQ1후행 해석 방법 없이도 본질적으로 해석 가능한 충실한 설명을 생성할 수 있도록 수정된 선형 변환을 설계할 수 있는가?
  • RQ2학습 중에 어떻게 가중치-입력 일치를 촉진하여 모델 표현의 해석 가능성을 높일 수 있는가?
  • RQ3B-cos 변환은 ResNet, DenseNet, ConvNeXt, 비전 트랜스포머와 같은 현대 아키텍처에 얼마나 잘 통합될 수 있으며, 정확도를 유지할 수 있는가?
  • RQ4기존 표준 모델 및 해석 방법과 비교해 볼 때 B-cos 레이어의 사용이 정성적 및 정량적 해석 가능성 지표를 모두 향상시키는가?
  • RQ5최적화 목표를 재구성하여 모델이 이미지 가장자리와 같은 허위 특징을 사용해 편향을 계산하는 데 의존하는 것을 방지할 수 있는가? 이는 해설의 명확성을 향상시킬 수 있는가?

주요 결과

  • B-cos 네트워크는 ResNet, DenseNet, ConvNeXt, 비전 트랜스포머를 포함한 다양한 아키텍처에서 ImageNet에서 top-1 정확도가 80% 이상을 기록하며, 표준 모델과 비교해 미미한 성능 저하만을 보였다.
  • B-cos 해설은 정성적으로 뛰어나며, 객체 부분과 같은 임무 관련 특징을 명확히 강조하며, 기존 해석 방법보다 시각적 품질과 해석 가능성 지표에서 뛰어난 성능을 보였다.
  • 평균 보정된 해설(E’)은 표준 BCE 손실로 학습된 모델가 모든 클래스에서 이미지 가장자리를 양성 편향에 사용하는 경향이 있음을 드러내었으며, 이는 타깃 목표를 재정의해 양성 증거에 집중함으로써 완화되었다.
  • 제안된 최적화 수정 — 타깃 인코딩 재정의 — 는 해설이 관심 객체에 대해 날카럽게 집중하도록 하여, 모델 설계와 최적화가 함께 작용해 해석 가능성의 질을 결정함을 확인했다.
  • B-cos 프레임워크는 정규화 레이어 및 어텐션 메커니즘과 호환되어 최신 기술의 모델에 해석 가능성과 성능을 희생시키지 않고 적용할 수 있다.
  • 비선형성, 정규화, 정규화 없이도 B-cos만으로 구성된 CNN도 CIFAR-10에서 경쟁 가능한 성능을 기록함으로써, B-cos 변환 자체의 모델링 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.