Skip to main content
QUICK REVIEW

[논문 리뷰] LICO: Explainable Models with Language-Image Consistency

Yiming Lei, Zilong Li|arXiv (Cornell University)|2023. 10. 15.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

LICO는 군집과 최적 운반 이론을 통한 조각별에서 세밀한 다양체 및 최적 운반 정렬을 통해 시각적 특징을 학습 가능한 클래스별 언어 프롬프트와 정렬함으로써 설명 가능한 이미지 분류를 향상시키는 새로운 프레임워크를 제안한다. 추론 오버헤드 없이 색소그램의 설명 가능성과 분류 정확도를 향상시켜 여덟 개의 벤치마크 데이터셋에서 기존 방법을 능가하며, Grad-CAM과 같은 사후 해석 기법과도 호환된다.

ABSTRACT

Interpreting the decisions of deep learning models has been actively studied since the explosion of deep neural networks. One of the most convincing interpretation approaches is salience-based visual interpretation, such as Grad-CAM, where the generation of attention maps depends merely on categorical labels. Although existing interpretation methods can provide explainable decision clues, they often yield partial correspondence between image and saliency maps due to the limited discriminative information from one-hot labels. This paper develops a Language-Image COnsistency model for explainable image classification, termed LICO, by correlating learnable linguistic prompts with corresponding visual features in a coarse-to-fine manner. Specifically, we first establish a coarse global manifold structure alignment by minimizing the distance between the distributions of image and language features. We then achieve fine-grained saliency maps by applying optimal transport (OT) theory to assign local feature maps with class-specific prompts. Extensive experimental results on eight benchmark datasets demonstrate that the proposed LICO achieves a significant improvement in generating more explainable attention maps in conjunction with existing interpretation methods such as Grad-CAM. Remarkably, LICO improves the classification performance of existing models without introducing any computational overhead during inference. Source code is made available at https://github.com/ymLeiFDU/LICO.

연구 동기 및 목표

  • 사후 해석 기법에서의 one-hot 레이블의 의미적 빈도 부족으로 인해 이미지 영역과 색소그램 간의 약한 대응이 발생하는 문제를 해결하기 위해.
  • CLIP와 같은 대규모 시각-언어 모델(VLM)에서의 실제 세계 의미 지식을 통합하여 딥 러닝 모델의 해석 가능성 향상하기 위해.
  • 학습 가능한 프롬프트 메커니즘을 통해 시각적 특징 다각도와 클래스 인식 언어 표현 간의 일관된 정렬을 가능하게 하기 위해.
  • 최적 운반 이론을 사용하여 국소적 특징 맵을 클래스별 프롬프트와 정렬함으로써 세분화된 색소그램 생성하기 위해.
  • 추론 시에 추가 계산 비용 없이 분류 성능 향상과 해석 가능성 유지하기 위해.

제안 방법

  • 사전 훈련된 CLIP 텍스트 인코더를 사용하여 연속 공간에 임bed된 학습 가능한 클래스별 프롬프트를 도입하여 언어와 시각 간의 다리를 놓는다.
  • 대비 손실을 통해 이미지와 텍스트 특징 분포 간의 전역 다각도 정렬을 수립하여 의미 일관성 확보한다.
  • 국소적 특징 맵을 해당 클래스별 프롬프트와 매칭하기 위해 최적 운반(OT) 이론을 적용하여 세분화된 주의 집중 정렬을 가능하게 한다.
  • 교차 엔트로피, 다각도 매칭, OT 정렬을 결합한 다중 과제 손실을 사용하여 분류 및 해석 가능성 동시 최적화한다.
  • 학습 가능한 MLP를 통해 CLIP 임bed된 프롬프트를 이미지 특징 공간으로 투영하여 공유 거리 공간에서의 정렬을 가능하게 한다.
  • 색소그램을 개선하기 위한 플러그인 모듈로 기존 사후 해석 방법(예: Grad-CAM)과 호환성을 유지한다.

실험 결과

연구 질문

  • RQ1대규모 VLM에서 유도된 언어 유도 프롬프트를 통합함으로써 딥 러닝 모델에서 색소그램의 일관성과 해석 가능성 향상이 가능한가?
  • RQ2시각적 특징 다각도를 클래스 인식 언어 표현과 정렬함으로써 분류 성능 향상과 더 정확한 주의 집중 정렬이 가능할까?
  • RQ3최적 운반 이론을 사용해 국소적 특징 맵을 클래스별 프롬프트에 정교하게 할당하여 설명의 정밀도를 향상시킬 수 있을까?
  • RQ4제안된 방법은 성능 향상과 해석 가능성 향상과 함께 추론 효율성을 유지하는가?
  • RQ5기존의 프롬프트 기반 및 사후 해석 방법과 비교해 LICO는 소수 샘플 및 전체 레이블 설정에서 어떻게 성능을 내는가?

주요 결과

  • 전체 설정에서 CUB-200에서 LICO는 82.7%의 정확도를 기록하여 베이스라인(80.1%)과 +CGC 베이스라인(81.5%)을 능가한다.
  • 스탠포드 카스에서 LICO는 전체 설정에서 91.5%의 정확도를 기록하여 베이스라인(89.7%)과 +CGC(90.3%)를 초월한다.
  • 1-샷 학습에서 LICO는 CUB-200에서 베이스라인 대비 3.2% 향상되고, 스탠포드 카스에서는 1.0% 향상된다.
  • 제거 실험 결과, 다각도 매칭(L_MM)과 OT 정렬(L_OT) 모두 필수적임을 확인하였으며, 병합 사용 시 최고 성능(76.27% top-1 정확도)을 기록한다.
  • 다각도 매칭에서 유클리드 거리가 코사인 유사도보다 더 좋은 성능을 보였으며, CIFAR-100에서 0.32% 향상되었다.
  • CUB-200에서 LICO는 최고의 삽입 및 삭제 점수(각각 57.1과 15.1)를 기록하여 색소그램 품질과 강건성을 뛰어나게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.