Skip to main content
QUICK REVIEW

[논문 리뷰] Language in a Bottle: Language Model Guided Concept Bottlenecks for Interpretable Image Classification

Yue Yang, Artemis Panagopoulou|arXiv (Cornell University)|2022. 11. 21.
Explainable Artificial Intelligence (XAI)인용 수 6
한 줄 요약

이 논문은 GPT-3를 사용해 텍스트적 개념을 생성하고 CLIP를 활용해 이미지와 정렬함으로써 자동으로 고성능이며 해석 가능한 개념 버블넥 모델(CBMs)을 생성하는 언어 유도 버블넥(LaBo)을 제안한다. LaBo는 11개의 다양한 데이터셋에서 1-shot 학습 시 선형 프로브보다 11.7% 높은 정확도를 달성하여, 수동 개념 주석이 필요 없이도 검정 상자 모델의 성능을 따라하거나 능가하는 해석 가능한 모델이 가능함을 보여준다.

ABSTRACT

Concept Bottleneck Models (CBM) are inherently interpretable models that factor model decisions into human-readable concepts. They allow people to easily understand why a model is failing, a critical feature for high-stakes applications. CBMs require manually specified concepts and often under-perform their black box counterparts, preventing their broad adoption. We address these shortcomings and are first to show how to construct high-performance CBMs without manual specification of similar accuracy to black box models. Our approach, Language Guided Bottlenecks (LaBo), leverages a language model, GPT-3, to define a large space of possible bottlenecks. Given a problem domain, LaBo uses GPT-3 to produce factual sentences about categories to form candidate concepts. LaBo efficiently searches possible bottlenecks through a novel submodular utility that promotes the selection of discriminative and diverse information. Ultimately, GPT-3's sentential concepts can be aligned to images using CLIP, to form a bottleneck layer. Experiments demonstrate that LaBo is a highly effective prior for concepts important to visual recognition. In the evaluation with 11 diverse datasets, LaBo bottlenecks excel at few-shot classification: they are 11.7% more accurate than black box linear probes at 1 shot and comparable with more data. Overall, LaBo demonstrates that inherently interpretable models can be widely applied at similar, or better, performance than black box approaches.

연구 동기 및 목표

  • 개념 버블넥 모델(CBMs)의 한계를 해결하기 위해, 비용이 많이 들고 수동으로 개념을 주석화해야 하는 문제와 종종 검정 상자 모델보다 성능이 열 劣한 문제를 해결하고자 한다.
  • 수동으로 설계된 개념이 없이도 고성능이면서 본질적으로 해석 가능한 이미지 분류기를 개발하고자 한다.
  • 언어 모델이 시각적으로 관련이 있고, 구분력이 있으며 다양한 개념을 효과적으로 식별하는 데 유용한 사전 지식로 기능할 수 있음을 보여주고자 한다.
  • 특히 저자료 환경에서 검정 상자 모델과 경쟁하거나 그 이상의 성능을 달성하면서도 CBMs의 해석 가능성 유지하기

제안 방법

  • 카테고리별로 특화된 기술적 설명을 GPT-3에 프롬프트하여 후보 개념으로서 사실적이고 기술적인 문장을 대량 생성한다.
  • 구분력, 커버리지, 다양성을 균형 있게 고려하는 새로운 서브모듈라 utility 함수를 제안하여 후보 풀에서 최적의 개념 하위집합을 효율적으로 선별한다.
  • CLIP를 사용해 이미지 입력과 텍스트적 개념을 모두 임bedding 처리함으로써, 이미지 내 개념 존재 여부를 크로스 어텐션 기반 점수로 평가한다.
  • 선택된 개념 점수를 기반으로 버블넥 레이어를 구성하고, 이를 선형 분류기의 입력 특징으로 사용하여 이미지 레이블을 예측한다.
  • 표준 학습 절차를 사용해 선형 분류기를 엔드 투 엔드로 최적화함으로써 모델의 해석 가능성 유지한다.
  • 각 데이터셋에 맞게 GPT-3 프롬프트를 미세조정하여 어휘의 정확도를 높이고 모호성을 줄인다 (예: '조랑판새'라는 꽃과 새를 혼동 방지)

실험 결과

연구 질문

  • RQ1GPT-3와 같은 언어 모델을 사용해 해석 가능한 이미지 분류를 위한 고품질의 시각적으로 기반된 개념을 자동으로 생성할 수 있는가?
  • RQ2언어 모델이 생성한 대량의 후보 개념에서 다양하고 구분력 있는 하위집합을 효율적으로 선별할 수 있는가?
  • RQ3자동으로 생성된 개념 버블넥이 특히 저샷 학습 환경에서 검정 상자 모델과 비교해 성능이 유사하거나 뛰어나게 달성할 수 있는가?
  • RQ4자동으로 생성된 개념은 수동으로 설계된 CBMs에 비해 정확도를 높이면서도 얼마나 높은 수준의 해석 가능성을 유지하는가?
  • RQ5버블넥 크기, 개념 길이, 클래스 이름 포함 여부 등의 설계 선택 사항이 성능 및 해석 가능성에 어떤 영향을 미치는가?

주요 결과

  • LaBo는 11개의 다양한 데이터셋에서 1-shot 학습 시 선형 프로브보다 평균 11.7% 높은 정확도를 달성하여 저자료 환경에서 검정 상자 기반 모델을 크게 능가한다.
  • LaBo 버블넥은 다양한 데이터 설정에서 평균적으로 선형 프로브보다 1.5% 더 높은 정확도를 기록하여 일관된 성능 향상을 보였다.
  • 수동 개념 주석의 필요성을 줄여주어 도메인 전문가의 입력 없이도 해석 가능한 모델을 구축할 수 있도록 한다.
  • LaBo는 개념이 자연어 기반의 설명이므로 인간이 읽고 이해할 수 있으며, 시각적 특성과 의미적으로 기반된 고도의 해석 가능성을 유지한다.
  • 제거 실험 결과, 클래스 이름을 개념에서 제외하고 짧고 중복이 없으며 시각적으로 기반된 문장을 선호할 경우 성능과 해석 가능성 양측 모두 향상됨을 확인했다.
  • 이 방법은 미세조정이 최소한으로 필요한 수준에서 다양한 분야에 일반화 가능하며, 정밀한 이미지 인식, 피부 종양 분류, 위성 영상 분석 등 다양한 분야에서 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.