Skip to main content
QUICK REVIEW

[논문 리뷰] Quantifying Learnability and Describability of Visual Concepts Emerging in Representation Learning

Iro Laina, Ruth Fong|arXiv (Cornell University)|2020. 10. 27.
Multimodal Machine Learning Applications참고 문헌 69인용 수 4
한 줄 요약

이 논문은 자기지도 학습을 통한 시각적 개념의 해석 가능성 해석을 정량화하기 위해 인간 기반의 두 객관적 지표인 학습 가능성과 기술 가능성(기술포텐셜)을 도입한다. 인간 평가자를 분류기로 삼아 학습 가능성을 측정하고, 자연어 기술을 통해 클래스를 인식할 수 있는 능력을 테스트함으로써, 주관성을 줄이고 인간 및 자동화된 캡션 시스템 간의 클래스 수준 기술 비교를 가능하게 하는 원칙적이고 확장 가능한 평가 프레임워크를 제공한다.

ABSTRACT

The increasing impact of black box models, and particularly of unsupervised ones, comes with an increasing interest in tools to understand and interpret them. In this paper, we consider in particular how to characterise visual groupings discovered automatically by deep neural networks, starting with state-of-the-art clustering methods. In some cases, clusters readily correspond to an existing labelled dataset. However, often they do not, yet they still maintain an "intuitive interpretability". We introduce two concepts, visual learnability and describability, that can be used to quantify the interpretability of arbitrary image groupings, including unsupervised ones. The idea is to measure (1) how well humans can learn to reproduce a grouping by measuring their ability to generalise from a small set of visual examples (learnability) and (2) whether the set of visual examples can be replaced by a succinct, textual description (describability). By assessing human annotators as classifiers, we remove the subjective quality of existing evaluation metrics. For better scalability, we finally propose a class-level captioning system to generate descriptions for visual groupings automatically and compare it to human annotators using the describability metric.

연구 동기 및 목표

  • 자기지도 학습을 통해 발견된 시각적 개념의 해석 가능성 평가를 위한 원칙적이고 객관적인 평가 프레임워크를 개발하기 위해.
  • 주관적인 이름 붙이기나 기술 작업에 의존하는 대신 인간 평가자를 분류기로 활용하여 해석 가능성 평가의 주관성을 줄이기 위해.
  • 특히 ImageNet과 같은 기존 레이블이 있는 데이터셋과 일치하지 않는 시각적 클러스터가 인간이 얼마나 잘 학습하고 기술할 수 있는지 정량화하기 위해.
  • 자동화된 클래스 수준 캡션 시스템이 인간 수준의 기술 가능성과 맞는 기술을 생성할 수 있는지 조사하기 위해.
  • 인간 및 기계가 생성한 시각 클러스터 기술 간의 직접적이고 정량적인 비교를 가능하게 하기 위해.

제안 방법

  • 소수의 예시만을 사용하여 인간 평가자가 주어진 클러스터에 속하는지 여부를 분류하도록 훈련하고, 분류 정확도를 의미적 일관성의 객관적 지표로 삼음으로써 학습 가능성을 측정함.
  • 평가자에게 클러스터의 자연어 기술을 제공하고, 새로운 예시를 기술에 기반해 정확하게 분류할 수 있는 능력을 측정함으로써 기술 가능성을 평가함.
  • 단일 이미지 캡션 모델에서 유도된 클래스 수준 캡션 시스템을 사용하여 시각 클러스터에 대해 자동으로 기술을 생성함.
  • 자동화된 기술과 인간 평가자 기반 기술 간의 성능을 기술 가능성 지표를 사용해 비교함으로써 기계가 생성한 기술의 품질을 검증함.
  • 인간의 학습 가능성과 기술 가능성을 동시에 테스트하는 강제 선택 실험 설계를 통해 객관성과 확장성을 확보함.
  • 인간 평가에 의존하지 않고도 기술의 품질을 검증할 수 있는 지표를 도입하여, 시각 클러스터의 캡션 시스템에 대한 자동화된 벤치마킹을 가능하게 함.

실험 결과

연구 질문

  • RQ1표준 데이터셋에 레이블이 없는 개념이라도 소수의 예시만으로 인간이 그 시각적 개념을 인식할 수 있는 정도는 어느 정도인가?
  • RQ2단순하고 자연스러운 언어 기술로 시각 클러스터를 충실하게 요약할 수 있으며, 이를 통해 인간이 정확하게 인식할 수 있는가?
  • RQ3자동화된 캡션 시스템은 인간 평가자 기반 기술과 비슷한 수준의 품질을 갖는 기술을 얼마나 잘 생성할 수 있는가?
  • RQ4제안된 지표인 학습 가능성과 기술 가능성은 해석 가능성 연구에서 주관적인 인간 평가의 객관적이고 확장 가능한 대안이 될 수 있는가?
  • RQ5자기지도 모델은 표준 이미지 분류 레이블에 포함되지 않는 의미적으로 일관된 시각적 개념을 발견하는가?

주요 결과

  • 자기지도 모델은 ImageNet과 같은 표준 레이블과 일치하지 않는 경우에도 의미적으로 일관된 시각적 개념을 발견할 수 있으며, 이는 높은 인간 학습 가능성 점수로 입증된다.
  • 인간 평가자가 소수의 예시만으로도 높은 정확도로 이미지를 분류함으로써, 발견된 클러스터의 의미적 일관성이 높음을 시사한다.
  • 기술 가능성 지표는 자연어 기술이 시각 클러스터의 핵심을 얼마나 효과적으로 포괄하는지 정량화하는 데 성공했으며, 대부분의 경우 인간 평가자 기반 기술이 기준 자동 캡션보다 우수한 성능을 보였다.
  • 제안된 클래스 수준 캡션 시스템은 클러스터 수준 데이터로 미세조정된 경우 인간 평가자 기반 기술과 경쟁 가능한 기술을 생성할 수 있으며, 특히 그 경우에 뛰어난 성능을 보였다.
  • 이 프레임워크를 통해 인간 및 기계가 생성한 기술 간의 직접적이고 정량적인 비교가 가능해졌으며, 적절히 보정된 자동화 시스템이 높은 기술 가능성 수준을 달성할 수 있음을 입증했다.
  • 학습 가능성과 기술 가능성 지표는 해석 가능성 연구에서 주관적인 평가 방법에 대한 객관적이고 확장 가능한 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.