Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Visual Classifiers using Human-centric Annotations.

Ishan Misra, C. Lawrence Zitnick|arXiv (Cornell University)|2015. 12. 22.
Multimodal Machine Learning Applications인용 수 3
한 줄 요약

이 논문은 인간 중심의 노이즈가 많은 애너테이션—태그와 캡션과 같은 것들—으로부터 시각적으로 기반된 이미지 분류기를 학습하는 방법을 제안한다. 이는 인간 보고 편향을 모델링하고 분리함으로써 이루어진다. 일관되지도, 주관적인 애너테이션에서 발생하는 구조적 노이즈를 활용함으로써 분류 및 캡션 성능을 크게 향상시키며, MS COCO 및 Yahoo Flickr 100M와 같은 일부 벤치마크에서 최신 기술 성능을 두 배로 끌어올린다.

ABSTRACT

When human annotators are given a choice about what to label in an image, they apply their own subjective judgments on what to ignore and what to mention. We refer to these noisy human-centric annotations as exhibiting human reporting bias. Examples of such annotations include tags and keywords found on photo sharing sites, or in datasets containing captions. In this paper, we use these noisy annotations for learning visually correct classifiers. Such annotations do not use consistent vocabulary, and miss a significant amount of the information present in an image; however, we demonstrate that the noise in these annotations exhibits structure and can be modeled. We propose an algorithm to decouple the human reporting bias from the correct visually grounded labels. Our results are highly interpretable for reporting what's in the image versus what's worth saying. We demonstrate the algorithm's efficacy along a variety of metrics and datasets, including MS COCO and Yahoo Flickr 100M. We show significant improvements over traditional algorithms for both classification and captioning, doubling the performance of existing methods in some cases.

연구 동기 및 목표

  • 실제 데이터셋에서 발견되는 일관되지도, 주관적인 인간 애너테이션에서 정확한 시각 분류기를 학습하는 데 도전하는 것.
  • 태그와 캡션과 같은 인간 중심의 애너테이션에서 발생하는 구조적 노이즈를 모델링하여 인간 보고 편향을 반영하는 것.
  • 실제 시각적 콘텐츠에서 인간 보고 편향을 분리하여 해석 가능하고 시각적으로 기반된 예측을 생성하는 것.
  • 노이즈가 많은 애너테이션에서 약한 지도 학습을 통해 이미지 분류 및 이미지 캡션 작업의 성능을 향상시키는 것.
  • MS COCO 및 Yahoo Flickr 100M와 같은 다양한 데이터셋에서 실제 애너테이션 조건 하에서 방법의 효과성을 입증하는 것.

제안 방법

  • 이 방법은 인간이 생성한 애너테이션—태그와 캡션과 같은 것들—에서 인간 보고 편향을 구조적 노이즈 과정으로 모델링한다.
  • 애너테이터의 잠재적 시각 콘텐츠와 주관적 보고 행동을 분리하기 위한 확률적 프레임워크를 도입한다.
  • 애너테이션의 어휘 일관성 부족과 정보 누락을 고려하여, 시각적으로 기반된 레이블을 추정하기 위한 공동 추론 메커니즘을 사용한다.
  • 대규모 노이즈가 많은 데이터셋에서 약한 지도 학습을 활용하여, 애너테이션 과정의 편향 인식 표현을 학습한다.
  • 시각 정확도와 인간 보고 패턴의 일관성을 동시에 최적화하는 기울기 역전파가 가능한 목적 함수를 사용해 엔드 투 엔드로 모델을 훈련한다.
  • 시각적 콘텐츠와 '이미지에 무엇이 있는가'와 '언급할 만한 가치가 있는가'를 구분함으로써, 예측의 해석 가능성을 보장한다.

실험 결과

연구 질문

  • RQ1인간 중심의 애너테이션에서 발생하는 구조적 노이즈를 효과적으로 모델링하여 시각 분류기 성능을 향상시킬 수 있는가?
  • RQ2약한 지도 학습에서 인간 보고 편향을 진정한 시각적 콘텐츠에서 얼마나 잘 분리할 수 있는가?
  • RQ3기존 방법과 비교해 실세계 데이터셋에서 제안된 방법이 분류 및 캡션 성능을 얼마나 향상시키는가?
  • RQ4MS COCO 및 Yahoo Flickr 100M와 같이 애너테이션 품질과 어휘 다양성이 다양한 다양한 데이터셋 간에 이 방법이 일반화되는가?
  • RQ5모델이 시각적 콘텐츠와 주관적 애너테이션 선택을 구분할 수 있는 해석 가능한 출력을 생성할 수 있는가?

주요 결과

  • 제안된 방법은 일부 벤치마크 데이터셋에서 기존 방법 대비 이미지 분류 및 캡션 성능을 크게 향상시키며, 경우에 따라 최신 기술 성능을 두 배로 끌어올린다.
  • MS COCO 및 Yahoo Flickr 100M에서 인간 애너테이션의 구조적 노이즈를 효과적으로 모델링함으로써 최신 기술 성능을 달성한다.
  • 시각적으로 기반된 콘텐츠와 주관적 보고 편향을 구분함으로써 높은 해석 가능성을 보여준다.
  • 성능 향상은 다양한 평가 지표에서 일관되게 나타나, 애너테이션 변동성에 대한 강건성을 보여준다.
  • 정제된 또는 기준 레이블이 필요 없이도 애너테이션의 어휘 일관성 부족과 정보 누락을 효과적으로 처리한다.
  • 알고리즘이 다양한 데이터셋으로 잘 일반화되어 있으며, 매우 노이즈가 많은 실제 인간 애너테이션에서도 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.