Skip to main content
QUICK REVIEW

[논문 리뷰] ConceptLearner: Discovering Visual Concepts from Weakly Labeled Image Collections

Bolei Zhou, Vignesh Jagadeesh|arXiv (Cornell University)|2014. 11. 19.
Advanced Image and Video Retrieval Techniques참고 문헌 31인용 수 6
한 줄 요약

ConceptLearner는 인간이 라벨링한 바운딩 박스 없이 태그 또는 설명만 있는 약한 레이블을 가진 이미지 컬렉션에서 10,000개 이상의 시각적 개념 검출기를 발견하기 위해 확장 가능하고 최대 마진을 고려한 하드 인스턴스 학습 방법을 제안한다. 이는 도메인 선택 기반 감독 하에서 SUN 및 Pascal VOC 2007에서 약한 지도 학습 및 웹 기반 지도 학습 기반선보다 경쟁적인 성능을 달성하며, 이미지 수준의 인식과 영역 수준의 검출에서 뛰어난 성능을 보인다.

ABSTRACT

Discovering visual knowledge from weakly labeled data is crucial to scale up computer vision recognition system, since it is expensive to obtain fully labeled data for a large number of concept categories. In this paper, we propose ConceptLearner, which is a scalable approach to discover visual concepts from weakly labeled image collections. Thousands of visual concept detectors are learned automatically, without human in the loop for additional annotation. We show that these learned detectors could be applied to recognize concepts at image-level and to detect concepts at image region-level accurately. Under domain-specific supervision, we further evaluate the learned concepts for scene recognition on SUN database and for object detection on Pascal VOC 2007. ConceptLearner shows promising performance compared to fully supervised and weakly supervised methods.

연구 동기 및 목표

  • 비용이 많이 드는 완전히 레이블링된 데이터셋 없이도 시각적 인식 시스템의 확장성을 해결하기 위해.
  • 레이블이 노이즈가 많거나 누락되거나 정확도가 떨어지는 약한 레이블이 부여된 이미지 컬렉션에서 시각적 개념을 탐지하기 위해.
  • 인간의 개입 없이 완전히 자동화된 방식으로 대규모 시각적 개념 검출기를 학습하기 위해.
  • 도메인 선택 기반 감독을 통해 학습된 검출기의 일반화 성능을 새로운 데이터셋에서 평가하기 위해.
  • 발견된 개념이 이미지 수준의 인식 및 영역 수준의 검출 작업에서 실제로 유용한지 입증하기 위해.

제안 방법

  • NUS-WIDE 및 SBU와 같은 데이터셋에서 제공하는 이미지 태그나 짧은 설명과 같은 약한 레이블을 감독 신호로 활용한다.
  • 약한 레이블 데이터에서 시각적 개념 검출기를 학습하기 위해 확장 가능한 최대 마진 학습 프레임워크와 하드 인스턴스 마이닝을 적용한다.
  • 두 단계 파이프라인을 사용한다: 첫 번째로 소스 데이터셋에서 개념 검출기를 학습하고, 두 번째로 도메인 선택 기반 감독을 통해 새로운 데이터셋에 적용한다.
  • 객체 검출 평가를 위해 R-CNN에서 유도된 영역 제안 및 딥 특징 추출 파이프라인을 활용한다.
  • Pascal VOC 2007에 전이하기 위해 검증 세트 성능 기반으로 최상의 성능을 보인 개념 검출기를 선별한다.
  • 문법적 구조와 공존 제약 조건을 통합하여 예측을 정교화하고 검출된 개념 간의 중복을 줄인다.

실험 결과

연구 질문

  • RQ1인간이 레이블링한 바운딩 박스 없이도 약한 레이블이 부여된 이미지 컬렉션에서 대규모로 시각적 개념을 탐지할 수 있는가?
  • RQ2약한 레이블이 부여된 데이터에서 학습된 개념 검출기가 SUN 및 Pascal VOC 2007과 같은 새로운 데이터셋으로 일반화되는 정도는 어떠한가?
  • RQ3도메인 선택 기반 감독이 약한 지도 학습 검출기의 최종 인식 및 검출 작업 성능을 향상시킬 수 있는가?
  • RQ4Scene 및 객체 인식에서 ConceptLearner의 성능은 완전히 지도 학습 및 약한 지도 학습 기반선과 비교해 어떻게 되는가?
  • RQ5발견된 개념 검출기가 이미지 수준의 인식과 영역 수준의 검출 모두에 효과적으로 활용될 수 있는가?

주요 결과

  • ConceptLearner는 인간의 레이블링 없이 NUS-WIDE 및 SBU 데이터셋에서 약한 레이블 데이터로부터 10,000개 이상의 시각적 개념 검출기를 학습했다.
  • SUN 데이터베이스에서 시나리오 인식에 대해 평균 mAP 35.6%를 달성하여 약한 지도 학습 및 웹 기반 지도 학습 기반선을 모두 초월했다.
  • Pascal VOC 2007에서 20개의 객체 클래스 평균 정밀도(AP)는 44.7%를 기록하여 웹 기반 지도 학습 및 영상 기반 지도 학습 방법을 모두 능가했다.
  • 20개의 Pascal VOC 2007 클래스 중 14개에서 최신의 약한 지도 학습 방법인 ICML’14 [31]보다 뛰어난 성능을 보였다.
  • 최소한의 재학습으로도 도메인 선택 기반 감독을 통해 강력한 일반화 성능을 입증하여 새로운 데이터셋으로 효과적으로 전이가 가능했다.
  • 프레임워크는 이미지 수준의 인식과 영역 수준의 검출 모두를 지원하며, 두 환경 모두에서 높은 정확도를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.