Skip to main content
QUICK REVIEW

[논문 리뷰] Fine-grained visual recognition with salient feature detection

Hui Feng, Shanshan Wang|arXiv (Cornell University)|2018. 08. 12.
Advanced Neural Network Applications참고 문헌 14인용 수 4
한 줄 요약

이 논문은 부분 애너테이션을 사용하여 주목할 만한 객체 부분을 탐지하고, 개별 부분에서 분류에 유용한 특징을 추출하며, 이를 조합하여 분류 성능을 향상시키는 미세한 시각 인식 방법인 FP-CNN을 제안한다. 이는 CUB200-2011 데이터셋에서 88.20%의 정확도를 달성하여 최신 기술 대비 최대 7.2个百分点 향상된 성능을 보였다.

ABSTRACT

Computer vision based fine-grained recognition has received great attention in recent years. Existing works focus on discriminative part localization and feature learning. In this paper, to improve the performance of fine-grained recognition, we try to precisely locate as many salient parts of object as possible at first. Then, we figure out the classification probability that can be obtained by using separate parts for object classification. Finally, through extracting efficient features from each part and combining them, then feeding to a classifier for recognition, an improved accuracy over state-of-art algorithms has been obtained on CUB200-2011 bird dataset.

연구 동기 및 목표

  • 정확한 객체 부분 국소화를 통해 미세한 시각 인식 정확도를 향상시키기 위해.
  • 개별 부분(예: 머리, 날개, 다리)이 분류 성능에 기여하는 방식을 분석하기 위해.
  • 다양한 부분의 특징을 조합하여 뛰어난 인식 정확도를 달성하는 방법을 개발하기 위해.
  • CUB200-2011 벤치마크에서 기존 최신 기술을 능가하기 위해.

제안 방법

  • 부분 애너테이션을 사용하여 주목할 만한 부분을 탐지하고 국소화함으로써 레이블이 부여된 부분 이미지를 생성하는 딥 네트워크를 훈련한다.
  • 관절점 애너테이션(예: 부리, 정상, 날개)을 기반으로 최소한의 직사각형 또는 정사각형 봉투를 사용하여 부분 영역을 생성한다.
  • 세부 조정된 ResNet-50 모델을 사용하여 각 탐지된 부분에서 특징을 추출한다.
  • 분류기(libSVM)를 사용하여 특징을 점진적으로 조합하여 성능 향상을 평가한다.
  • 개별 부분의 성능을 기반으로 머리, 날개, 가슴에서의 특징를 사용하는 최종 모델를 구성하여 최적의 인식 성능를 달성한다.
  • 입력 이미지를 224×224로 리사이징하여 CUB200-2011 데이터셋에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1어느 객체 부분이 미세한 분류 정확도에 가장 크게 기여하는가?
  • RQ2분류에 독립적으로 사용될 경우 개별 부분의 성능는 어떻게 비교되는가?
  • RQ3다양한 부분의 특징를 점진적으로 조합하면 전체 인식 정확도가 전체 이미지 또는 단일 부분을 사용할 때보다 향상되는가?
  • RQ4제안된 주목할 만한 부분 탐지 및 특징 조합 방법이 CUB200-2011에서 기존 최신 기술을 능가하는가?

주요 결과

  • 머리 영역만으로도 77.02%의 분류 정확도를 달성하여 다른 모든 개별 부분보다 뛰어나며, 전체 이미지 인식 성능(78.92%)에 근접한다.
  • 날개와 가슴 부분은 각각 약 50%의 정확도를 기록하여 중간 정도이지만 분류에 도움이 되는 정보를 제공한다.
  • 다리와 꼬리 부분은 각각 31.72%와 29.48%의 가장 낮은 개별 정확도를 기록하여 분류에 있어 최소한의 분류 능력을 가진다.
  • 머리, 날개, 가슴에서의 특징를 점진적으로 조합하면 최고의 정확도 88.23%를 달성하여 모든 부분의 조합보다 略로 높은 성능를 기록한다.
  • 최종 FP-CNN 모델은 CUB200-2011 테스트 세트에서 88.20%의 정확도를 기록하여 최고의 기존 방법(Mask-CNN, 87.30%)을 0.9个百分点 뛰어넘었다.
  • 완전한 감독 없이도 약 4.1에서 7.2个百分点 향상되어 약한 감독 기반 접근법보다 뛰어난 성능를 보이며, 강력한 성능를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.