Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Attention Multi-Class Constraint for Fine-grained Image Recognition

Ming Sun, Yuchen Yuan|arXiv (Cornell University)|2018. 06. 14.
Advanced Neural Network Applications인용 수 17
한 줄 요약

이 논문은 미세 분류 이미지 인식을 위한 새로운 엔드 투 엔드 CNN 프레임워크를 제안하며, one-squeeze multi-excitation (OSME) 모듈과 multi-attention multi-class constraint (MAMC)를 포함한다. 이는 복수의 특징 부분을 동시에 국소화하고 주의 영역 간의 거리 학습을 강제함으로써 단일 단계 학습을 효율적으로 가능하게 하며, 부분 애너테이션 없이도 CUB-200-2011, Stanford Dogs, Stanford Cars 및 새로운 대규모 Dogs-in-the-Wild 데이터셋에서 최신 기술 수준의 정확도를 달성한다.

ABSTRACT

Attention-based learning for fine-grained image recognition remains a challenging task, where most of the existing methods treat each object part in isolation, while neglecting the correlations among them. In addition, the multi-stage or multi-scale mechanisms involved make the existing methods less efficient and hard to be trained end-to-end. In this paper, we propose a novel attention-based convolutional neural network (CNN) which regulates multiple object parts among different input images. Our method first learns multiple attention region features of each input image through the one-squeeze multi-excitation (OSME) module, and then apply the multi-attention multi-class constraint (MAMC) in a metric learning framework. For each anchor feature, the MAMC functions by pulling same-attention same-class features closer, while pushing different-attention or different-class features away. Our method can be easily trained end-to-end, and is highly efficient which requires only one training stage. Moreover, we introduce Dogs-in-the-Wild, a comprehensive dog species dataset that surpasses similar existing datasets by category coverage, data volume and annotation quality. This dataset will be released upon acceptance to facilitate the research of fine-grained image recognition. Extensive experiments are conducted to show the substantial improvements of our method on four benchmark datasets.

연구 동기 및 목표

  • 기존의 약한 감독 기반 미세 분류 인식 방법이 개별적으로 객체 부위를 다루고 복잡한 다단계 학습을 요구하는 한계를 해결하기 위해.
  • 단일 순방향 전파에서 다수의 상관관계가 없는 부위를 효율적으로 국소화할 수 있는 경량이며 완전히 미분 가능한 주의 메커니즘을 개발하기 위해.
  • 주의 영역과 클래스 식별자에 따라 특징 클러스터링을 강제하는 메트릭 학습 기반 손실(MAMC)을 도입하기 위해.
  • 미세 분류 인식 연구를 촉진하기 위해 고품질의 대규모 강아지 종 분류 데이터셋인 Dogs-in-the-Wild을 수집하고 공개하기 위해.

제안 방법

  • one-squeeze multi-excitation (OSME) 모듈은 특징 맵에 채널별 자극을 적용하여 복수의 특징적인 주의 영역을 명시적 자르기나 다중 순방향 전파 없이 식별한다.
  • OSME는 하나의 전역 평균 풀링 연산(일명 one-squeeze)을 수행한 후, 병렬로 실행되는 다수의 자극 분기로 구성되어 서로 다른 객체 부위에 대한 다양한 주의 맵을 생성한다.
  • multi-attention multi-class constraint (MAMC) 손실은 동일한 클래스이면서 동일한 주의 영역에 속한 특징을 임베딩 공간에서 가까이 모으고, 다른 클래스이거나 다른 영역에 속한 특징은 멀리 떼어내도록 한다.
  • MAMC는 클래스 간 및 주의 영역 간의 거리 최소화와 클래스 내 및 주의 영역 내의 거리 최대화를 목표로 하는 메트릭 학습 목적함수로 수식화된다.
  • 전체 네트워크는 기존의 방법에서 흔히 볼 수 있는 계단식 또는 다단계 학습 절차를 피하기 위해 단일 단계에서 엔드 투 엔드로 훈련된다.
  • 본 방법은 네 가지 벤치마크 데이터셋에서 평가되었으며, 특히 고도의 카테고리 커버리지, 대량의 데이터 및 높은 애너테이션 품질을 갖춘 새로 도입된 Dogs-in-the-Wild 데이터셋도 포함되어 있다.

실험 결과

연구 질문

  • RQ1부분 애너테이션이 없이도 단일의 엔드 투 엔드 학습 가능한 네트워크가 미세 분류 이미지에서 복수의 특징적인 부위를 효과적으로 국소화할 수 있는가?
  • RQ2공동 메트릭 학습 손실을 통해 복수의 주의 영역 간의 상관관계를 강제하면 분류 정확도가 향상되는가?
  • RQ3경량의 one-squeeze multi-excitation 모듈이 효율성과 성능 면에서 다단계 또는 다스케일 주의 메커니즘을 능가할 수 있는가?
  • RQ4제안된 방법은 특히 추가 애너테이션이 없는 경우 최신 기술 수준의 방법들과 비교하여 어떻게 성능을 내는가?
  • RQ5새로 도입된 Dogs-in-the-Wild 데이터셋이 미세 분류 인식에 더 도전적인 벤치마크를 제공하는 정도는 어느 정도인가?

주요 결과

  • CUB-200-2011 데이터셋에서 ResNet-101을 사용할 경우, 본 방법은 상위 1 정확도 87.1%를 기록하여 최고 성능을 낸 MACNN와 동일하며, 추가 애너테이션이 없는 경우 PN-CNN(86.3%)와 RAM(86.9%)를 모두 초월한다.
  • ResNet-50를 사용할 경우, 추가 애너테이션이 없는 두 번째로 좋은 방법(RAM)보다 0.2% 높고, 애너테이션이 있는 두 번째로 좋은 방법(PN-CNN)보다 0.8% 높다.
  • Stanford Dogs 데이터셋에서 본 방법은 91.7%의 정확도를 기록하여 RACNN(다중 학습 단계 사용)를 제외한 모든 약한 감독 기반 방법을 능가한다.
  • Stanford Cars 데이터셋에서 본 방법은 93.0%의 정확도를 기록하여 DVAN 및 RAN과 같은 다스케일 및 다단계 모델을 포함한 모든 비교 모델을 능가한다.
  • 새로 도입된 Dogs-in-the-Wild 데이터셋에서 본 방법은 가장 높은 정확도를 기록하여 더 도전적이고 다양한 실제 기반 벤치마크에서의 강건성을 입증한다.
  • 시각화 결과는 OSME 주의 영역이 인간이 구분하는 부위들인 머리, 꼬리, 몸통 형태와 잘 일치함을 확인하여 효과적이고 의미 있는 국소화를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.