Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-branch and Multi-scale Attention Learning for Fine-Grained Visual Categorization

Fan Zhang, Meng Li|arXiv (Cornell University)|2020. 03. 20.
Advanced Neural Network Applications참고 문헌 28인용 수 18
한 줄 요약

이 논문은 경계 상자 또는 부분 애너테이션 없이도 구분 가능한 객체 및 부분 영역을 학습할 수 있는 다중지점, 다중스케일 주의망인 MMAL-Net을 제안한다. 주의 객체 국지화 모듈(AOLM)과 주의 부분 제안 모듈(APPM)을 사용하여 다중스케일의 객체 및 부분 이미지를 생성하며, 공유 가중치를 가진 다중지점 네트워크를 통해 공동 학습함으로써 기존 방법보다 더 빠른 추론 속도를 갖는 상태의 기술(SOTA) 정확도를 달성한다.

ABSTRACT

ImageNet Large Scale Visual Recognition Challenge (ILSVRC) is one of the most authoritative academic competitions in the field of Computer Vision (CV) in recent years. But applying ILSVRC's annual champion directly to fine-grained visual categorization (FGVC) tasks does not achieve good performance. To FGVC tasks, the small inter-class variations and the large intra-class variations make it a challenging problem. Our attention object location module (AOLM) can predict the position of the object and attention part proposal module (APPM) can propose informative part regions without the need of bounding-box or part annotations. The obtained object images not only contain almost the entire structure of the object, but also contains more details, part images have many different scales and more fine-grained features, and the raw images contain the complete object. The three kinds of training images are supervised by our multi-branch network. Therefore, our multi-branch and multi-scale learning network(MMAL-Net) has good classification ability and robustness for images of different scales. Our approach can be trained end-to-end, while provides short inference time. Through the comprehensive experiments demonstrate that our approach can achieves state-of-the-art results on CUB-200-2011, FGVC-Aircraft and Stanford Cars datasets. Our code will be available at https://github.com/ZF1044404254/MMAL-Net

연구 동기 및 목표

  • 작은 클래스 간 차이와 큰 클래스 내 변동성이 분류를 어렵게 하는 미세 분류 시각 인식(FGVC) 문제를 해결하기 위해.
  • 구분 가능한 영역 국지화에 비용이 많이 드는 경계 상자 또는 부분 애너테이션에 의존하지 않도록 하기 위해.
  • 객체 및 부분 영역에서 다중스케일 특징을 효과적으로 캡처할 수 있는 엔드 투 엔드 학습 가능한 네트워크를 개발하여 정확도와 강건성을 향상시키기 위해.
  • 기존의 약한 지도 학습 방법보다 성능을 유지하거나 향상시키면서 모델 복잡도와 추론 시간을 줄이기 위해.

제안 방법

  • 해당 방법은 원본 이미지, 객체 이미지(AOLM에서 유도), 부분 이미지(APPM에서 유도)의 세 가지 지점에서 공유 가중치를 가진 다중지점 네트워크를 사용한다.
  • 주의 객체 국지화 모듈(AOLM)은 추가 학습이나 파라미터 없이 카테고리 레이블과 특징 맵만을 사용하여 객체 경계 상자를 예측한다.
  • 주의 부분 제안 모듈(APPM)은 액티브레이션 맵을 기반으로 다수의 구분 가능한 부분 영역을 식별하며, 부분 애너테이션이 필요하지 않다.
  • 원본 이미지에서 AOLM과 APPM을 각각 사용하여 객체 및 부분 이미지를 생성하고, 이를 다중스케일 특징 학습을 위한 네트워크에 입력한다.
  • 모든 지점은 교차 엔트로피 손실을 사용하며, 동일한 CNN 및 완전 연결 계층을 공유하므로 파라미터 효율성과 함께 엔드 투 엔드 학습이 가능하다.
  • 추론 시에는 오직 객체 지점만을 사용하므로 계산량과 추론 시간이 크게 감소한다.

실험 결과

연구 질문

  • RQ1경계 상자 또는 부분 애너테이션이 없이도 약한 지도 학습 방법이 미세 분류 시각 인식에서 최상의 성능을 달성할 수 있는가?
  • RQ2다중스케일 및 다중지점 학습은 미세 분류에서 특징 표현과 강건성을 어떻게 향상시킬 수 있는가?
  • RQ3주의 기반 국지화 및 부분 제안 모듈은 추가 보조 지도 없이 카테고리 레이블만으로 엔드 투 엔드 학습이 가능한가?
  • RQ4지점 간 파라미터 공유가 파라미터 수 증가 없이 모델 효율성과 성능을 향상시킬 수 있는가?
  • RQ5기존의 다중지점 또는 제안 기반 모델과 비교해 본다면, 제안된 방법은 추론 속도와 정확도에서 어떤가?

주요 결과

  • MMAL-Net은 CUB-200-2011, FGVC-Aircraft, Stanford Cars 데이터셋에서 기존 방법을 능가하는 최상의 성능(SOTA)을 달성한다.
  • 객체 국지화 모듈(AOLM)은 CUB-200-2011에서 85.1%의 PCP(정확히 국지화된 부분 비율)를 기록하여 SCDA(76.8%), ACOL(46.0%), ADL(62.3%)을 초월한다.
  • ResNet-50 기준보다 정확도가 4.1% 향상되었으며, 동일한 파라미터 수를 유지한다.
  • Tesla P100에서 이미지당 추론 시간은 1.80ms로, NTS-Net(5.61ms) 및 RA-CNN보다 훨씬 빠르며, 단일 지점 추론 덕분이다.
  • 시각화 결과는 AOLM과 APPM이 인간의 인식과 일치하는 가장 구분 가능한 영역(예: 새의 머리와 몸통)을 효과적으로 국지화하고 있음을 확인한다.
  • 절단 실험 결과, 원본, 객체, 부분 지점 모두가 최종 정확도에 기여하며, 특히 객체 및 부분 지점이 스케일 강건성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.