Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Regionlets for Object Detection

Hongyu Xu, Xutao Lv|arXiv (Cornell University)|2017. 12. 06.
Advanced Neural Network Applications참고 문헌 49인용 수 7
한 줄 요약

이 논문은 비직사각형 영역 선택과 학습 가능한 리지온렛을 종합한 엔드 투 엔드 딥 러닝 파이프라인으로서의 새로운 객체 검출 프레임워크인 Deep Regionlets를 제안한다. 영역 선택 네트워크와 게이팅 기반 딥 리지온렛 학습 모듈을 사용함으로써, 비정형 객체에 대한 특징 표현을 향상시켜 세그멘테이션 레이블 없이도 PASCAL VOC 및 MS COCO에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we propose a novel object detection framework named "Deep Regionlets" by establishing a bridge between deep neural networks and conventional detection schema for accurate generic object detection. Motivated by the abilities of regionlets for modeling object deformation and multiple aspect ratios, we incorporate regionlets into an end-to-end trainable deep learning framework. The deep regionlets framework consists of a region selection network and a deep regionlet learning module. Specifically, given a detection bounding box proposal, the region selection network provides guidance on where to select regions to learn the features from. The regionlet learning module focuses on local feature selection and transformation to alleviate local variations. To this end, we first realize non-rectangular region selection within the detection framework to accommodate variations in object appearance. Moreover, we design a "gating network" within the regionlet leaning module to enable soft regionlet selection and pooling. The Deep Regionlets framework is trained end-to-end without additional efforts. We perform ablation studies and conduct extensive experiments on the PASCAL VOC and Microsoft COCO datasets. The proposed framework outperforms state-of-the-art algorithms, such as RetinaNet and Mask R-CNN, even without additional segmentation labels.

연구 동기 및 목표

  • 딥 뉴럴 네트워크와 기존의 리지온렛 기반 검출 간의 격차를 메우어 일반적인 객체 검출 성능을 향상시키기 위해.
  • 이전 방법에서의 고정된 직사각형 영역과 강성 있는 리지온렛 구조의 한계를 해결하기 위해.
  • 학습 가능한 비직사각형 영역 선택과 적응형 리지온렛 풀링을 통한 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 공간 변환과 소프트 게이팅을 통해 물체의 변형, 크기, 종횡비 변화에 대한 강건성을 향상시키기 위해.
  • 개체 세그멘테이션 애너테이션을 요구하지 않고도 최신 기술 수준의 검출 정확도를 달성하기 위해.

제안 방법

  • 영역 선택 네트워크(RSN)가 영역 제안 네트워크(RPN) 출력 내에서 비직사각형 영역 선택을 수행하여 물체의 형태 변화를 더 잘 포착한다.
  • 딥 리지온렛 학습 모듈이 선택된 영역에서 특징을 추출하기 위해 공간 변환을 적용하고, 게이팅 네트워크를 통해 소프트 리지온렛 풀링을 수행한다.
  • 게이팅 네트워크는 미분 가능하고 주의 기반 선택을 가능하게 하여 모델이 가장 구분력 있는 부분에 집중할 수 있도록 한다.
  • 모든 프레임워크는 입력 이미지와 진짜 바운딩 박스만을 사용하여 추가적인 지도 없이 엔드 투 엔드로 훈련 가능하다.
  • 이 방법은 탄성 RoI 풀링을 일반화하고 개선된 특징 학습을 위한 탄력적인 리지온렛 구성 설정을 지원한다.
  • 공정한 비교를 위해 최신 기술 수준의 검출기들과의 비교를 위해 ResNet-101을 백본 네트워크로 사용한다.

실험 결과

연구 질문

  • RQ1비직사각형 영역 선택이 딥 객체 검출기에서 비정형 물체의 특징 표현을 향상시킬 수 있는가?
  • RQ2소프트 풀링을 갖춘 학습 가능한 리지온렛이 정적 또는 하드 리지온렛 선택보다 검출 정확도에서 뛰어나게 성능을 높일 수 있는가?
  • RQ3엔드 투 엔드 딥 러닝 프레임워크에 리지온렛 기반 모델링을 통합하면 기존의 표준 검출기보다 성능이 뛰어나게 되는가?
  • RQ4제안된 방법이 개체 세그멘테이션 레이블을 사용하지 않고도 최신 기술 수준의 결과를 달성할 수 있는가?
  • RQ5딥 리지온렛 프레임워크는 D-F-RCNN와 같은 탄성 컨볼루션 기반 방법과 비교해 어떻게 성능을 냈는가?

주요 결과

  • PASCAL VOC 2012 테스트에서 제안된 방법은 DP-FCN를 포함한 모든 경쟁 방법을 능가하며, mAP 85.7%를 기록했다.
  • MS COCO 2017 테스트-디브에서 방법은 43.4% mAP를 달성하여 Faster R-CNN(+8.5%), R-FCN(+8.5%), D-F-RCNN/D-R-FCN(+4.0%)를 모두 능가했다.
  • 세그멘테이션 레이블이나 다중 해상도 훈련 없이도 Mask R-CNN보다 1.1% mAP 높은 성능을 기록했다.
  • Focal loss와 다중 해상도 훈련을 사용하는 RetinaNet조차도 이론적으로는 경쟁 가능한 성능을 기록했다.
  • 제거 분석 결과, 비직사각형 영역 선택과 게이팅 네트워크가 검출 정확도 향상에 크게 기여하는 것으로 확인되었다.
  • 프레임워크는 완전히 엔드 투 엔드로 훈련 가능하며, 탄성 RoI 풀링을 일반화하여 객체 검출의 특징 학습에 더 넓은 적용 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.