Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Regionlets: Blended Representation and Deep Learning for Generic Object Detection

Hongyu Xu, Xutao Lv|arXiv (Cornell University)|2018. 11. 28.
Advanced Neural Network Applications참고 문헌 76인용 수 5
한 줄 요약

이 논문은 깊이 학습 아키텍처 내에서 영역 선택 네트워크와 게이팅 네트워크를 통해 비직사각형 영역 선택과 학습 가능한 특징 풀링을 통합하는 새로운 객체 검출 프레임워크인 Deep Regionlets를 제안한다. 이 방법은 분할 주석이 필요 없이 PASCAL VOC 및 COCO 벤치마크에서 최신 기술 수준의 성능을 달성하며, 엔드 투 엔드 훈련을 통해 외관 변화와 변형에 대한 강건성을 향상시킨다.

ABSTRACT

In this paper, we propose a novel object detection algorithm named "Deep Regionlets" by integrating deep neural networks and a conventional detection schema for accurate generic object detection. Motivated by the effectiveness of regionlets for modeling object deformations and multiple aspect ratios, we incorporate regionlets into an end-to-end trainable deep learning framework. The deep regionlets framework consists of a region selection network and a deep regionlet learning module. Specifically, given a detection bounding box proposal, the region selection network provides guidance on where to select sub-regions from which features can be learned from. An object proposal typically contains 3-16 sub-regions. The regionlet learning module focuses on local feature selection and transformations to alleviate the effects of appearance variations. To this end, we first realize non-rectangular region selection within the detection framework to accommodate variations in object appearance. Moreover, we design a "gating network" within the regionlet leaning module to enable instance dependent soft feature selection and pooling. The Deep Regionlets framework is trained end-to-end without additional efforts. We present ablation studies and extensive experiments on the PASCAL VOC dataset and the Microsoft COCO dataset. The proposed method yields competitive performance over state-of-the-art algorithms, such as RetinaNet and Mask R-CNN, even without additional segmentation labels.

연구 동기 및 목표

  • 일반 객체 검출에서 객체 변형과 외관 변화를 모델링하는 데 도전하는 것.
  • 기존의 영역레트 기반 검출과 딥 러닝 간 격차를 해소하기 위해 엔드 투 엔드 훈련을 가능하게 하는 것.
  • 다양한 종횡비와 하위 카테고리 변화가 있는 객체의 특징 표현을 향상시키는 것.
  • 수작업 특징에 대한 의존도를 줄이기 위해 공간적 및 특징 변환을 엔드 투 엔드로 학습하는 것.
  • 추가적인 분할 레이블 없이도 경쟁적인 검출 정확도를 달성하는 것.

제안 방법

  • 프레임워크는 객체 제안 경계상자 내에서 비직사각형 영역 선택을 수행하는 영역 선택 네트워크(RSN)로 구성된다.
  • 딥 리전렛 러닝 모듈은 선택된 부분 영역의 특징을 정렬하기 위해 공간 변환 네트워크를 사용한다.
  • 게이팅 네트워크는 영역레트 간 인스턴스 기반 소프트 특징 선택 및 풀링을 가능하게 한다.
  • 전체 시스템은 영역 선택 및 특징 학습 구성 요소를 통해 역전파되는 기울기를 포함하여 엔드 투 엔드로 훈련된다.
  • 변형 가능한 부분을 모델링하기 위해 객체 제안에 대해 3~16개의 부분 영역을 사용하는 계층적 특징 표현을 활용한다.
  • 공간 변환은 미분 가능하여 투사 변환 매개변수를 통해 역전파가 가능하다.

실험 결과

연구 질문

  • RQ1비직사각형 영역 선택이 외관 변화와 변형에 대한 특징 표현 향상에 기여하는가?
  • RQ2학습 가능한 게이팅 메커니즘이 딥 검출 네트워크에서 고정 풀링 전략을 능가하는가?
  • RQ3분할 주석 없이도 영역레트를 딥 러닝 프레임워크에 통합하면 표준 R-CNN 또는 RetinaNet 기준선보다 성능이 향상되는가?
  • RQ4영역레트 기반 접근 방식은 다양한 객체 카테고리와 종횡비에서 일반 검출 작업에 일반화되는가?
  • RQ5영역 선택과 특징 학습의 엔드 투 엔드 훈련이 검출 정확도와 강건성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 Deep Regionlets 프레임워크는 분할 레이블 없이도 RetinaNet 및 Mask R-CNN와 같은 최신 기술 수준의 방법을 능가하는 PASCAL VOC 데이터셋에서 경쟁적인 성능을 달성한다.
  • Microsoft COCO 데이터셋에서 이 방법은 복잡한 실세계 조건 하에서도 강력한 검출 정확도를 보이며, 일반 객체 검출에서의 효과성을 확인한다.
  • 제거 분석 결과, 비직사각형 영역 선택과 게이팅 네트워크 모두 성능 향상에 기여한다는 것이 확인된다.
  • Faster R-CNN 대비 약 6360만 개의 파라미터가 증가하지만, 성능 향상 고려 시 이는 미미한 증가로 간주된다.
  • 엔드 투 엔드 훈련 체계는 영역 선택과 특징 학습의 공동 최적화를 가능하게 하여 특징의 구분 능력과 정밀도를 향상시킨다.
  • 객체의 변형과 다수의 종횡비를 고려하여 객체 제안 내에서의 융통성 있는 부분 영역 표현을 학습함으로써 효과적으로 모델링한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.