Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to detect and localize many objects from few examples

Bastien Moysset, Christopher Kermorvant|arXiv (Cornell University)|2016. 11. 17.
Advanced Image and Video Retrieval Techniques참고 문헌 27인용 수 6
한 줄 요약

이 논문은 국소적이고 공유되는 예측을 통해 낮은 파라미터 수를 유지하면서도 공간적 2D-LSTM 층을 사용하여 전역적 맥락을 포착하는 완전 컨volution 신경망 객체 검출 모델을 제안한다. 이는 입력 크기 조정 없이도 성능을 유지하면서, 문서 이미지의 텍스트 검출과 같은 소수의 예시, 고객체 밀도 작업에서 YOLO 및 Multibox와 같은 최신 기법들을 능가한다. 특히, 입력 크기 조정 없이도 높은 재현율과 F-측정치를 달성한다.

ABSTRACT

The current trend in object detection and localization is to learn predictions with high capacity deep neural networks trained on a very large amount of annotated data and using a high amount of processing power. In this work, we propose a new neural model which directly predicts bounding box coordinates. The particularity of our contribution lies in the local computations of predictions with a new form of local parameter sharing which keeps the overall amount of trainable parameters low. Key components of the model are spatial 2D-LSTM recurrent layers which convey contextual information between the regions of the image. We show that this model is more powerful than the state of the art in applications where training data is not as abundant as in the classical configuration of natural images and Imagenet/Pascal VOC tasks. We particularly target the detection of text in document images, but our method is not limited to this setting. The proposed model also facilitates the detection of many objects in a single image and can deal with inputs of variable sizes without resizing.

연구 동기 및 목표

  • 소수의 레이블링된 예시만 제공된 상황에서 이미지 내에 많은 소형 객체를 검출하고 정렬하는 데 도전한다.
  • 제한된 학습 데이터에서 고객체 밀도 상황에서 YOLO 및 Multibox와 같은 기존의 단단한 검출기의 한계를 극복한다.
  • 입력 크기 조정 없이도 변수 크기의 입력에 대해 엔드 투 엔드 학습을 가능하게 하여 실제 문서 이미지 분석에 대한 유연성을 향상시킨다.
  • 모델 용량을 증가시키지 않고도 2D-LSTM 층을 통한 공간적 맥락을 활용하여 저자료 환경에서 검출 재현율을 향상시킨다.
  • 높은 공간적 파라미터 공유를 유지하면서도 바운딩 박스 좌표를 직접적으로 회귀할 수 있는 파라미터 효율적인 아키텍처를 개발한다.

제안 방법

  • 특징 맵 전역에서 공간적으로 공유되고 국소적인 예측을 가능하게 하기 위해 출력 헤드로 1×1 컨볼루션 레이어를 사용한다.
  • 컨볼루션 블록 간에 2D-LSTM 레이어를 도입하여 전역적 맥락을 집계하고 공간 영역 간의 특징 표현을 향상시킨다.
  • 영역 제안 생성을 회피하고 직접적인 바운딩 박스 좌표 회귀를 적용하여 모델 복잡성을 감소시킨다.
  • 각 최적화 단계 이전에 전역 매칭 전략을 적용하여, 동일한 공간 셀에 여러 객체가 포함된 경우에도 예측을 정답 박스에 할당한다.
  • 입력 크기 조정 없이도 공간 해상도와 객체 세부 정보를 유지하면서도 변수 크기의 입력을 지원하기 위해 완전 컨볼루션 설계를 채택한다.
  • 당시 주요 딥러닝 라이브러리에서 2D-LSTM를 네이티브로 지원하지 않아, 커스텀 C++ 프레임워크를 사용해 모델을 구현한다.

실험 결과

연구 질문

  • RQ1공간적으로 공유되는 출력 헤드를 갖는 완전 컨볼루션 객체 검출기로 저자료 환경에서 높은 성능을 달성할 수 있는가?
  • RQ22D-LSTM 레이어를 통한 전역적 맥락 통합이 표준 컨볼루션 또는 완전 연결 헤드에 비해 소형 또는 겹치는 객체 검출에 어떻게 기여하는가?
  • RQ3제한된 학습 데이터로 많은 소형 객체를 검출할 때, 모델이 YOLO 및 Multibox를 얼마나 뛰어나게 능가하는가?
  • RQ4입력 크기 조정 없이도 변수 크기의 입력을 처리할 수 있으며, 이로 인해 검출 정확도가 유지되는가?
  • RQ5영역 제안 생성 없이 직접 회귀를 적용하는 것이 고객체 밀도 상황에서 더 높은 재현율을 이끌어내는가?

주요 결과

  • 제안된 모델은 Maurdor 데이터셋에서 YOLO 및 Multibox를 크게 능가하여, 텍스트 검출 작업에서 더 높은 평균 정밀도 및 F-측정치를 달성한다.
  • 2D-LSTM 레이어의 추가로 모든 지표에서 검출 성능이 향상되었으며, 특히 소형 및 겹치는 텍스트 영역에서 재현율 향상이 가장 두드러졌다.
  • 프랑스어 및 영어 문서 이미지에서 모두 70% 이상의 F-Measure Bag of Words 점수를 확보하여, 전체 페이지 텍스트 인식 작업에서 모든 기준 모델을 능가했다.
  • YOLO는 한 셀당 하나의 타겟만 허용하는 제약로 인해 문서 텍스트 검출 작업에서 의미 있는 수렴을 이루지 못했다. 이는 고객체 밀도 시나리오에 부적합하다.
  • Multibox는 초모수 튜닝에도 불구하고 성능이 열등했으며, 주로 출력 위치 간의 파라미터 공유가 부족하여 효율적인 학습이 어려웠기 때문이다.
  • 개별 예측기의 수용장치보다 큰 객체를 성공적으로 검출함으로써, 2D-LSTM를 통한 맥락 집계의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.