Skip to main content
QUICK REVIEW

[논문 리뷰] Cheaper Pre-training Lunch: An Efficient Paradigm for Object Detection

Dongzhan Zhou, Xinchi Zhou|arXiv (Cornell University)|2020. 04. 25.
Advanced Neural Network Applications참고 문헌 46인용 수 4
한 줄 요약

이 논문은 객체 검출을 위한 새로운이고 효율적인 사전 훈련 프레임워크인 Montage 사전 훈련을 제안한다. 이 방법은 외부 데이터(예: ImageNet)를 사용하지 않고도 목표 검출 데이터셋만을 활용하며, 계산 비용을 4배 감소시킨다. 정보가 풍부한 샘플을 몽타주 형식으로 조합하고, ERF 적응형 밀도 분류를 사용함으로써, ImageNet 사전 훈련 수준 또는 그 이상의 검출 성능를 달성한다. 정확도를 희생시키지 않은 채 훈련 효율성이 크게 향상된다.

ABSTRACT

In this paper, we propose a general and efficient pre-training paradigm, Montage pre-training, for object detection. Montage pre-training needs only the target detection dataset while taking only 1/4 computational resources compared to the widely adopted ImageNet pre-training.To build such an efficient paradigm, we reduce the potential redundancy by carefully extracting useful samples from the original images, assembling samples in a Montage manner as input, and using an ERF-adaptive dense classification strategy for model pre-training. These designs include not only a new input pattern to improve the spatial utilization but also a novel learning objective to expand the effective receptive field of the pretrained model. The efficiency and effectiveness of Montage pre-training are validated by extensive experiments on the MS-COCO dataset, where the results indicate that the models using Montage pre-training are able to achieve on-par or even better detection performances compared with the ImageNet pre-training.

연구 동기 및 목표

  • 객체 검출기의 사전 훈련에 있어 ImageNet과 같은 대규모 외부 분류 데이터셋에 대한 의존도를 제거하기 위해.
  • 사전 훈련 중 계산 비용을 줄이면서도 검출 성능를 유지하거나 향상시키기 위해.
  • 배경 등 반복적인 요소를 줄이고 정보가 풍부한 샘플에 집중함으로써 훈련의 부정확성을 개선하고, 공간적 및 특징 활용도를 향상시키기 위해.
  • 다양한 검출 프레임워크와 백본에 적용 가능한 일반적이고 효율적이며 데이터에 종속되지 않는 사전 훈련 프레임워크를 개발하기 위해.

제안 방법

  • 배경의 반복성을 줄이기 위해 검출 데이터셋 이미지에서 양성 및 음성 샘플을 추출한다.
  • 비율을 고려한 배치 전략을 사용해 공간 활용도를 극대화하는 방식으로 샘플을 몽타주 이미지로 조합한다.
  • 입력 크기를 표준화하기 위해 크기 조정 및 자르기 전략을 적용하고, 데이터 증강(랜덤 플립, 스케일 저자극)을 함께 사용한다.
  • 효율적 수용장역(ERF) 기반의 소프트 레이블 할당을 통해 특징 학습을 향상시키는 ERF 적응형 밀도 분류를 적용한다.
  • 전역 및 블록 단위 분류 전략을 사용하며, ERF 적응형 방법이 둘 다를 뛰어넘는 성능를 보인다.
  • ERF 가중치 기반의 레이블 할당을 사용해 몽타주 이미지에서 백본을 표준 교차 엔트로피 손실로 훈련시킨다.

실험 결과

연구 질문

  • RQ1ImageNet과 같은 외부 데이터셋에 의존하지 않고도 객체 검출을 위한 사전 훈련을 효율적으로 수행할 수 있는가?
  • RQ2기존 사전 훈련에서 발생하는 배경 픽셀의 반복성을 줄이면 계산 효율성이 어떻게 향상될 수 있는가?
  • RQ3검출 데이터만 기반으로 한 사전 훈련 전략이 ImageNet 사전 훈련 수준의 성능를 달성할 수 있는가?
  • RQ4공간적 레이아웃과 레이블 할당 전략이 사전 훈련 효과성에 어떤 영향을 미치는가?
  • RQ5전역 또는 블록 단위 분류보다 ERF 적응형 밀도 분류가 특징 표현을 향상시키는가?

주요 결과

  • ResNet-50를 사용해 COCO val2017에서 Montage 사전 훈련이 36.3 AP를 달성했으며, 동일한 훈련 조건에서 ImageNet 사전 훈련(34.3 AP)을 뛰어넘었다.
  • ERF 적응형 밀도 분류 전략이 38.9 AP75를 기록해 블록 단위(37.6) 및 전역(36.3) 분류를 크게 앞서갔다.
  • ImageNet-1k 사전 훈련 대비 사전 훈련 계산량을 4배 감소시켰으며, 오직 검출 데이터셋만을 사용했다.
  • 스케일 조정을 위한 패드-애드-크롭 방법이 가장 높은 성능(35.2 AP)을 기록했으며, 워프(34.6) 및 리사이즈(34.7)를 뛰어넘었다.
  • 이 방법은 일반화 가능성이 높아 다양한 검출 프레임워크와 백본에서 일관된 성능 향상을 보였다.
  • 외부 데이터 없이도 훈련 비용을 늘리지 않고도 빠른 수렴과 경쟁 가능한 정확도를 달성할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.