Skip to main content
QUICK REVIEW

[논문 리뷰] DOTA: A Large-scale Dataset for Object Detection in Aerial Images

Gui-Song Xia|arXiv (Cornell University)|2017. 11. 28.
Advanced Neural Network Applications참고 문헌 40인용 수 137
한 줄 요약

DOTA를 도입합니다. 15개의 방향성 범주, 188,282개의 인스턴스, 2806개의 고해상도 이미지가 포함된 큰 규모의 공중 이미지 객체 탐지 데이터셋이며, 수평 및 방향성 경계 상자 탐지의 베이스라인을 제공합니다.

ABSTRACT

Example datasets of the Interactive Feature Localization in Deep neural networks (IFeaLiD) tool. <strong>Cityscapes</strong> These datasets are based on the image <code>bielefeld_000000_007186_leftImg8bit.png</code> of the Cityscapes dataset. The datasets can be explored online in IFeaLiD: conv2_x (<code>bielefeld_000000_007186_leftImg8bit.png.C1.npz.8.zip</code>) conv3_x (<code>bielefeld_000000_007186_leftImg8bit.png.C2.npz.8.zip</code>) conv4_x (<code>bielefeld_000000_007186_leftImg8bit.png.C3.npz.8.zip</code>) <strong>COCO</strong> These datasets are based on the image <code>000000015746.jpg</code> of the COCO dataset. The datasets can be explored online in IFeaLiD: conv2_x (<code>000000015746.jpg.C1.npz.8.zip</code>) conv3_x (<code>000000015746.jpg.C2.npz.8.zip</code>) conv4_x (<code>000000015746.jpg.C3.npz.8.zip</code>) <strong>DIV2K</strong> These datasets are based on the image <code>0804.png</code> of the DIV2K dataset. The datasets can be explored online in IFeaLiD: conv2_x (<code>0804.png.C1.npz.8.zip</code>) conv3_x (<code>0804.png.C2.npz.8.zip</code>) conv4_x (<code>0804.png.C3.npz.8.zip</code>) <strong>DOTA</strong> These datasets are based on the image <code>P0034.png</code> of the DOTA dataset. The datasets can be explored online in IFeaLiD: conv2_x (<code>P0034.png.C1.npz.8.zip</code>) conv3_x (<code>P0034.png.C2.npz.8.zip</code>) conv4_x (<code>P0034.png.C3.npz.8.zip</code>)

연구 동기 및 목표

  • 항공 영상에서 실세계 지구 시각의 도전 과제를 반영하는 크고 다양한 고해상도 데이터셋을 제공하여 강건한 객체 탐 Detection를 유도하고 가능하게 한다.
  • 항공 장면에서 객체를 더 잘 포획하고 객체 간 중첩을 줄이기 위해 방향성 경계 상자 주석을 정의한다.
  • 수평 경계 상자(HBB)와 방향성 경계 상자(OBB)에 대해 최신 탐지기를 사용한 베이스라인을 확립한다.
  • 밀집한 장면, 극단적인 종횡비, 큰 클래스 내 다양성 차이가 향후 알고리즘 개발에 어떤 영향을 주는지 강조한다.

제안 방법

  • 다양한 센서/플랫폼으로부터 해상도 최대 4000x4000의 2806장의 공중 이미지를 수집한다.
  • 15개 범주에 걸쳐 임의로 방향이 있는 사각형 경계 상자 형태로 188,282개의 객체 인스턴스를 주석으로 달아준다.
  • 객체 크기를 맥락화하기 위해 각 이미지에 대한 공간 해상도 메타데이터를 제공한다.
  • CNN 처리용 패치를 사용한 대형 이미지 크기로 인해 비표준 처리와 병합 결과를 위한 비최대 억제(NMS) 기반의 베이스라인으로 OBB와 HBB를 평가한다.
  • 자르기 전략: CNN 처리를 위해 stride 512의 1024x1024 패치를 생성하고 결과를 비점진적 억제로 병합한다.

실험 결과

연구 질문

  • RQ1현존하는 객체 탐지기가 매우 다양한 객체 규모와 방향으로 보이는 항공 이미지를 얼마나 잘 일반화하는가?
  • RQ2항공 데이터에서 수평 경계 상자(HBB)로 학습된 탐지기와 방향성 경계 상자(OBB)로 학습된 탐지기 간의 성능 격차는 어느 정도인가?
  • RQ3방향성 경계 상자가 밀집된 항공 장면에서 축에 정렬된 상자에 비해 실질적인 이점을 제공하는가?
  • RQ4DOTA가 소형/대형 객체의 균형, 붐빔, 극단적 종횡비 측면에서 탐지기에 어떤 도전을 주는가?

주요 결과

  • DOTA는 188,282개의 인스턴스가 15개 범주에 걸쳐 2806장의 고해상도 이미지에 분포되어 있어 현재까지 가장 큰 주석이 달린 항공 객체 데이터셋이다.
  • OBB에 대해 학습/적용된 탐지기가 혼잡하고 길쭉한 객체에서 축에 정렬된 경계 상자(HBB)보다 현저한 향상을 보인다.
  • 소형 및 밀집 객체의 항공 장면에서 베이스라인 결과가 상당한 난이도를 드러내며(예: 소형/대형 차량, 선박), 범주 간 성능이 엇갈린다.
  • 크로스-데이터셋 실험에서 UCAS-AOD와 DOTA 간에 상당한 일반화 격차가 나타나며, DOTA가 더 큰 다양성과 도전성을 보여준다.
  • 방향성 사다리꼴 주석을 가진 데이터셋 특유의 주석은 수평 상자에 비해 더 촘촘한 포획 및 근접 인스턴스의 분리를 강화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.