Skip to main content
QUICK REVIEW

[논문 리뷰] Data Augmentation for Object Detection via Differentiable Neural Rendering

Guanghan Ning, Guang Chen|arXiv (Cornell University)|2021. 03. 04.
Advanced Neural Network Applications참고 문헌 56인용 수 8
한 줄 요약

이 논문은 객체 검출을 위한 새로운 오프라인 데이터 증강 방법인 Differentiable Neural Rendering 기반 데이터 증강(DANR)을 제안한다. 이 방법은 3D 인식 특징 투영과 깊이 추정을 이용해 현실적인 새로운 시점 이미지를 생성하고, 자동으로 해당하는 바운딩 박스 애너테이션을 생성한다. 이는 데이터 부족 조건에서 검출 성능을 크게 향상시키며, 특히 장꼬리 분포 및 저자원 데이터셋에서 효과적이다. 또한 기존의 온라인 증강 기법들과 완전히 호환된다.

ABSTRACT

It is challenging to train a robust object detector under the supervised learning setting when the annotated data are scarce. Thus, previous approaches tackling this problem are in two categories: semi-supervised learning models that interpolate labeled data from unlabeled data, and self-supervised learning approaches that exploit signals within unlabeled data via pretext tasks. To seamlessly integrate and enhance existing supervised object detection methods, in this work, we focus on addressing the data scarcity problem from a fundamental viewpoint without changing the supervised learning paradigm. We propose a new offline data augmentation method for object detection, which semantically interpolates the training data with novel views. Specifically, our new system generates controllable views of training images based on differentiable neural rendering, together with corresponding bounding box annotations which involve no human intervention. Firstly, we extract and project pixel-aligned image features into point clouds while estimating depth maps. We then re-project them with a target camera pose and render a novel-view 2d image. Objects in the form of keypoints are marked in point clouds to recover annotations in new views. Our new method is fully compatible with online data augmentation methods, such as affine transform, image mixup, etc. Extensive experiments show that our method, as a cost-free tool to enrich images and labels, can significantly boost the performance of object detection systems with scarce training data. Code is available at \url{https://github.com/Guanghan/DANR}.

연구 동기 및 목표

  • 감독 학습에서 기존 파라다임을 변경하지 않고 데이터 부족 조건에서도 강건한 객체 검출기를 훈련시키는 데 도전한다.
  • 완전 자동으로 바운딩 박스 애너테이션을 생성하는 동시에 의미적으로 유의미하고 현실적인 새로운 시점의 훈련 이미지를 생성한다.
  • 기존의 온라인 증강 기법을 초월하여 다양성과 현실성을 향상시키는 제어 가능한 3D 인식 데이터 증강 방법을 제공한다.
  • 기존의 온라인 데이터 증강 기법들(예: mixup, 애핀 변환 등)과의 호환성을 확보한다.
  • 소수 클래스 샘플이 희소한 장꼬리 분포 데이터셋에서의 성능 향상을 도모한다.

제안 방법

  • 먼저 입력 RGB 이미지에서 깊이 맵을 추정하고, 픽셀 수준의 특징을 추출한다.
  • 이 특징들은 객체 인스턴스가 키포인트로 표시된 3D 잠재 공간으로 투영되는 포인트 클라우드로 변환된다.
  • 다양한 신호 기반 신경 렌더링 파이프라인을 사용하여, 포인트 클라우드를 새로운 카메라 자세에서 재투영하여 2D 새로운 시점 이미지를 생성한다.
  • 3D 포인트 클라우드 내 키포인트를 활용해 인간 간섭 없이도 정확한 바운딩 박스 애너테이션을 새로운 시점에 복원한다.
  • 이 방법은 완전히 미분 가능하며, 이미지 및 애너테이션 생성의 엔드 투 엔드 최적화를 가능하게 한다.
  • 임의의 카메라 자세 제어를 지원하여 다양하고 의미적으로 일관된 데이터 증강을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다양한 신호 기반 신경 렌더링는 데이터 부족 조건에서 객체 검출기 일반화 성능 향상에 기여하는 현실적이고 다양한 새로운 시점 이미지를 생성할 수 있는가?
  • RQ2이러한 새로운 시점에 대해 인간 레이블링 없이도 자동으로 정확한 바운딩 박스 애너테이션을 생성할 수 있는가?
  • RQ3낮은 데이터 환경에서 DANR로 훈련된 객체 검출기의 성능는 기존의 표준 온라인 증강 기법으로 훈련된 검출기와 비교해 어떻게 되는가?
  • RQ4이 방법은 한 단계 검출기와 두 단계 검출기의 다양한 검출기 아키텍처(ResNet 대비 ResNeSt)와도 효과적으로 작동하는가?
  • RQ5해상도와 깊이 추정 정확도는 증강된 데이터의 품질과 최종 검출 성능에 어떤 영향을 미치는가?

주요 결과

  • ICR-Weapon, ICR-Flag, ICR-Logo 데이터셋에서, 데이터 부족 조건 하에서 AUC가 각각 0.68에서 0.75, 0.72에서 0.97, 0.73에서 0.96으로 향상되었다.
  • 실내 환경 데이터셋에서는 ResNeSt-50 백본을 사용할 때 AP가 69.4에서 79.6으로 상승하여, 훈련 데이터가 풍부하지 않은 경우에도 일관된 성능 향상을 보였다.
  • 한 단계 검출기로 실내 데이터셋을 사용했을 때, AP는 10.2점(69.4에서 79.6) 상승했고, AP50는 2.3점(95.4에서 97.7) 상승했다.
  • 작은 객체에 대한 성능 향상이 더욱 두드러졌으며, 실내 데이터셋에서 AP_S는 56.5에서 61.4로 상승했다.
  • COCO 데이터셋에서는 높은 데이터 양과 해상도 제약으로 인해 성능 향상이 미미했지만, 소형 객체 검출의 재현율은 향상되었다.
  • 이 방법은 온라인 증강과 완전히 호환되었으며, 모든 평가 환경에서 병합 사용 시 추가적인 성능 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.