Skip to main content
QUICK REVIEW

[논문 리뷰] Pixel and Feature Level Based Domain Adaption for Object Detection in Autonomous Driving

Yuhu Shan, Wen Feng Lu|arXiv (Cornell University)|2018. 09. 30.
Domain Adaptation and Few-Shot Learning참고 문헌 49인용 수 5
한 줄 요약

이 논문은 자율주행 차량의 객체 검출을 위한 새로운 비지도 도메인 적응 프레임워크를 제안하며, 픽셀 수준의 이미지 변환과 특징 수준의 적대적 적응을 동시에 수행한다. CycleGAN을 활용해 도메인 불변 이미지 변환을 하고, 영역 제안 기반 특징 적대적 훈련을 통해 합성 주행 이미지와 실제 주행 이미지 간의 도메인 차이를 크게 줄이며, 엔드 투 엔드 훈련을 통해 최대 2%의 정확도 향상을 달성하여 최신 기술 수준의 검출 성능을 확보한다.

ABSTRACT

Annotating large scale datasets to train modern convolutional neural networks is prohibitively expensive and time-consuming for many real tasks. One alternative is to train the model on labeled synthetic datasets and apply it in the real scenes. However, this straightforward method often fails to generalize well mainly due to the domain bias between the synthetic and real datasets. Many unsupervised domain adaptation (UDA) methods are introduced to address this problem but most of them only focus on the simple classification task. In this paper, we present a novel UDA model to solve the more complex object detection problem in the context of autonomous driving. Our model integrates both pixel level and feature level based transformtions to fulfill the cross domain detection task and can be further trained end-to-end to pursue better performance. We employ objectives of the generative adversarial network and the cycle consistency loss for image translation in the pixel space. To address the potential semantic inconsistency problem, we propose region proposal based feature adversarial training to preserve the semantics of our target objects as well as further minimize the domain shifts. Extensive experiments are conducted on several different datasets, and the results demonstrate the robustness and superiority of our method.

연구 동기 및 목표

  • 합성 주행 데이터셋과 실제 주행 데이터셋 간의 도메인 차이 문제를 해결하기 위해.
  • 실제 자율주행 환경에 배포될 때 합성 데이터로 훈련된 모델의 일반화 성능을 향상시키기 위해.
  • 픽셀 수준과 특징 수준에서 동시에 작동하는 통합된 비지도 도메인 적응 프레임워크를 개발하기 위해.
  • 도메인 적응 과정에서 대상 객체(예: 차량, 보행자)의 의미적 정합성을 유지하기 위해.
  • 이미지 변환과 검출 성능을 동시에 최적화하는 엔드 투 엔드 훈련을 가능하게 하기 위해.

제안 방법

  • 합성 이미지(예: Sim10k)를 실제 데이터셋(예: Cityscapes, KITTI)의 시각적 스타일로 변환하기 위해 사이클 일致성 손실를 사용하는 CycleGAN을 사용한다.
  • 생성적 적대적 네트워크를 통해 소스 도메인과 타겟 도메인 간의 이미지 분포를 정렬하기 위해 픽셀 수준의 도메인 적응(PDA) 모듈을 적용한다.
  • 객체 의미를 유지하면서 특징 공간에서의 도메인 차이를 최소화하기 위해 영역 제안 기반 특징 적대적 훈련(FDA)을 도입한다.
  • PDA와 FDA 모듈을 엔드 투 엔드 훈련 파이프라인에 통합하여 이미지 변환과 검출 성능을 동시에 최적화한다.
  • 변환된 소스 이미지로 훈련된 Faster R-CNN 검출기를 사용하여 실제 타겟 도메인에서의 검출 일반화 성능을 향상시킨다.
  • 두 단계 훈련 과정을 사용한다: 먼저 PDA와 FDA 모듈을 별도로 사전 훈련한 후, 전체 네트워크를 10 에포크 동안 엔드 투 엔드로 미세 조정한다.

실험 결과

연구 질문

  • RQ1합성에서 실제 주행 데이터셋으로의 전이 시 픽셀 수준과 특징 수준의 도메인 적응을 동시에 수행하면 객체 검출 성능이 향상되는가?
  • RQ2사이클 일치성을 갖춘 CycleGAN을 통한 이미지 변환이 객체 검출에서 도메인 차이를 줄이는 데 얼마나 효과적인가?
  • RQ3영역 제안 기반 특징 적대적 훈련이 도메인 적응 과정에서 차량, 보행자와 같은 핵심 객체의 의미적 정합성을 유지하는가?
  • RQ4독립된 모듈 훈련에 비해 엔드 투 엔드 미세 조정이 검출 정확도 향상에 얼마나 기여하는가?
  • RQ5기상 조건 변화( dense 안개, 비) 및 경관 레이아웃 변화(고속도로 대비 도심)와 같은 다양한 도메인 차이에 대해 이 방법은 얼마나 강건한가?

주요 결과

  • 제안된 방법은 Sim10k → Cityscapes, Cityscapes → KITTI, Cityscapes → Foggy-Cityscapes를 포함한 여러 교차 도메인 객체 검출 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 엔드 투 엔드 훈련은 비엔드 투 엔드 기반선 대비 1%에서 2%의 검출 mAP 향상을 가져오며, 공동 최적화의 이점을 입증한다.
  • 이미지 변환 결과는 도로의 구조적 레이아웃이 유지되며, 도메인 차이에도 불구하고 차량과 같은 핵심 객체의 의미가 그대로 유지됨을 보여준다.
  • Foggy-Cityscapes로의 변환과 KITTI에서의 VKITTI-Rainy로의 변환을 통해 안개나 비와 같은 도전적인 도메인 차이를 성공적으로 처리한다.
  • 정성적 결과는 엔드 투 엔드 훈련이 객체 세부 정보(특히 배경과 겹치거나 가까이 있는 경우)의 유지에 기여함을 확인한다.
  • 테스트 시 이미지 변환 모듈가 제거되므로, 표준 Faster R-CNN(테슬라 M40에서 VGG16 기준 165ms)과 동일한 추론 시간을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.