Skip to main content
QUICK REVIEW

[논문 리뷰] Unbiasing Semantic Segmentation For Robot Perception using Synthetic Data Feature Transfer

Jonathan Balloch, Varun Agrawal|arXiv (Cornell University)|2018. 09. 11.
Advanced Neural Network Applications참고 문헌 40인용 수 12
한 줄 요약

이 논문은 실시간 세분화 모델을 위한 로봇 인식에 합성 세분화 데이터를 사용해 사전 훈련하는 방법을 제안하며, ImageNet 사전 훈련보다 성능을 크게 향상시킨다. 다양한 저편향 합성 데이터로부터 특징을 전이함으로써, 실제 데이터가 부족한 상황에서 실세계 미세조정 데이터가 적은 경우에도 뛰어난 정확도를 달성할 수 있다.

ABSTRACT

Robot perception systems need to perform reliable image segmentation in real-time on noisy, raw perception data. State-of-the-art segmentation approaches use large CNN models and carefully constructed datasets; however, these models focus on accuracy at the cost of real-time inference. Furthermore, the standard semantic segmentation datasets are not large enough for training CNNs without augmentation and are not representative of noisy, uncurated robot perception data. We propose improving the performance of real-time segmentation frameworks on robot perception data by transferring features learned from synthetic segmentation data. We show that pretraining real-time segmentation architectures with synthetic segmentation data instead of ImageNet improves fine-tuning performance by reducing the bias learned in pretraining and closing the extit{transfer gap} as a result. Our experiments show that our real-time robot perception models pretrained on synthetic data outperform those pretrained on ImageNet for every scale of fine-tuning data examined. Moreover, the degree to which synthetic pretraining outperforms ImageNet pretraining increases as the availability of robot data decreases, making our approach attractive for robotics domains where dataset collection is hard and/or expensive.

연구 동기 및 목표

  • 제한적이고 노이즈가 많은 실제 세계 데이터만으로 실시간 세분화 모델을 훈련하는 데 도전하는 것.
  • 저자원 로봇 시각 환경에서 ImageNet 사전 훈련이 유도하는 편향과 분포 이탈 문제를 해결하는 것.
  • 합성 데이터 사전 훈련이 ImageNet 사전 훈련보다 합성과 실제 로봇 인식 데이터 간 도메인 갭을 더 효과적으로 줄일 수 있는지 조사하는 것.
  • 다양한 양의 실제 세계 미세조정 데이터에서 합성 사전 훈련의 성능 향상 정도를 정량화하는 것.
  • 고수준 도메인 유사성과 데이터 다양성, 스케일, 편향의 역할이 합성 사전 훈련의 효과성에 어떻게 기여하는지 평가하는 것.

제안 방법

  • ImageNet 대신 대규모 합성 RGB-D 세분화 데이터셋(예: SceneNet RGB-D, GTA)에서 실시간 세분화 아키텍처(예: DeepLabv3+ with MobileNet)를 사전 훈련한다.
  • 진행적으로 더 작은 레이블된 데이터 서브셋을 사용하여 실제 로봇 인식 데이터셋(예: Cityscapes, SUN RGB-D, Robot@Home)에서 사전 훈련된 모델을 미세조정한다.
  • 주요 평가 지표로 평균 교차율(mIoU)을 사용하여 ImageNet으로 사전 훈련한 모델과의 성능을 비교한다.
  • 고수준 도메인 유사성의 영향을 분리하기 위해 유사한(예: 드라이빙용 GTA)과 비유사한(예: 실내 주행용 SceneNet) 합성 데이터셋에서의 사전 훈련을 비교하는 아블레이션 스터디를 수행한다.
  • 합성 데이터와 실제 데이터 간 도메인 이탈 갭(G^{tr})을 줄이는 데 합성 사전 훈련이 어떻게 기여하는지 전이 학습을 통해 평가한다.
  • 다양한 합성 데이터 분포에서 훈련된 모델들을 비교함으로써 합성 사전 훈련에서 데이터 다양성, 스케일, 도메인 유사성 간의 트레이드오프를 분석한다.

실험 결과

연구 질문

  • RQ1ImageNet 사전 훈련 대비 합성 데이터에서 사전 훈련한 실시간 세분화 모델이 실제 로봇 인식 데이터에서의 미세조정 성능을 향상시키는가?
  • RQ2실제 세계의 미세조정 데이터가 점점 줄어들수록 합성 사전 훈련의 성능 향상은 어떻게 변화하는가?
  • RQ3합성 사전 훈련 데이터와 실제 타겟 데이터 간 고수준 도메인 유사성이 모델 성능에 어느 정도 기여하는가?
  • RQ4합성 사전 훈련의 이점은 도메인 유사성 때문인가, 아니면 데이터 다양성, 스케일, 감소된 편향과 같은 다른 요인 때문인가?
  • RQ5합성 사전 훈련은 로봇 응용 분야에서 강력한 세분화 성능을 달성하기 위해 필요한 실제 세계 데이터의 양을 줄일 수 있는가?

주요 결과

  • 모든 미세조정 데이터 스케일에서 합성 데이터에서 사전 훈련한 모델이 ImageNet에서 사전 훈련한 모델보다 성능이 뛰어나며, 실제 데이터가 점점 부족해질수록 성능 향상이 커진다.
  • ImageNet 사전 훈련 대비 합성 사전 훈련은 실제 세계 데이터 요구량을 15%에서 50%까지 감소시키며, 훨씬 적은 레이블된 데이터로도 ImageNet 기반 성능에 도달할 수 있도록 한다.
  • 단지 25,000 프레임만으로도 SceneNet RGB-D나 GTA에서 합성 사전 훈련한 모델이 Cityscapes와 SUN RGB-D 양쪽에서 ImageNet 사전 훈련 모델을 능가함을 보여주며, 더 작은 스케일임에도 불구하고 합성 데이터의 효과성을 입증한다.
  • 입력 데이터의 높은 다양성과 낮은 편향을 가진 합성 데이터에서 사전 훈련한 모델은 목표 작업에 덜 대응되는 경우에도, 유사한 고수준 도메인에서 사전 훈련한 모델보다 성능이 뛰어나다.
  • 사전 훈련 데이터와 타겟 데이터 간 고수준 유사성은 일부 성능 향상에 기여하지만, 도메인 유사성만으로는 성공 여부를 예측하기에 충분하지 않으며, 데이터 다양성과 편향 감소가 더 강력한 예측 요소이다.
  • 실제 세계 데이터의 가용성이 감소할수록 ImageNet과 합성 사전 훈련 간 성능 격차가 커지며, 이는 합성 사전 훈련이 자원이 부족한 로봇 응용 분야에 확장 가능한 솔루션임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.