Skip to main content
QUICK REVIEW

[논문 리뷰] EfficientSeg: An Efficient Semantic Segmentation Network

Vahit Buğra Yeşilkaynak, Yusuf H. Şahin|arXiv (Cornell University)|2020. 09. 14.
Advanced Neural Network Applications참고 문헌 24인용 수 7
한 줄 요약

이 논문은 소규모 데이터에서의 전연결 훈련을 가능하게 하기 위해 MobileNetV3 블록을 사용한 확장 가능한 U-Net 기반의 세분화 네트워크인 EfficientSeg를 제안한다. 깊이 스케일링과 표적화된 텍스처 불변 데이터 증강을 조합함으로써, Minicity 데이터셋에서 58.1% mIoU를 달성하여 U-Net을 18.1%포인트 뛰어넘었으며, 유사한 파라미터 수를 유지한다.

ABSTRACT

Deep neural network training without pre-trained weights and few data is shown to need more training iterations. It is also known that, deeper models are more successful than their shallow counterparts for semantic segmentation task. Thus, we introduce EfficientSeg architecture, a modified and scalable version of U-Net, which can be efficiently trained despite its depth. We evaluated EfficientSeg architecture on Minicity dataset and outperformed U-Net baseline score (40% mIoU) using the same parameter count (51.5% mIoU). Our most successful model obtained 58.1% mIoU score and got the fourth place in semantic segmentation track of ECCV 2020 VIPriors challenge.

연구 동기 및 목표

  • 사전 훈련된 가중치가 적용되지 않는 한정된 데이터로 깊이 있는 세분화 네트워크를 처음부터 효과적으로 훈련하는 데 도전한다.
  • 제한된 감독 하에 높은 성능을 유지하면서 메모리와 계산 효율성이 뛰어난 확장 가능한 아키텍처를 개발한다.
  • 낮은 데이터 환경에서 데이터 증강과 네트워크 깊이가 모델 성능에 미치는 영향을 조사한다.
  • ImageNet 사전 훈련 없이 Minicity 데이터셋에서 뛰어난 mIoU 점수를 달성한다.
  • 효과적인 데이터 증강이 자료가 부족한 환경에서 단순한 깊이 스케일링보다 더 높은 성능 향상을 이끌 수 있음을 입증한다.

제안 방법

  • 더 높은 효율성과 표현력을 확보하기 위해 MobileNetV3 블록을 백본으로 사용한 수정된 U-Net 아키텍처를 설계한다.
  • 다양한 깊이를 가진 네트워크 변형(예: EfficientSeg-1.5 및 EfficientSeg-6.0)을 생성하기 위해 깊이 스케일링 메커니즘을 구현한다.
  • 클래스 불균형을 해결하기 위해 클래스별 가중치(일반적인 희귀 클래스는 2, 매우 희귀 클래스는 3)를 적용한 가중치가 부여된 교차 엔트로피 손실을 사용한다.
  • 무작위 색조/명도 스케일링(0.4–1.6), JPEG 압축, 비균일 스케일링, 무작위 회전(±20°), 수평 뒤집기 등을 포함한 종합적인 데이터 증강 전략을 적용한다.
  • 정확도 향상을 위해 테스트 시 증강을 통해 원본 및 뒤집힌 테스트 이미지의 예측을 평균 내어 평가한다.
  • 학습 시 Adam 옵timizer를 사용하고, 초기 학습률(1e-3)을 200 에포크와 400 에포크에서 각각 10배로 감소시키는 코스인 감소 스케줄을 적용한다.

실험 결과

연구 질문

  • RQ1소규모 데이터셋에서 ImageNet 사전 훈련 가중치 없이 깊이 있는 세분화 네트워크를 효과적으로 처음부터 훈련시킬 수 있는가?
  • RQ2낮은 데이터 환경에서 데이터 증강이 사전 훈련의 필요성을 얼마나 줄일 수 있는가?
  • RQ3한정된 데이터로 처음부터 훈련할 때 네트워크 깊이를 늘리는 것이 성능에 어떤 영향을 미치는가?
  • RQ4기본 U-Net 블록에 비해 MobileNetV3 블록이 모델 용량과 효율성의 더 나은 균형을 제공할 수 있는가?
  • RQ5소수의 샘플 학습 환경에서 데이터 증강이 모델 깊이 증가보다 더 큰 성능 향상을 이끌 수 있는 지점이 존재하는가?

주요 결과

  • 전체 증강 전략을 사용해 훈련된 EfficientSeg (1.5)는 Minicity 테스트 세트에서 51.5% mIoU를 달성하여 기준 U-Net보다 11.5%포인트 높은 성능을 보였다.
  • 가장 효과적인 모델인 EfficientSeg (6.0)는 58.1% mIoU를 기록하여 ECCV 2020 VIPriors 세분화 경쟁에서 4위를 차지했다.
  • 데이터 증강 없이도 깊이가 더 깊은 EfficientSeg (6.0) 모델은 오직 47.6% mIoU에 그치며, 증강 기법이 깊이 스케일링보다 더 큰 영향을 미친다는 점을 입증했다.
  • 희귀 클래스인 'train'에 대해서도 강력한 성능을 보였으며, 증강 없이 0.002 mIoU, 증강 시에도 0.002 mIoU를 기록하여 클래스 균형 잡힌 훈련과 증강의 유용성을 보여주었다.
  • 제거 분석을 통해 텍스처 불변 증강(색조, 명도, JPEG 압축)이 네트워크 깊이 증가보다 더 큰 성능 향상을 이끌었다.
  • 테스트 시 뒤집힌 이미지 예측과 원본 예측의 평균을 내는 것이 단일 순전파보다 더 높은 mIoU를 제공하여 예측의 정확도 향상을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.