Skip to main content
QUICK REVIEW

[논문 리뷰] U-Net Based Multi-instance Video Object Segmentation

Heguang Liu, Jingle Jiang|arXiv (Cornell University)|2019. 05. 19.
Advanced Image and Video Retrieval Techniques참고 문헌 15인용 수 6
한 줄 요약

이 논문은 U-Net 기반의 완전 컨볼루션 네트워크를 제안하며, 인스턴스 격리와 가중치가 부여된 교차 엔트로피 및 딱딱한 계수의 하이브리드 손실을 활용하여 다중 인스턴스 비디오 객체 세분화를 수행한다. DAVIS 2017에서 F mean: 0.467과 J mean: 0.424를 달성하여, 특히 완전한 인스턴스 커버리지가 요구되는 시나리오에서 재현율과 윤곽의 매끄러움에서 기준 모델을 능가한다.

ABSTRACT

Multi-instance video object segmentation is to segment specific instances throughout a video sequence in pixel level, given only an annotated first frame. In this paper, we implement an effective fully convolutional networks with U-Net similar structure built on top of OSVOS fine-tuned layer. We use instance isolation to transform this multi-instance segmentation problem into binary labeling problem, and use weighted cross entropy loss and dice coefficient loss as our loss function. Our best model achieves F mean of 0.467 and J mean of 0.424 on DAVIS dataset, which is a comparable performance with the State-of-the-Art approach. But case analysis shows this model can achieve a smoother contour and better instance coverage, meaning it better for recall focused segmentation scenario. We also did experiments on other convolutional neural networks, including Seg-Net, Mask R-CNN, and provide insightful comparison and discussion.

연구 동기 및 목표

  • 실시간 처리를 위해 시간 정보에 의존하지 않고 다중 인스턴스 비디오 객체 세분화의 과제를 해결하기 위해.
  • 기존 최신 기술인 OSVOS와 비교해 세분화의 완전성과 윤곽의 매끄러움을 향상시키기 위해.
  • DAVIS 2017 벤치마크에서 U-Net, SegNet, Mask R-CNN와 같은 완전 컨볼루션 아키텍처를 평가하고 비교하기 위해.
  • 다중 인스턴스 세분화를 위한 효과적인 손실 함수와 인스턴스 격리 전략을 탐구하기 위해.

제안 방법

  • 엔코더 특징에서의 공간적 세부 정보를 유지하기 위해 스킵 연결을 갖춘 U-Net 유사 아키텍처를 사용한다.
  • 다중 인스턴스 마스크를 각 인스턴스당 하나의 이진 마스크로 변환하여 문제를 N개의 독립적인 이진 세분화 작업으로 변환함으로써 인스턴스 격리를 적용한다.
  • 클래스 불균형을 해결하고 IoU를 향상시키기 위해 가중치가 부여된 교차 엔트로피와 딱딱한 계수를 조합한 하이브리드 손실 함수를 사용한다.
  • 첫 번째 프레임에서 OSVOS 최적화 특징을 미세 조정하여 새로운 비디오 시퀀스에 대한 원샷 적응을 가능하게 한다.
  • GPU 메모리 제약으로 인해 배치 크기를 8로 설정하였으며, 모델 당 수렴까지 약 8시간이 소요된다.
  • 표준 메트릭인 F mean과 J mean을 사용하여 DAVIS 2017 테스트 세트에서 모델을 평가한다.

실험 결과

연구 질문

  • RQ1시간 정보를 사용하지 않고도 U-Net 기반 아키텍처가 다중 인스턴스 비디오 객체 세분화에서 경쟁적인 성능을 달성할 수 있는가?
  • RQ2이진 마스크로의 인스턴스 격리가 종단 간 다중 클래스 예측과 비교해 세분화 정확도와 완전성에 어떤 영향을 미치는가?
  • RQ3가중치가 부여된 교차 엔트로피와 딱딱한 계수 손실을 조합함으로써 소형 객체 세분화에서의 클래스 불균형 문제에 어떤 영향을 미치는가?
  • RQ4제안된 모델은 OSVOS 및 Mask R-CNN, SegNet 등의 다른 아키텍처와 비교해 성능과 애너테이션 품질 측면에서 어떻게 비교되는가?
  • RQ5모델의 실패 모드는 특히 가림과 객체 경계 손실 상황에서 어떻게 나타나는가?

주요 결과

  • 제안된 U-Net 기반 모델은 DAVIS 2017 데이터셋에서 F mean: 0.467과 J mean: 0.424를 달성하여 최신 기술인 OSVOS와 유사한 성능을 보였다.
  • 모델는 OSVOS보다 더 매끄러운 윤곽과 더 나은 인스턴스 커버리지를 제공하여 재현율 중심의 세분화 작업에 더 적합하다.
  • 큰 운동 및 외관 변화에도 잘 대처하며, 먼 곳에서 회전하는 차량이 있는 드리프트 치카네 시퀀스에서 이를 입증했다.
  • 다중 인스턴스 가림 상황에서는 어려움을 겪으며, 한 객체가 다른 객체 앞을 지나갈 때 두 객체를 모두 추적하는 경향이 있었고, 캠엘 시퀀스에서 이를 확인할 수 있었다.
  • 객체가 영상 경계를 벗어나 다시 들어올 때 추적을 잃는 경향이 있었으며, 모터크로스 점프 시퀀스에서 이를 입증했다.
  • Mask R-CNN는 새로운 클래스에 대해 일반화 능력이 떨어져(예: 낙타를 말로 오해함) 및 첫 프레임 사전 지도 학습을 효과적으로 통합하지 못해 실패했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.