Skip to main content
QUICK REVIEW

[논문 리뷰] Make One-Shot Video Object Segmentation Efficient Again

Tim Meinhardt, Laura Leal-Taixé|arXiv (Cornell University)|2020. 12. 03.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 논문은 메타학습을 통한 모델 초기화와 뉴런 수준의 학습률을 활용하여 테스트 시 미세조정 반복 횟수를 크게 줄이고 동시에 최신 기술 수준의 성능을 달성하는 매우 효율적인 일회성 영상 객체 세분화 방법인 e-OSVOS를 제안한다. 객체 검출 헤드를 갖춘 Mask R-CNN을 직접 미세조정하고 온라인 적응을 적용함으로써, DAVIS 2016, DAVIS 2017, YouTube-VOS에서 이전의 미세조정 방법보다 수십~수백 배 빠른 추론 속도로 50~100회의 테스트 시 반복만으로도 높은 정확도를 달성한다.

ABSTRACT

Video object segmentation (VOS) describes the task of segmenting a set of objects in each frame of a video. In the semi-supervised setting, the first mask of each object is provided at test time. Following the one-shot principle, fine-tuning VOS methods train a segmentation model separately on each given object mask. However, recently the VOS community has deemed such a test time optimization and its impact on the test runtime as unfeasible. To mitigate the inefficiencies of previous fine-tuning approaches, we present efficient One-Shot Video Object Segmentation (e-OSVOS). In contrast to most VOS approaches, e-OSVOS decouples the object detection task and predicts only local segmentation masks by applying a modified version of Mask R-CNN. The one-shot test runtime and performance are optimized without a laborious and handcrafted hyperparameter search. To this end, we meta learn the model initialization and learning rates for the test time optimization. To achieve optimal learning behavior, we predict individual learning rates at a neuron level. Furthermore, we apply an online adaptation to address the common performance degradation throughout a sequence by continuously fine-tuning the model on previous mask predictions supported by a frame-to-frame bounding box propagation. e-OSVOS provides state-of-the-art results on DAVIS 2016, DAVIS 2017, and YouTube-VOS for one-shot fine-tuning methods while reducing the test runtime substantially. Code is available at https://github.com/dvl-tum/e-osvos.

연구 동기 및 목표

  • 영상 객체 세분화(VOS)에서 기존 일회성 미세조정 방법의 비효율성, 즉 수백에서 수천 번의 테스트 시 반복이 필요로 하는 문제를 해결하기 위해.
  • 미세조정 기반 VOS에서 고정된 사전학습과 수작업으로 설정된 초모수의 한계를 극복하기 위해 메타학습을 통해 최적의 초기화 및 학습률을 학습함으로써.
  • 템플릿 매칭이나 마스크 전파에 의존하지 않고도 효율적이고 고성능의 일회성 VOS를 가능하게 하여, 미세조정을 핵심 기반으로 유지할 수 있도록 하기 위해.
  • 프레임 간 바운딩 박스 전파를 이용해 과거 예측을 기반으로 지속적으로 미세조정하는 온라인 적응을 도입하여 장시간 시퀀스에서의 성능 안정성을 향상시키기 위해.
  • 최근 비학습 기반 방법으로의 전환 경향에 도전하여, 미세조정이 효율적이고 효과적일 수 있음을 입증하기 위해.

제안 방법

  • 모든 객체에 대해 후속 일회성 미세조정에 최적화된 초기 모델 가중치를 메타학습하여 고정된 사전학습이 필요 없도록 한다.
  • 뉴런 수준에서 개별 학습률을 예측하여 테스트 시 미세조정 중에 적응형으로, 작업에 특화된 최적화를 가능하게 하여 수작업 초모수 조정이 필요 없도록 한다.
  • Mask R-CNN의 엔드 투 엔드로 학습 가능한 검출 헤드를 사용하여 검출과 세분화를 분리함으로써, 마스크 예측을 국소화된 영역으로 제한하여 계산 비용을 줄인다.
  • 이전에 예측된 마스크와 전파된 바운딩 박스를 사용해 매 5프레임마다 모델을 미세조정하는 온라인 적응을 적용하여 시간이 지남에 따라 성능 저하를 완화한다.
  • RoIAlign을 사용해 국소화된 영역에서 특징을 추출함으로써 정확도를 향상시키면서도 세분화 범위를 관련 객체 영역으로 제한한다.
  • 다양한 객체와 영상에서 일반화 가능한 테스트 시 시나리오를 고려해 메타학습 프레임워크 내에서 초기화 및 학습률 적응을 최적화하도록 모델을 훈련한다.

실험 결과

연구 질문

  • RQ1일회성 미세조정이 성능을 희생시키지 않으면서도 실시간 영상 객체 세분화에 실제로 적용 가능한 정도로 충분히 효율적으로 만들 수 있는가?
  • RQ2메타학습을 사용해 테스트 시 미세조정에 최적화된 모델 초기화 및 학습률 스케줄을 자동으로 발견할 수 있는가?
  • RQ3뉴런 단위로 학습률을 예측하는 것이 고정 또는 파rameter 단위 학습률보다 더 나은 일반화 및 더 빠른 수렴을 이끌 수 있는가?
  • RQ4검출 헤드를 갖춘 엔드 투 엔드 Mask R-CNN이 최소한의 추론 비용으로도 전용 마스크 제안 또는 전파 방법보다 뛰어난 성능을 내는가?
  • RQ5추가적인 재학습이나 추가 모듈 없이도 온라인 적응이 장시간 영상 시퀀스에서 성능을 안정화시킬 수 있는가?

주요 결과

  • e-OSVOS는 일회성 미세조정 방법 중에서 DAVIS 2016, DAVIS 2017, YouTube-VOS에서 최신 기술 수준의 성능을 달성했으며, 반복 횟수를 크게 줄임에도 불구하고 여러 시퀀스에서 PReMVOS를 능가한다.
  • e-OSVOS-100-OnA 버전은 DAVIS 2017에서 평균 88.1%의 mIoU를 기록했으며, PReMVOS(88.8%)의 평균 성능을 뛰어넘었고, 0.29 프레임/초의 속도를 기록한 데 반해 PReMVOS는 0.01 fps였다.
  • e-OSVOS-50-OnA는 테스트 시 50회의 반복만으로도 DAVIS 2017에서 평균 86.5%의 mIoU를 달성하여, 최소한의 계산으로도 높은 정확도를 확보할 수 있음을 입증했다.
  • 이전의 미세조정 접근 방식이 객체당 최대 1000회의 반복이 필요로 했던 것에 비해, e-OSVOS는 테스트 시 추론 비용을 수십~수백 배 감소시켰다.
  • 더 단순한 아키텍처를 사용하고도, 높은 경계 예측이 필요한 어려운 시퀀스인 blackswan와 india에서도 경쟁적인 성능을 보였다.
  • 제거 실험 결과, 메타학습을 통한 초기화와 뉴런 수준의 학습률이 성능 향상에 핵심적임을 확인했으며, 이들 요소를 제거할 경우 정확도가 크게 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.