Skip to main content
QUICK REVIEW

[논문 리뷰] BoLTVOS: Box-Level Tracking for Video Object Segmentation

Paul Voigtlaender, Jonathon Luiten|arXiv (Cornell University)|2019. 04. 09.
Visual Attention and Saliency Detection참고 문헌 51인용 수 14
한 줄 요약

BoLTVOS는 두 단계로 구성된 비디오 객체 분할 프레임워크를 제안한다. 첫 번째 단계에서는 조건부 R-CNN를 사용하여 시간적 일관성 재평가 기법을 적용해 경계 박스를 통해 객체를 추적하고, 두 번째 단계에서는 Box2Seg를 적용해 분할 마스크를 생성한다. 이는 첫 번째 프레임 마스크 정밀 조정 없이 DAVIS 2017 및 YouTube-VOS에서 최고 성능을 기록하며, 동일 분야의 모든 이전 방법을 능가하고, 이전 최고 방법보다 최대 45배 빠른 속도로 작동한다.

ABSTRACT

We approach video object segmentation (VOS) by splitting the task into two sub-tasks: bounding box level tracking, followed by bounding box segmentation. Following this paradigm, we present BoLTVOS (Box-Level Tracking for VOS), which consists of an R-CNN detector conditioned on the first-frame bounding box to detect the object of interest, a temporal consistency rescoring algorithm, and a Box2Seg network that converts bounding boxes to segmentation masks. BoLTVOS performs VOS using only the firstframe bounding box without the mask. We evaluate our approach on DAVIS 2017 and YouTube-VOS, and show that it outperforms all methods that do not perform first-frame fine-tuning. We further present BoLTVOS-ft, which learns to segment the object in question using the first-frame mask while it is being tracked, without increasing the runtime. BoLTVOS-ft outperforms PReMVOS, the previously best performing VOS method on DAVIS 2016 and YouTube-VOS, while running up to 45 times faster. Our bounding box tracker also outperforms all previous short-term and longterm trackers on the bounding box level tracking datasets OTB 2015 and LTB35. A newer version of this work can be found at arXiv:1911.12836.

연구 동기 및 목표

  • 최소한의 인간 주석을 요구하는 반감독 비디오 객체 분할(VOS) 문제에 도전하며, 특히 첫 번째 프레임 마스크 주석의 고비용을 피하고자 한다.
  • 첫 번째 프레임 경계 박지만을 사용하는 VOS 방법의 세 번째 유형에서 성능을 향상시키기 위해 박스 수준의 추적 및 분할을 개선하고자 한다.
  • 마스크 정밀 조정 기반 접근 방식에 비해 인fer 시간을 크게 줄이면서도 높은 정확도를 유지하는 방법을 개발하고자 한다.
  • 단기 및 장기 시각적 객체 추적에서 최고 성능을 달성하여, 객체 가림 및 재등장 상황에서도 강건성을 입증하고자 한다.

제안 방법

  • 첫 번째 프레임 경계 박자를 조건으로 삼아 객체를 추적하기 위해 조건부 R-CNN 검출기를 사용한다.
  • 트랙렛 기반 동적 프로그래밍을 모델링하고 간섭 물체를 처리함으로써 검출 신뢰도를 향상시키기 위해 시간적 일관성 재평가 알고리즘을 도입한다.
  • 기존의 유사도 예측 이전에 템플릿 특징와 영역 제안 특징를 연결함으로써 새로운 조건부 두 번째 단계를 갖춘 이중 단계 R-CNN 아키텍처를 사용한다.
  • 예측된 경계 박스에서 분할 마스크를 생성하기 위해 Box2Seg 네트워크를 활용하며, 분할을 후처리 단계로 간주한다.
  • 추적과 병행하여 첫 번째 프레임 마스크 정밀 조정을 수행하지만 런타임을 증가시키지 않는 BoLTVOS-ft라는 변형을 도입한다.
  • 국소 검색 창이 아닌 전체 이미지에 걸친 글로벌 특징 비교를 활용하여 객체가 사라졌을 경우 복구하고 재검출할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1비디오 객체 분할을 박스 수준의 추적과 경계 박스 분할로 효과적으로 분리할 수 있는가? 이는 성능 향상과 효율성 향상으로 이어지는가?
  • RQ2글로벌 특징 비교와 시간적 일관성 재평가 기법을 갖춘 조건부 R-CNN가 장기 추적 환경에서 기존 추적 방법보다 뛰어난 성능을 보일 수 있는가?
  • RQ3유사도 예측을 위한 특징 연결을 포함한 이중 단계 추적 접근 방식이 가림 및 추적 오차에 대해 더 강건한가?
  • RQ4첫 번째 프레임 경계 박지만을 사용하는 방법이 첫 번째 프레임 마스크를 사용하는 방법과 비교해 유사하거나 뛰어난 성능을 달성할 수 있으며, 훨씬 더 빠른가?
  • RQ5첫 번째 프레임 마스크에 대한 엔드 투 엔드 정밀 조정을 추적 파이프라인에 통합할 수 있는가? 이는 인fer 시간을 증가시키지 않는다.

주요 결과

  • BoLTVOS는 장기 추적 벤치마크인 LTB35에서 최고 성능을 기록하며, 이전 최고 방법(MBMD)보다 3.3%p 높은 F-스코어 66.2%를 달성했다.
  • OTB2015에서 BoLTVOS는 AUC 스코어 69.7%를 기록하여 이전 최고 방법(SiamRPN++)의 69.6%를 略로 초월했다.
  • DAVIS 2017 및 YouTube-VOS에서 BoLTVOS는 첫 번째 프레임 마스크 정밀 조정을 사용하지 않는 모든 방법보다 뛰어나며, 일부 정밀 조정을 사용하는 방법과도 동등하거나 슈퍼어리어하다.
  • BoLTVOS-ft는 PReMVOS보다 DAVIS 2016 및 YouTube-VOS에서 뛰어난 성능을 보였고, 최대 45배 빠른 속도로 작동했다.
  • 시간적 일관성 재평가 알고리즘은 LTB35의 최대 F-스코어를 63.4%에서 66.2%로 3.3%p 향상시켜 장기 추적 과제를 해결하는 데 효과적임을 입증했다.
  • BoLTVOS는 LTB35 및 OTB2015에서 각각 1.43 프레임/초의 속도로 작동하여, 높은 정확도를 유지하면서도 강력한 효율성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.