Skip to main content
QUICK REVIEW

[논문 리뷰] MOSE: A New Dataset for Video Object Segmentation in Complex Scenes

Henghui Ding, Chang Liu|arXiv (Cornell University)|2023. 02. 03.
Visual Attention and Saliency Detection인용 수 6
한 줄 요약

이 논문은 36개 카테고리에 걸쳐 5,200개의 객체를 포함하는 고해상도 영상 2,149개로 구성된 대규모 비디오 객체 분할 데이터셋인 MOSE를 소개한다. 이 데이터셋은 무거운 교차 및 객체의 사라짐/재등장, 소형/눈에 띄지 않는 객체, 혼잡한 환경을 특징으로 하며, 기존의 표준 벤치마크(DAVIS 등)에서 SOTA 방법이 90% 이상의 J&F 성능를 기록하는 데 반해, MOSE에서는 반숙제 설정에서 성능이 단 59.4% J&F로 급격히 떨어지며 실제 적용에서의 취약성을 드러낸다.

ABSTRACT

Video object segmentation (VOS) aims at segmenting a particular object throughout the entire video clip sequence. The state-of-the-art VOS methods have achieved excellent performance (e.g., 90+% J&F) on existing datasets. However, since the target objects in these existing datasets are usually relatively salient, dominant, and isolated, VOS under complex scenes has rarely been studied. To revisit VOS and make it more applicable in the real world, we collect a new VOS dataset called coMplex video Object SEgmentation (MOSE) to study the tracking and segmenting objects in complex environments. MOSE contains 2,149 video clips and 5,200 objects from 36 categories, with 431,725 high-quality object segmentation masks. The most notable feature of MOSE dataset is complex scenes with crowded and occluded objects. The target objects in the videos are commonly occluded by others and disappear in some frames. To analyze the proposed MOSE dataset, we benchmark 18 existing VOS methods under 4 different settings on the proposed MOSE dataset and conduct comprehensive comparisons. The experiments show that current VOS algorithms cannot well perceive objects in complex scenes. For example, under the semi-supervised VOS setting, the highest J&F by existing state-of-the-art VOS methods is only 59.4% on MOSE, much lower than their ~90% J&F performance on DAVIS. The results reveal that although excellent performance has been achieved on existing benchmarks, there are unresolved challenges under complex scenes and more efforts are desired to explore these challenges in the future. The proposed MOSE dataset has been released at https://henghuiding.github.io/MOSE.

연구 동기 및 목표

  • 기존 비디오 객체 분할(VOS) 벤치마크가 주로 눈에 띄는, 고립된, 교차가 없는 객체를 포함하고 있어 실제 적용 가능성에 빈도가 높다는 문제를 해결하기 위해.
  • 무거운 교차, 객체의 사라짐/재등장, 소형/눈에 띄지 않는 타겟을 포함한 복잡하고 현실적인 상황에서 현재 VOS 방법의 성능을 분석하기 위해.
  • 대규모, 다양성 있고 도전적인 벤치마크 데이터셋을 제공함으로써 더 강건하고 일반화 능력이 뛰어난 VOS 알고리즘의 개발을 촉진하기 위해.
  • 장기적인 비디오 분할, 군중 속에서의 객체 추적, 그리고 복잡한 환경에서 소형 또는 눈에 띄지 않는 객체를 다루는 데 있어 핵심 과제를 규명하기 위해.

제안 방법

  • MOSE 데이터셋은 스포츠, 도시 풍경, 자연 환경 등 다양한 실제 영상 자료에서 수집되어 객체의 외관, 운동, 교차 패턴에 높은 다양성을 확보하였다.
  • 각 영상 클립에는 36개 카테고리에 걸쳐 총 431,725개의 마스크를 포함하는 고품질의 픽셀 정밀도 분할 마스크가 5,200개의 객체에 대해 포함되어 있다.
  • 장기 추적 및 분할 평가를 지원하기 위해 평균 길이가 기존 벤치마크를 초월하는 장시간 영상 시퀀스를 포함하고 있다.
  • 복잡한 시각적 과제를 강조한다: 빈번한 교차, 객체의 사라짐 및 재확인, 소형 타겟, 유사한 외관을 가진 밀도 높은 군중.
  • 반숙제(마스크 및 경계상자), 무숙제(제로샷), 상호작용 VOS의 4가지 설정에서 18개의 기존 SOTA VOS 방법을 재학습하고 평가하여 종합적인 벤치마크를 수행하였다.
  • 평가 지표로는 복잡한 시나리오 조건에서의 성능 저하를 정량적으로 평가하기 위해 J&F(Jaccard 및 F-score)를 사용하였다.

실험 결과

연구 질문

  • RQ1표준 벤치마크와는 달리, 무거운 교차와 객체의 사라짐/재등장이 있는 데이터셋에서 SOTA VOS 방법의 성능는 어떻게 되는가?
  • RQ2현재 VOS 모델이 혼잡하고 복잡한 환경에서 소형, 눈에 띄지 않거나 비주목 대상인 객체를 얼마나 잘 추적하지 못하는가?
  • RQ3장기적인 비디오 시퀀스와 지속적인 교차에 직면했을 때 기존 VOS 방법의 주요 실패 원인은 무엇인가?
  • RQ4기존 VOS 방법은 객체가 고립되어 있지 않고 자주 교차되는 실제 환경에 일반화할 수 있는가?

주요 결과

  • XMem 및 DeAOT와 같은 SOTA VOS 방법은 DAVIS에서는 90% 이상의 J&F 성능를 기록하지만, 반숙제 설정에서 MOSE에서는 각각 57.6%와 59.4% J&F로 급격히 떨어지며, 복잡한 시나리오에서의 성능 격차가 뚜렷하게 드러난다.
  • 성능 저하의 주요 원인은 사라진 후 재확인이 어려운 과제와 특히 재등장 시 외관이 변화하는 경우의 무거운 교차 처리 과제에 기인한다.
  • 유사한 외관을 가진 객체들이 함께 움직이는 밀도 높은 군중에서 객체 추적 및 분할에 어려움을 겪는다.
  • 소형 및 눈에 띄지 않는 객체는 자주 실종되거나 잘못 분류되며, 현재 모델이 저시야도 타겟에 민감하지 못함을 드러낸다.
  • MOSE의 장시간 영상 시퀀스는 현재 VOS 모델의 계산 및 메모리 제약를暴露하며, 장기간에 걸쳐 정확한 객체 특징을 유지하지 못하는 경향이 있다.
  • 결과적으로 현재 VOS 알고리즘은 실제 복잡성에 대해 강건하지 않음을 입증하며, 맥락적 추론과 장기 기억을 중시하는 새로운 아키텍처 및 학습 프레임워크 개발의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.