Skip to main content
QUICK REVIEW

[논문 리뷰] Occluded Video Instance Segmentation: Dataset and ICCV 2021 Challenge

Jiyang Qi, Yan Gao|arXiv (Cornell University)|2021. 11. 15.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 901개의 교착 영상 시나리오에 걸쳐 296만 개의 고품질 마스크를 포함한 대규모 비디오 인스턴스 세그멘테이션 데이터셋인 OVIS를 소개한다. 이는 비디오 이해에서 교착 상태에 대한 추론 능력을 평가하고 향상시키기 위해 특별히 설계되었다. 최신 기술에도 불구하고, 극도로 교착된 개체에 대한 성능은 급격히 떨어지며, AP는 5.6으로 떨어지는데, 이는 현재 모델에 있어 심각한 격차를 드러내며, 저자들은 이를 ICCV 2021 챌린지를 통해 해결하고자 하였다. 이 챌린지로 인해 최대 21.6 AP를 달성한 새로운 방법들이 도출되었다.

ABSTRACT

Although deep learning methods have achieved advanced video object recognition performance in recent years, perceiving heavily occluded objects in a video is still a very challenging task. To promote the development of occlusion understanding, we collect a large-scale dataset called OVIS for video instance segmentation in the occluded scenario. OVIS consists of 296k high-quality instance masks and 901 occluded scenes. While our human vision systems can perceive those occluded objects by contextual reasoning and association, our experiments suggest that current video understanding systems cannot. On the OVIS dataset, all baseline methods encounter a significant performance degradation of about 80% in the heavily occluded object group, which demonstrates that there is still a long way to go in understanding obscured objects and videos in a complex real-world scenario. To facilitate the research on new paradigms for video understanding systems, we launched a challenge based on the OVIS dataset. The submitted top-performing algorithms have achieved much higher performance than our baselines. In this paper, we will introduce the OVIS dataset and further dissect it by analyzing the results of baselines and submitted methods. The OVIS dataset and challenge information can be found at http://songbai.site/ovis .

연구 동기 및 목표

  • 현재 비디오 이해 시스템이 인간의 시각에 비해 극도로 교착된 개체를 인식하는 데에 크게 뒤처지는 비디오에서의 심각한 과제를 해결하기 위해.
  • 실제 세계의 복잡성과 다양성을 더 잘 반영하기 위해, 교착된 비디오 인스턴스 세그멘테이션에 집중한 대규모 고품질 데이터셋을 구축하기 위해.
  • 실제 세계의 복잡한 시나리오에서 교착 상태가 많은 상황에서 기존 최신 기술의 비디오 인스턴스 세그멘테이션 모델의 한계를 종합적인 베이스라인 분석을 통해 평가하기 위해.
  • ICCV 2021 교착 비디오 인스턴스 세그멘테이션 챌린지를 통해 새로운 교착 상태 추론 패러다임에 대한 연구를 자극하기 위해.

제안 방법

  • OVIS 데이터셋은 다양한 교착 유형을 포함한 901개의 복잡한 영상 시나리오를 수집하여 구축되었으며, 장시간 연속 영상과 높은 객체 밀도를 통해 교착 노출를 극대화하였다.
  • 모든 프레임의 각 인스턴스는 정밀한 인스턴스 마스크와 교착 수준 점수로 주석 처리되어 있어, 교착 정도에 따라 세분화된 평가가 가능하다.
  • MaskTrack R-CNN, STEm-Seg, QueryInst 등 9종의 최신 기술 비디오 인스턴스 세그멘테이션 모델이 OVIS에서 평가되어 기준 성능이 확립되었다.
  • ICCV 2021 챌린지는 새로운 아키텍처와 학습 전략을 사용한 제출을 초대하였으며, 상위 성능을 낸 방법들은 시간적 모델링과 COCO 및 Pascal VOC와 같은 이미지 수준 데이터셋에서 유래한 데이터 증강 기법을 활용하였다.
  • 데이터 증강, 예를 들어 COCO에서 유도된 이미지 쌍을 합성하여 모델의 교착 상태에 대한 강건성에 미치는 영향을 분석하기 위해 분석 실험을 수행하였다.
  • 표준 평가 지표를 사용하여 성능을 평가하였으며, AP(평균 정밀도)를 포함하고 있으며, 특히 극도로 교착된 개체에 대해 별도의 점수(AP_HO)를 제공하였다.

실험 결과

연구 질문

  • RQ1현재 최신 기술의 비디오 인스턴스 세그멘테이션 모델은 인간의 시각에 비해 극도로 교착된 개체에서 어떻게 성능을 내는가?
  • RQ2실제 세계의 복잡한 시나리오에서 교착 상태가 얼마나 기존 비디오 인스턴스 세그멘테이션 방법의 성능을 떨어뜨리는가?
  • RQ3어떤 아키텍처나 학습 혁신이 교착된 비디오 인스턴스 세그멘테이션에서 성능 향상에 기여하는가?
  • RQ4이미지 수준의 인스턴스 세그멘테이션 데이터셋에서 유래한 데이터 증강 기법이 비디오 모델의 교착 상태에 대한 강건성 향상에 기여하는가?
  • RQ5현재 모델의 주요 실패 유형은 무엇이며, 이는 맥락과 연관성에서 인간의 추론과 비교해 볼 때 어떻게 다를까?

주요 결과

  • 모든 기준 모델이 극도로 교착된 개체에서 급격한 성능 저하를 겪었으며, 이 그룹에서의 최고 AP는 단지 5.6에 그쳐 교착 상태 추론에 있어 심각한 격차가 있음을 시사한다.
  • 챌린지에서 상위 성능을 낸 방법은 테스트 세트에서 AP 21.6을 기록하여, 최고의 기준 모델(16.3 AP)을 크게 앞서며 교착 상태에 대한 강건성 향상의 진전을 보여주었다.
  • COCO와 Pascal VOC에서 유도된 합성 이미지 쌍을 사용함으로써 STEm-Seg의 AP가 2.4점 향상(13.8에서 16.2로)되었으며, 이는 데이터 증강이 교착 상태 일반화에 효과적임을 보여준다.
  • 3D 컨볼루션과 바텀업 아키텍처(예: STEm-Seg)를 기반으로 한 방법들이 교착된 시나리오에서 더 우수한 성능을 보였는데, 이는 더 나은 시간적 모델링과 검출 병목 현상 회피 가능성 때문일 것이다.
  • 실패 케이스 분석을 통해 ID 전환, 완전히 교착된 개체를 재식별하지 못하는 문제, 그리고 서로 겹치고 밀도가 높은 시나리오에서의 혼동 등 뚜렷한 문제들이 드러났다.
  • 챌린지 결과는 심지어 상위 성능 모델들도 물체가 작거나 겹치거나 완전히 숨겨진 경우에 심각한 교착 상태에 대해 어려움을 겪고 있음을 강조하며, 더 나은 맥락적 추론이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.