[논문 리뷰] 1st Place Solution for YouTubeVOS Challenge 2021:Video Instance Segmentation
이 논문은 YouTube-VIS 2021 챌린지에서 1등을 차지한 솔루션을 제시하며, 시간적 연관성 있는 인스턴스 세분화(TCIS), 다중 소스 데이터(MSD) 훈련을 통해 프레임 중복을 완화하고, 더 나은 객체 레코그니션을 위해 双방향 추적(BiTrack)을 도입한 통합된 비디오 인스턴스 세분화 모델을 제안한다. 이 방법은 공개 검증 세트에서 0.575 mAP, 비공개 테스트 세트에서 0.541 mAP를 기록하여 YouTube-VIS 2019 및 2021 벤치마크에서 모두 새로운 기록을 수립한다.
Video Instance Segmentation (VIS) is a multi-task problem performing detection, segmentation, and tracking simultaneously. Extended from image set applications, video data additionally induces the temporal information, which, if handled appropriately, is very useful to identify and predict object motions. In this work, we design a unified model to mutually learn these tasks. Specifically, we propose two modules, named Temporally Correlated Instance Segmentation (TCIS) and Bidirectional Tracking (BiTrack), to take the benefit of the temporal correlation between the object's instance masks across adjacent frames. On the other hand, video data is often redundant due to the frame's overlap. Our analysis shows that this problem is particularly severe for the YoutubeVOS-VIS2021 data. Therefore, we propose a Multi-Source Data (MSD) training mechanism to compensate for the data deficiency. By combining these techniques with a bag of tricks, the network performance is significantly boosted compared to the baseline, and outperforms other methods by a considerable margin on the YoutubeVOS-VIS 2019 and 2021 datasets.
연구 동기 및 목표
- YouTube-VIS 2021과 같은 비디오 인스턴스 세분화 데이터셋에서 높은 프레임 중복성과 낮은 데이터 효율성 문제를 해결하기 위해.
- 통합 모델을 통해 검출, 세분화, 추적을 공동으로 학습하여 비디오 인스턴스 세분화 성능을 향상시키기 위해.
- 다양한 데이터 소스를 통합하는 새로운 다중 소스 데이터(MSD) 훈련 메커니즘을 통해 모델의 일반화 능력과 강인성을 향상시키기 위해.
- 비디오를 정방향과 역방향으로 처리하여 놓친 객체를 복구하는 이중 방향 추적(BiTrack)을 도입하여 추적 정확도와 레코그니션을 향상시키기 위해.
- 구조적 혁신과 실용적인 훈련 기법의 조합을 통해 YouTube-VIS 2019 및 2021 벤치마크에서 최고 성능을 달성하기 위해.
제안 방법
- 시간적 연관성 있는 인스턴스 세분화(TCIS)를 제안하며, 이는 인접 프레임 간의 인스턴스 마스크 간의 시간적 의존성을 명시적으로 모델링하여 일관성과 정확도를 향상시킨다.
- 다양한 비디오 세그먼트와 프레임 샘플링 전략을 포함한 다중 소스 데이터(MSD) 훈련 메커니즘을 도입하여 데이터 다양성을 증가시키고, 중복 프레임에 대한 과적합을 줄인다.
- 양방향 추적(BiTrack)을 활용하며, 이는 비디오를 정방향과 역방향으로 추적한 후 결과를 병합하여 더 완전한 객체 트랙을 복구하는 후처리 단계이다.
- 6단계 피처 피라미드 네트워크(FPN)와 추가적인 P7 피처 수준를 갖춘 마스크 R-CNN 기반 백본을 사용하여 다중 척도 피처 표현을 향상시킨다.
- 검출, 세분화, 추적에 공통 피처를 사용하는 다중 작업 학습 프레임워크를 적용하며, 마스크 스코어링 및 의미 세분화를 위한 보조 헤드도 포함한다.
- 검증 세트에서 앙상블 학습과 가짜 레이블링을 적용하여 성능을 추가로 향상시키며, 특히 비공개 테스트 세트에서의 성능 향상에 기여한다.
실험 결과
연구 질문
- RQ1인접 프레임 간의 시간적 상관관계를 효과적으로 활용하여 비디오 인스턴스 세분화 성능을 향상시킬 수 있는가?
- RQ2YouTube-VIS 2021에서의 프레임 중복성이 모델 성능에 미치는 영향은 어느 정도이며, 데이터 효율성을 어떻게 향상시킬 수 있는가?
- RQ3이중 방향 추적(BiTrack)이 비디오 인스턴스 세분화에서 객체 레코그니션과 트랙 완전성에 기여하는가?
- RQ4TCIS와 MSD와 같은 아키텍처 구성 요소가 낮은 데이터 또는 중복 데이터 환경에서 일반화 능력과 강인성에 기여하는 방식은 무엇인가?
- RQ5어떤 훈련 기법 조합과 모델 앙상블 전략이 YouTube-VIS 2021 및 2019 벤치마크에서 최고의 성능을 낼 수 있는가?
주요 결과
- 제안된 방법은 YouTube-VIS 2021 공개 검증 세트에서 0.575 mAP를 기록하여 1등을 차지하고, 새로운 최고 기록을 수립했다.
- 비공개 테스트 세트에서는 0.541 mAP를 기록하여 검증 세트를 초월한 강력한 일반화 능력과 강인성을 입증했다.
- YouTube-VIS 2019 벤치마크에서는 0.543 mAP를 기록하여 이전 최고 성능 모델(MaskProp)보다 mAP 기준 11.0% 향상시켰다.
- 제거 실험 결과, TCIS, MSD, BiTrack 각각이 개별적으로 2% 이상의 mAP 향상을 기여하며, 병합된 구성 요소는 기준 모델 대비 약 8% mAP 향상을 이끌었다.
- 큰 백본(ResNeSt101, Swin-S), 가짜 레이블링, 모델 앙상블을 포함한 트릭 모음은 표준 백본 대비 15% 이상의 mAP 향상을 이끌었으며, 실용적 훈련 전략의 중요성을 입증했다.
- 시각적 결과는 모델이 일관된 인스턴스 마스크와 색상 코딩된 식별자를 갖춰, 프레임 간에 정확하게 객체를 검출하고 세분화하며 추적함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.