[논문 리뷰] Online Video Instance Segmentation via Robust Context Fusion
이 논문은 온라인 비디오 인스턴스 세분화를 위한 강건한 컨텍스트 퓨전(RCF) 네트워크를 제안하며, 중요도 인식 압축과 트랜스포머 기반 퓨전을 활용해 몇 장의 이전 프레임에서 압축되고 관련성이 높은 컨텍스트를 실시간 타겟 프레임 예측에 효율적으로 통합합니다. 이 방법은 YouTube-VIS 2019 및 2021에서 최신 기술 수준(SOTA) 성능을 달성하며, 클립 수준의 방법조차도 능가하고, 제약이 없는 상황에서 음성 신호가 세분화 성능을 약간 향상시킬 수 있음을 보여줍니다.
Video instance segmentation (VIS) aims at classifying, segmenting and tracking object instances in video sequences. Recent transformer-based neural networks have demonstrated their powerful capability of modeling spatio-temporal correlations for the VIS task. Relying on video- or clip-level input, they suffer from high latency and computational cost. We propose a robust context fusion network to tackle VIS in an online fashion, which predicts instance segmentation frame-by-frame with a few preceding frames. To acquire the precise and temporal-consistent prediction for each frame efficiently, the key idea is to fuse effective and compact context from reference frames into the target frame. Considering the different effects of reference and target frames on the target prediction, we first summarize contextual features through importance-aware compression. A transformer encoder is adopted to fuse the compressed context. Then, we leverage an order-preserving instance embedding to convey the identity-aware information and correspond the identities to predicted instance masks. We demonstrate that our robust fusion network achieves the best performance among existing online VIS methods and is even better than previously published clip-level methods on the Youtube-VIS 2019 and 2021 benchmarks. In addition, visual objects often have acoustic signatures that are naturally synchronized with them in audio-bearing video recordings. By leveraging the flexibility of our context fusion network on multi-modal data, we further investigate the influence of audios on the video-dense prediction task, which has never been discussed in existing works. We build up an Audio-Visual Instance Segmentation dataset, and demonstrate that acoustic signals in the wild scenarios could benefit the VIS task.
연구 동기 및 목표
- 실시간 프레임 단위 추론을 가능하게 하여 비디오 인스턴스 세분화에서 높은 지연 시간과 계산 비용 문제를 해결하기 위해.
- 시간적 일致성을 유지하면서 이전 기준 프레임에서 압축되고 효과적인 컨텍스트를 융합하여 온라인 VIS 성능을 향상시키기 위해.
- 추가 매칭 처리가 필요 없도록 정렬을 유지하는 인스턴스 임베딩을 학습하여 식별자 추적을 가능하게 하기 위해.
- 특히 제약이 없는 실세계 상황에서 음성 모odal이 비디오-밀도 예측 작업에 어떤 역할을 하는지 탐구하기 위해.
- 다중모달 융합을 연구하기 위해 새로운 시각-청각 인스턴스 세분화 데이터셋을 구축하고 평가하기 위해.
제안 방법
- 모델은 기준 프레임에서 관련 특징을 압축하여 중복과 노이즈를 줄인 후 융합하기 위해 중요도 인식 압축을 활용합니다.
- 트랜스포머 인코더는 표현력 있는 자기 및 상호 어텐션 메커니즘을 사용하여 압축된 기준 프레임 특징과 타겟 프레임 특징을 융합합니다.
- 고정 길이 쿼리에 의해 트랜스포머 디코더에서 순서를 유지하는 인스턴스 코드를 학습하여, 추가 매칭 없이도 식별자 추적을 가능하게 합니다.
- 모델은 리프시츠 연속성을 활용하여 안정적인 식별자 할당을 보장하며, 순서 유지에 대한 명시적 감독이 필요 없도록 합니다.
- 음성 모달은 동일한 컨텍스트 융합 메커니즘을 사용하여 시각 특징과 융합되는 음성 토큰을 통해 통합됩니다.
- 프레임워크는 다중모달 입력을 지원하는 유연한 아키텍처를 지녀, 밀도 있는 예측을 위한 공동 시각-청각 추론을 가능하게 합니다.
실험 결과
연구 질문
- RQ1소수의 기준 프레임을 효과적으로 활용함으로써 강건한 컨텍스트 융합 메커니즘이 온라인 비디오 인스턴스 세분화 성능을 향상시킬 수 있는가?
- RQ2기준 프레임 특징의 중요도 인식 압축이 온라인 추론에서 모델의 강건성과 효율성을 향상시키는가?
- RQ3순서를 유지하는 인스턴스 코드는 온라인 VIS에서 복잡한 후처리 매칭이 필요 없도록 할 수 있는가?
- RQ4실세계 제약이 없는 비디오 시나리오에서 음성 신호가 비디오 인스턴스 세분화 성능을 어느 정도 향상시킬 수 있는가?
- RQ5야생의 제어되지 않은 비디오 환경에서 음성 융합의 성능 향상은 통계적으로 유의미한가?
주요 결과
- 제안된 RCF 네트워크는 YouTube-VIS 2019에서 40.8 mAP, YouTube-VIS 2021에서 43.4 mAP를 기록하여 기존의 모든 온라인 VIS 방법을 능가하고, 이전에 발표된 클립 수준의 방법조차도 초월합니다.
- 모델은 여유 있는 인스턴스 쿼리에 대해 강건하여, 프레임 내 실제 인스턴스 수보다 훨씬 많은 쿼리가 존재하더라도 강력한 성능을 유지합니다.
- 인스턴스 코드의 순서를 감독해도 성능 향상이 없으며, 순서 유지 성질이 네트워크 아키텍처 자체에서 자연스럽게 유도되기 때문입니다.
- 토큰 융합에서 픽셀 단위의 가중치를 비활성화하면 mAP가 0.7 포인트 향상되며, 이는 배경 영역보다는 전경 영역에 집중하는 데 중요함을 시사합니다.
- 음성 통합은 AVIS 검증 세트에서 평균 +1.9 mAP의 약간의 성능 향상을 가져오지만, 통계적으로 유의미하지 않음(p-value > 0.05).
- 약한, 일관되지 않은 시각-청각 상관관계와 짧은 지속 시간의 소리 이벤트로 인해 음성의 이점은 제약이 없는 비디오에서는 국한되어 있습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.