[논문 리뷰] Learning Referring Video Object Segmentation from Weak Annotation
이 논문은 표적 객체의 첫 번째 등장 시 단일 마스크만 사용하고 이후 프레임에는 경계 박스만 사용함으로써 밀도 높은 마스크 레이블링 비용을 8배 감소시키는 약한 감독(annotation) 기반의 참조 비디오 객체 분할(RVOS) 방법을 제안한다. 언어 유도형 다중 프레임 분할 및 양단 대비 학습을 통한 SimRVOS라는 방법은 완전 감독 방법과 비교해 유사한 성능을 달성함으로써, 밀도 높은 정밀한 레이블링 없이도 고성능 분할이 가능하다는 것을 입증한다.
Referring video object segmentation (RVOS) is a task that aims to segment the target object in all video frames based on a sentence describing the object. Although existing RVOS methods have achieved significant performance, they depend on densely-annotated datasets, which are expensive and time-consuming to obtain. In this paper, we propose a new annotation scheme that reduces the annotation effort by 8 times, while providing sufficient supervision for RVOS. Our scheme only requires a mask for the frame where the object first appears and bounding boxes for the rest of the frames. Based on this scheme, we develop a novel RVOS method that exploits weak annotations effectively. Specifically, we build a simple but effective baseline model, SimRVOS, for RVOS with weak annotation. Then, we design a cross frame segmentation module, which uses the language-guided dynamic filters from one frame to segment the target object in other frames to thoroughly leverage the valuable mask annotation and bounding boxes. Finally, we develop a bi-level contrastive learning method to enhance the pixel-level discriminative representation of the model with weak annotation. We conduct extensive experiments to show that our method achieves comparable or even superior performance to fully-supervised methods, without requiring dense mask annotations.
연구 동기 및 목표
- 밀도 높은 마스크 레이블링의 높은 레이블링 비용을 줄이면서도 높은 성능을 유지하기 위해.
- 인간의 레이블링 노력 최소화를 위해 실용적이고 효율적인 레이블링 체계를 설계함으로써 정확도를 훼손하지 않기 위해.
- 종단 간 RVOS를 위해 약한 감독 신호(특히, 한 프레임에서의 단일 마스크와 다른 프레임의 경계 박스)를 효과적으로 활용하는 딥 러닝 프레임워크를 개발하기 위해.
- 약한 감독 조건 하에서 새로운 이중 수준 대비 학습 전략을 통해 픽셀 수준의 특징 구별 능력을 향상시키기 위해.
제안 방법
- 새로운 레이블링 체계 제안: 표적 객체가 첫 번째로 나타나는 프레임에 대해 단일 마스크를 제공하고, 나머지 모든 프레임에는 경계 박스를 사용함으로써 레이블링 비용을 8배 감소시킴.
- 언어 유도형 동적 컨볼루션과 다중 모odal 융합을 사용하는 단순하지만 효과적인 기본 모델인 SimRVOS를 도입함.
- 언어 유도형 다중 프레임 분할(LGCFS) 모듈을 설계하여 한 프레임에서 유도된 동적 필터를 다른 프레임으로 전달함으로써 마스크를 예측함. 이는 마스크 및 경계 박스 레이블링을 동시에 활용함.
- 이중 수준 대비 학습(BLCL) 방법을 개발함. 이는 두 가지 구성 요소로 이루어짐: (a) 언어-시각 대비를 통한 언어적 특징과 전경 시각적 특징의 정렬, (b) 다중 프레임 간 일관성 대비를 통한 강건성 향상.
- LGCFS 모듈을 사용해 마스크 레이블링을 프레임 간 전파하면서도 경계 박스를 보조 레이블링으로 활용함으로써 외관 변화에 대한 일반화 능력을 향상시킴.
- 밀도 높은 픽셀 수준의 레이블링이 필요 없이도 약한 레이블링을 사용해 종단 간으로 모델을 훈련함으로써 강력한 성능 달성.
실험 결과
연구 질문
- RQ1밀도 높은 마스크 레이블링 대신 단일 마스크와 경계 박스만을 사용하는 참조 비디오 객체 분할 모델이 경쟁 가능한 성능을 달성할 수 있는가?
- RQ2약한 감독 조건 하에서 첫 번째 프레임의 유의미한 마스크 레이블링을 어떻게 효과적으로 모든 비디오 프레임으로 전파하고 활용할 수 있는가?
- RQ3약한 레이블링만 존재할 경우, 이중 수준 대비 학습이 픽셀 수준의 특징 구별 능력을 얼마나 향상시킬 수 있는가?
- RQ4밀도 높은 레이블링 없이도 약한 감독 기반 RVOS 프레임워크가 완전 감독 방법을 능가하거나 동등하게 성능을 내는가?
주요 결과
- 제안된 약한 레이블링 체계는 YouTube-RVOS에서 검증된 결과, 완전한 밀도 높은 레이블링 대비 8배의 레이블링 비용 절감을 달성함.
- JHMDB-Sentences 벤치마크에서 모델은 평균 IoU 62.7을 기록하며, LBDT 및 MTTR 등 완전 감독 방법보다 약한 감독 조건 하에서도 뛰어난 성능을 보임.
- 제안된 LGCFS 및 BLCL 모듈을 통합한 SimRVOS는 JHMDB-Sentences 세트에서 65.8% mAP를 달성하여 완전 감독 방법인 LBDT(65.8% mAP)를 능가하고 ReferFormer(69.3% mAP)와 전체 성능에서 동등한 성능 기록.
- 이중 수준 대비 학습 방법은 IoU 및 P@0.5에서 P@0.9까지의 지표에서 일관된 향상을 보이며, 특징의 구별 능력 향상이 뚜렷하게 나타남.
- LGCFS 모듈은 효과적인 마스크 전파를 가능하게 하여, 단순히 경계 박스만 사용하는 것보다 더 정확한 예측을 가능하게 함. 이는 정성적 비교를 통해 입증됨.
- 모델은 다양한 데이터셋 간에 잘 일반화되며, 미세조정 없이도 JHMDB-Sentences에서 강력한 zero-shot 성능을 기록함으로써 도메인 이동에 대한 강건성을 보임.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.