[논문 리뷰] Joint Modeling of Feature, Correspondence, and a Compressed Memory for Video Object Segmentation
이 논문은 단일 트랜스포머 기반 아키텍처 내에서 특징, 상응성, 압축된 메모리 토큰을 동시에 모델링하는 통합된 비디오 오브젝트 세그멘테이션 프레임워크인 JointFormer을 제안한다. Joint Blocks 내의 어텐션 메커니즘을 활용해 특징, 상응성, 메모리 간에 반복적으로 목표 정보를 전파함으로써, DAVIS 2017(검증 세트에서 89.7% J&F, 테스트-데브 세트에서 87.6%)과 YouTube-VOS 2018/2019(모든 검증 세트에서 87.0%)에서 최신 기술 수준을 상회하는 성능을 달성한다. 이는 향상된 분류 특징 학습과 장기적 시간적 모델링 덕분이다.
Current prevailing Video Object Segmentation methods follow the pipeline of extraction-then-matching, which first extracts features on current and reference frames independently, and then performs dense matching between them. This decoupled pipeline limits information propagation between frames to high-level features, hindering fine-grained details for matching. Furthermore, the pixel-wise matching lacks holistic target understanding, making it prone to disturbance by similar distractors. To address these issues, we propose a unified VOS framework, coined as JointFormer, for jointly modeling feature extraction, correspondence matching, and a compressed memory. The core Joint Modeling Block leverages attention to simultaneously extract and propagate the target information from the reference frame to the current frame and a compressed memory token. This joint scheme enables extensive multi-layer propagation beyond high-level feature space and facilitates robust instance-distinctive feature learning. To incorporate the long-term and holistic target information, we introduce a compressed memory token with a customized online updating mechanism, which aggregates target features and facilitates temporal information propagation in a frame-wise manner, enhancing global modeling consistency. Our JointFormer achieves a new state-of-the-art performance on the DAVIS 2017 val/test-dev (89.7\% and 87.6\%) benchmarks and the YouTube-VOS 2018/2019 val (87.0\% and 87.0\%) benchmarks, outperforming the existing works. To demonstrate the generalizability of our model, it is further evaluated on four new benchmarks with various difficulties, including MOSE for complex scenes, VISOR for egocentric videos, VOST for complex transformations, and LVOS for long-term videos.
연구 동기 및 목표
- 기존 VOS 방법에서 특징 추출과 매칭을 분리한 방식의 한계를 해결하기 위해, 정보 흐름이 고수준 특징에 국한되고 전체 오브젝트 이해를 간과한다는 점을 해결한다.
- 단일 아키텍처 내에서 특징, 픽셀 단위의 상응성, 인스턴스 수준의 압축된 메모리 토큰을 함께 모델링하여 분류 특징 학습을 향상시킨다.
- 압축된 메모리 토큰을 위한 맞춤형 온라인 업데이트 메커니즘을 설계하여 시간 차원을 따라 정보를 전파함으로써 장기적 시간적 모델링을 향상시킨다.
- 마스킹된 이미지 모델링과 같은 대규모 사전 훈련 기법을 효과적으로 활용할 수 있도록, 세 가지 구성 요소를 단일 어텐션 기반 프레임워크로 통합한다.
- 특징, 상응성, 메모리 간에 다수 수준의 반복적 정보 전파를 가능하게 함으로써 표준 벤치마크에서 뛰어난 성능을 달성한다.
제안 방법
- 프레임워크는 평탄화된 현재 프레임과 기준 프레임의 특징을 압축된 메모리 토큰과 연결하여, 비전 트랜스포머 기반 백본에서 스택된 Joint Blocks가 처리하는 토큰 시퀀스로 구성된다.
- 각 Joint Block은 자기 어텐션과 크로스 어텐션을 사용하여 특징 추출, 조밀한 상응성 맵 계산, 엔드 투 엔드 방식의 압축된 메모리 토큰 업데이트를 동시에 수행한다.
- 압축된 메모리 토큰은 각 오브젝트를 하나의 인스턴스 수준 임베딩으로 표현하여 전체 오브젝트 모델링을 가능하게 하고 메모리 오버헤드를 줄인다.
- 이전 프레임의 다중 수준 특징을 시간적 맥락으로 사용하는 맞춤형 온라인 업데이트 메커니즘을 통해 시간 차원을 따라 장거리 정보 흐름을 가능하게 한다.
- 테스트 시에는 다중 해상도 추론을 적용하여 다양한 해상도에서 예측을 평균화함으로써 정확성과 강건성을 향상시킨다.
- 백본에서 마스킹된 이미지 모델링 사전 훈련 목표를 사용하여 훈련함으로써, 더 나은 특징 학습과 후속 VOS 작업에서의 성능 향상을 달성한다.

실험 결과
연구 질문
- RQ1단일 트랜스포머 블록 내에서 특징, 상응성, 압축된 메모리 토큰을 통합적으로 모델링하는 것이 분리된 파이프라인에 비해 비디오 오브젝트 세그멘테이션 성능 향상에 기여하는가?
- RQ2각 오브젝트를 전체적으로 표현하는 압축된 메모리 토큰의 통합은 전체 오브젝트 이해를 어떻게 향상시키고 간섭 요소에 대한 민감도를 낮추는가?
- RQ3제안된 압축된 메모리 토큰을 위한 온라인 업데이트 메커니즘이 장기적 시간적 모델링과 장시간 영상에서의 강건성에 얼마나 기여하는가?
- RQ4통합된 어텐션 기반 설계는 특징과 매칭 모듈을 별도로 운영하는 것에 비해 마스킹된 이미지 모델링과 같은 대규모 사전 훈련 기법을 얼마나 효과적으로 활용할 수 있는가?
- RQ5압축된 메모리에 다수의 기준 프레임을 사용할 경우 성능, 추론 속도, 메모리 소비 간의 상호 상충 관계는 어떻게 나타나는가?
주요 결과
- JointFormer은 DAVIS 2017 검증 세트에서 89.7% J&F, 테스트-데브 세트에서 87.6%를 기록하여 기존 방법을 크게 앞서는 새로운 최신 기술 수준의 성능을 달성한다.
- YouTube-VOS 2018 및 2019 검증 세트에서 87.0%의 글로벌 스코어(G)를 기록하여 다양한 영상 분포에 걸쳐 강력한 일반화 능력을 보여준다.
- 제거 실험 결과 다중 해상도 추론이 성능 향상에 기여하며, 다중 해상도 평가를 사용할 경우 DAVIS 2017 테스트-데브 세트에서 최고 88.5% J&F를 달성함을 확인하였다.
- 기존 최신 기술 수준 모델들(AOT-L, DeAOT-L, XMem)의 백본을 ConvMAE-Base로 교체하더라도, 동일한 훈련 설정과 합성 사전 훈련 없이도 JointFormer이 크게 앞서는 성능을 보였다.
- XMem 대비 1 프레임당 5.785K 파라미터로 메모리 소비를 줄였고, YouTube-VOS 2018에서 86.0% G를 유지함으로써 효율성 향상을 입증하였다.
- 기준 프레임 수를 3개에서 1개로 줄였을 때 성능 저하가 미미하게 나타나(YouTube-VOS 2018에서 87.6%에서 86.2%로 감소), 강건성과 더 빠른 추론 가능성을 보여주었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.