[논문 리뷰] TransVOS: Video Object Segmentation with Transformers
TransVOS는 단일한 두 경로 특징 추출기를 사용하여 공간적 및 시간적 관계를 동시에 모델링하는 비전 트랜스포머 기반 프레임워크를 제안하며, DAVIS 및 YouTube-VOS 벤치마크에서 SOTA 기법보다 2.4% 높은 전체 J&F 점수를 기록하면서도 파라미터 수를 20% 감소시켰다.
Recently, Space-Time Memory Network (STM) based methods have achieved state-of-the-art performance in semi-supervised video object segmentation (VOS). A crucial problem in this task is how to model the dependency both among different frames and inside every frame. However, most of these methods neglect the spatial relationships (inside each frame) and do not make full use of the temporal relationships (among different frames). In this paper, we propose a new transformer-based framework, termed TransVOS, introducing a vision transformer to fully exploit and model both the temporal and spatial relationships. Moreover, most STM-based approaches employ two separate encoders to extract features of two significant inputs, i.e., reference sets (history frames with predicted masks) and query frame (current frame), respectively, increasing the models' parameters and complexity. To slim the popular two-encoder pipeline while keeping the effectiveness, we design a single two-path feature extractor to encode the above two inputs in a unified way. Extensive experiments demonstrate the superiority of our TransVOS over state-of-the-art methods on both DAVIS and YouTube-VOS datasets.
연구 동기 및 목표
- 기존의 스페이스타임 메모리(STM) 기법이 비디오 객체 세분화에서 공간적 및 시간적 관계를 완전히 모델링하는 데에 한계가 있음을 해결한다.
- 참조 및 쿼리 입력을 위한 통합된 두 경로 특징 추출기를 도입하여 이중 인코더 아키텍처를 대체함으로써 모델 복잡도를 감소시킨다.
- 비전 트랜스포머의 자기주의 메커니즘을 활용하여 프레임 간 및 프레임 내에서 장거리 의존성을 포착함으로써 세분화 정확도를 향상시킨다.
- STM형 아키텍처에서 동적 메모리 업데이트가 저품질의 이력 마스크를 전파함으로써 성능 저하를 초래할 수 있음을 밝힌다.
- 파라미터 수나 추론 비용을 증가시키지 않으면서도 높은 성능을 유지하는 경량이면서도 효과적인 아키텍처를 확립한다.
제안 방법
- 참조 프레임(예측 마스크 포함)과 쿼리 프레임을 통합된 방식으로 처리하는 비전 트랜스포머 기반 아키텍처를 도입한다.
- RGB 프레임과 참조 프레임의 예측 마스크를 별도로 처리하는 두 경로 특징 추출기를 설계하여, 연결 또는 시아미즈 공유 없이도 파라미터 효율적인 융합을 가능하게 한다.
- 자기주의 어텐션을 활용한 트랜스포머 디코더를 적용하여 모든 픽셀 간의 의존성을 프레임 간 및 각 프레임 내에서 동시에 모델링함으로써 공간적 및 시간적 관계를 동시에 포착한다.
- 쿼리 프레임 특징과 참조 프레임 특징 간의 크로스 어텐션을 활용하여 전역적 맥락을 기반으로 정확한 세분화 마스크를 예측한다.
- 비전 트랜스포머 백본의 특징 맵을 활용하여 시간적 및 공간적 영역에 주목하는 어텐션 맵을 생성한다.
- 예측 마스크를 특징 추출기의 전용 경로에 직접 입력하여 마스크 왜곡 및 팯딩에 의한 비일치를 방지한다.
실험 결과
연구 질문
- RQ1독립적인 인코더에 의존하지 않고도 비전 트랜스포머가 비디오 객체 세분화에서 공간적 및 시간적 관계를 효과적으로 모델링할 수 있는가?
- RQ2기존의 이중 인코더 또는 시아미즈 아키텍처에 비해 통합된 두 경로 특징 추출기가 정확도 및 파라미터 효율성 측면에서 뛰어나다는가?
- RQ3트랜스포머 디코더의 포함이 STM 기반 모델의 표준 어텐션 모듈에 비해 마스크 예측 성능을 어떻게 향상시키는가?
- RQ4기본 프레임과 이전 프레임만을 참조 입력으로 사용하는 것과 비교해, 주기적으로 업데이트되는 동적 메모리 백업을 유지할 경우의 영향은 무엇인가?
- RQ5두 경로 아키텍처를 통해 예측 마스크를 RGB 특징과 직접 융합하는 것이 연결 또는 잔여 연결 방식보다 성능 향상에 기여하는가?
주요 결과
- TransVOS는 첫 번째 및 이전 프레임만을 참조로 사용하여 DAVIS 17 검증 세트에서 76.4%의 J&F 점수를 기록하며, STM을 2.4% 높게 기록했다.
- 두 경로 특징 추출기는 독립적인 이중 인코더 설정 대비 20%의 파라미터 감소를 이끌었고, J&F 점수는 7.8% 향상되었다.
- 두 경로 특징 추출기를 사용할 경우, 마스크를 인코딩된 특징과 직접 곱하는 것보다 J&F 점수에서 15.1% 향상되었다.
- 트랜스포머 디코더를 제거하면 J&F 점수가 1.2% 감소하여 최적 성능을 위해 필수임을 확인했다.
- STM에서처럼 매 5프레임마다 동적 메모리 업데이트를 수행할 경우, 저품질의 이력 예측이 전파되어 성능 저하가 발생했다.
- 제안된 방법은 KMN 및 CFBI보다 각각 0.4% 높은 전체 J&F 점수를 기록하여 벤치마크 데이터셋에서 뛰어난 일반화 및 강건성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.