Skip to main content
QUICK REVIEW

[논문 리뷰] Language as Queries for Referring Video Object Segmentation

Jiannan Wu, Yi Jiang|arXiv (Cornell University)|2022. 01. 03.
Advanced Image and Video Retrieval Techniques인용 수 5
한 줄 요약

이 논문은 언어 기술을 동적 쿼리로 간주하여 비디오 프레임 내에서 참조된 객체를 직접 주시하고 분할하는 통합형 트랜스포머 기반 프레임워크인 ReferFormer을 제안한다. 언어 입력에 기반한 객체 쿼리를 조건화시킴으로써, 최첨단 성능을 기록하는 엔드 투 엔드 분할 및 추적을 가능하게 하며, Swin-Large 백본을 사용할 경우 Ref-Youtube-VOS에서 64.2 J&F를 달성한다.

ABSTRACT

Referring video object segmentation (R-VOS) is an emerging cross-modal task that aims to segment the target object referred by a language expression in all video frames. In this work, we propose a simple and unified framework built upon Transformer, termed ReferFormer. It views the language as queries and directly attends to the most relevant regions in the video frames. Concretely, we introduce a small set of object queries conditioned on the language as the input to the Transformer. In this manner, all the queries are obligated to find the referred objects only. They are eventually transformed into dynamic kernels which capture the crucial object-level information, and play the role of convolution filters to generate the segmentation masks from feature maps. The object tracking is achieved naturally by linking the corresponding queries across frames. This mechanism greatly simplifies the pipeline and the end-to-end framework is significantly different from the previous methods. Extensive experiments on Ref-Youtube-VOS, Ref-DAVIS17, A2D-Sentences and JHMDB-Sentences show the effectiveness of ReferFormer. On Ref-Youtube-VOS, Refer-Former achieves 55.6J&F with a ResNet-50 backbone without bells and whistles, which exceeds the previous state-of-the-art performance by 8.4 points. In addition, with the strong Swin-Large backbone, ReferFormer achieves the best J&F of 64.2 among all existing methods. Moreover, we show the impressive results of 55.0 mAP and 43.7 mAP on A2D-Sentences andJHMDB-Sentences respectively, which significantly outperforms the previous methods by a large margin. Code is publicly available at https://github.com/wjn922/ReferFormer.

연구 동기 및 목표

  • 참조 비디오 객체 분할(R-VOS)에서 기존 이중 스트림 파이프라인의 한계를 해결하기 위해 복잡한 다단계 설계와 최적화되지 않은 다중 모odal 추론을 개선한다.
  • 하향식 방법에서의 명시적 인스턴스 수준의 지도 학습 부족과 환경 변화에 대한 낮은 일반화 능력을 극복한다.
  • 조건부 어텐션을 통해 프레임 간에 쿼리를 자연스럽게 연결함으로써 후처리 추적의 필요성을 제거한다.
  • 비디오와 언어 입력만을 사용하여 객체를 동시에 검출하고 분할하며 추적하는 통합형 엔드 투 엔드 프레임워크를 개발한다.

제안 방법

  • 입력 언어 표현에 기반한 조건부로 학습 가능한 소규모 객체 쿼리를 도입하여, 참조된 객체에만 주시하도록 제한한다.
  • 이러한 조건부 쿼리를 동적 커널으로 사용하여 새로운 동적 커널 메커니즘을 통해 특징 맵을 필터링하고 분할 마스크를 생성한다.
  • 다양한 스케일에서 정교한 시각-언어 특징 상호작용을 가능하게 하는 교차 모odal 특징 피라미드 네트워크(CM-FPN)를 설계한다.
  • 분류, 바운딩 박스, 마스크 매칭 비용을 사용한 쿼리 기반 레이블 할당 전략을 도입하여 객체 기반을 최적화한다.
  • 인스턴스 매칭을 통해 프레임 간에 해당하는 쿼리를 연결하여 후처리 없이도 엔드 투 엔드 비디오 객체 추적을 달성한다.
  • 단일 순방향 전파에서 분할 마스크, 검출 박스, 분류 스코어를 생성하기 위해 트랜스포머 기반 디코더를 활용한다.

실험 결과

연구 질문

  • RQ1언어를 직접 비디오 프레임 내에서 참조된 객체를 향한 주시를 이끄는 쿼리로 사용할 수 있는가? 이는 R-VOS 파이프라인을 단순화할 수 있는가?
  • RQ2조건부 쿼리를 기반으로 한 통합형 엔드 투 엔드 프레임워크가 기존의 이단계 또는 하향식 접근 방식보다 정확도와 효율성 면에서 뛰어나게 성능을 내는가?
  • RQ3유사한 객체가 많은 복잡한 환경에서 조건부 쿼리의 수가 성능과 견고성에 어떤 영향을 미치는가?
  • RQ4교차 모달 특징 융합이 가림이나 조명 변화와 같은 도전적인 시각 조건에서 분할 성능을 얼마나 향상시키는가?
  • RQ5후처리 없이도 프레임 간 쿼리 연결을 통해 자연스럽게 객체 추적을 달성할 수 있는가?

주요 결과

  • ResNet-50 백본을 사용할 경우 ReferFormer은 Ref-Youtube-VOS에서 55.6 J&F를 기록하여 이전 최고 성능보다 8.4 포인트 뛰어나다.
  • Swin-Large 백본을 사용할 경우 ReferFormer은 Ref-Youtube-VOS에서 64.2 J&F를 달성하여 새로운 최첨단 성능을 수립한다.
  • A2D-Sentences에서는 55.0 mAP를 기록하여 이전 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • JHMDB-Sentences에서는 43.7 mAP를 기록하여 액션 중심의 참조 표현에 대한 강력한 일반화 능력을 입증했다.
  • 절단 실험 결과, 5개의 조건부 쿼리를 사용할 경우 최적의 성능를 기록하며, 이 수치를 초과할 경우 레이블 할당 불균형으로 인해 성능 저하가 발생함을 확인했다.
  • 학습 클립 프레임 수를 1에서 5로 늘일 경우 J&F가 5.0 포인트 향상되어 시간적 모델링의 중요성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.