Skip to main content
QUICK REVIEW

[논문 리뷰] Expression Prompt Collaboration Transformer for Universal Referring Video Object Segmentation

Jiajun Chen, Jiacheng Lin|arXiv (Cornell University)|2023. 08. 08.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 참조 비디오 객체 분할을 위한 유니버설 트랜스포머 기반 아키텍처인 EPCFormer을 제안한다. 이는 음성 및 텍스트 프롬프트를 동시에 처리하며, 대비 학습을 통한 표현 정렬 및 교차 모odal 융합을 위한 표현-시각 주의 메커니즘을 도입하여 Referring Video Object Segmentation (R-VOS) 및 Audio-guided Video Object Segmentation (A-VOS) 벤치마크에서 최신 기술 수준의 성능을 달성한다. Ref-Youtube-VOS에서 J&F 점수는 55.6%이며, A-Youtube-VOS에서는 53.7%를 기록한다.

ABSTRACT

Audio-guided Video Object Segmentation (A-VOS) and Referring Video Object Segmentation (R-VOS) are two highly related tasks that both aim to segment specific objects from video sequences according to expression prompts. However, due to the challenges of modeling representations for different modalities, existing methods struggle to strike a balance between interaction flexibility and localization precision. In this paper, we address this problem from two perspectives: the alignment of audio and text and the deep interaction among audio, text, and visual modalities. First, we propose a universal architecture, the Expression Prompt Collaboration Transformer, herein EPCFormer. Next, we propose an Expression Alignment (EA) mechanism for audio and text. The proposed EPCFormer exploits the fact that audio and text prompts referring to the same objects are semantically equivalent by using contrastive learning for both types of expressions. Then, to facilitate deep interactions among audio, text, and visual modalities, we introduce an Expression-Visual Attention (EVA) module. The knowledge of video object segmentation in terms of the expression prompts can seamlessly transfer between the two tasks by deeply exploring complementary cues between text and audio. Experiments on well-recognized benchmarks demonstrate that our EPCFormer attains state-of-the-art results on both tasks. The source code will be made publicly available at https://github.com/lab206/EPCFormer.

연구 동기 및 목표

  • 다중 모달 참조 비디오 객체 분할에서 상호작용의 유연성과 고정밀도 국소화 사이의 균형을 맞추는 데 도전한다.
  • 동일한 아키텍처 내에서 텍스트 및 음성 기반 분할 간의 원활한 지식 전이를 가능하게 하기 위해 두 모달리티를 통합한다.
  • 동일한 객체를 나타내는 음성 및 텍스트 표현 간의 의미 정렬을 대비 학습을 통해 향상시킨다.
  • 새로운 주의 메커니즘을 통해 음성, 텍스트, 시각적 특징 간의 깊고 조합 가능한 상호작용을 촉진한다.
  • 공유된 다중 작업 학습 프레임워크를 사용하여 R-VOS 및 A-VOS 작업 모두에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 텍스트 및 음성 참조 표현을 통합된 네트워크에서 처리하는 유니버설 트랜스포머 기반 아키텍처인 EPCFormer을 제안한다.
  • 선형 투영 이후 공통의 다중 모달 임베딩 공간에서 음성 및 텍스트 특징을 정렬하는 대비 학습 기반 메커니즘인 표현 정렬(Expressive Alignment, EA)을 도입한다.
  • 표현-시각 상호작용(Expressive-Visual Interaction, EVI) 모듈과 음성-텍스트 협업(Audio-Text Collaboration, ATC) 모듈로 구성된 표현-시각 주의(Expressive-Visual Attention, EVA)를 설계하여 음성, 텍스트, 시각적 특징의 깊고 조합 가능한 융합을 가능하게 한다.
  • R-VOS 및 A-VOS를 동시에 최적화하는 다중 작업 학습 전략을 활용하여 두 작업 간의 지식 전이를 가능하게 한다.
  • 음성 전용 및 텍스트 전용 두 개의 분기 경로를 사용하며, 공유된 시각 인코더와 교차 주의 메커니즘을 통해 모달리티를 동적으로 융합한다.
  • 세분화 및 표현 대비 학습을 조합한 가중 손실을 최적화하며, 초모델 분석을 통해 최적 설정은 2개의 MLP 레이어와 λ_expr = 1임을 확인한다.

실험 결과

연구 질문

  • RQ1공유된 파rameter를 사용하는 통합 아키텍처가 텍스트 및 음성 기반 참조 비디오 객체 분할을 효과적으로 처리할 수 있는가?
  • RQ2동일한 객체를 나타내는 음성 및 텍스트 표현이 다중 모달 임베딩 공간에서 의미적으로 정렬될 수 있는가?
  • RQ3음성, 텍스트, 시각적 특징 간의 깊고 조합 가능한 상호작용을 정밀한 분할을 위해 최적의 방식으로 구현할 수 있는가?
  • RQ4R-VOS 및 A-VOS 양쪽 작업에 동시에 다중 작업 학습을 적용할 경우 단일 작업 기반 베이스라인 대비 일반화 능력과 성능 향상이 이루어지는가?
  • RQ5MLP 깊이 및 대비 손실 가중치와 같은 아키텍처 구성 요소가 모델 성능에 미치는 영향은 어떠한가?

주요 결과

  • EPCFormer는 Ref-Youtube-VOS 벤치마크에서 55.6%의 J&F 점수를 기록하여 R-VOS 분야에서 새로운 최신 기술 수준을 확립한다.
  • A-Youtube-VOS 벤치마크에서 EPCFormer는 53.7%의 J&F 점수를 기록하여 A-VOS 분야에서 보고된 바 가장 높은 성능을 기록한다.
  • 2개의 MLP 레이어와 대비 손실 가중치 λ_expr = 1를 사용한 모델이 최적의 성능을 보이며, 1, 3, 또는 4개의 레이어를 사용한 구성보다 뛰어난 성능을 보인다.
  • 음성 및 텍스트 입력을 결합한 다중 작업 학습이 가장 높은 성능을 내며, R-VOS 및 A-VOS 간 효과적인 지식 전이가 이루어짐을 시사한다.
  • 제거 실험 결과, 표현 정렬(Expressive Alignment, EA) 및 표현-시각 주의(Expressive-Visual Attention, EVA) 모듈이 성능 향상에 핵심적인 역할을 하며, 제거된 변형 대비 뚜렷한 성능 향상이 확인된다.
  • 두 모달리티를 모두 사용할 경우 J, F, J&F 지표에서 일관된 향상이 나타나 모델의 강건성과 일반화 능력이 뛰어나다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.