[논문 리뷰] Fully Transformer-Equipped Architecture for End-to-End Referring Video Object Segmentation
이 논문은 참조 비디오 객체 분할(RVOS) 작업을 개체별 마스크 예측으로 간주하는 완전한 엔드 투 엔드 트랜스포머 기반 아키텍처인 FTEA를 제안한다. 이는 스택드 트랜스포머를 사용하여 다양성 정규화를 적용한 개체 특징을 디코딩하며, A2D Sentences에서 45.1% mAP, J-HMDB Sentences에서 38.7% mAP, Ref-YouTube-VOS에서 56.6% J&F를 기록하여 최신 기준 성능을 달성한다.
Referring Video Object Segmentation (RVOS) requires segmenting the object in video referred by a natural language query. Existing methods mainly rely on sophisticated pipelines to tackle such cross-modal task, and do not explicitly model the object-level spatial context which plays an important role in locating the referred object. Therefore, we propose an end-to-end RVOS framework completely built upon transformers, termed extit{Fully Transformer-Equipped Architecture} (FTEA), which treats the RVOS task as a mask sequence learning problem and regards all the objects in video as candidate objects. Given a video clip with a text query, the visual-textual features are yielded by encoder, while the corresponding pixel-level and word-level features are aligned in terms of semantic similarity. To capture the object-level spatial context, we have developed the Stacked Transformer, which individually characterizes the visual appearance of each candidate object, whose feature map is decoded to the binary mask sequence in order directly. Finally, the model finds the best matching between mask sequence and text query. In addition, to diversify the generated masks for candidate objects, we impose a diversity loss on the model for capturing more accurate mask of the referred object. Empirical studies have shown the superiority of the proposed method on three benchmarks, e.g., FETA achieves 45.1% and 38.7% in terms of mAP on A2D Sentences (3782 videos) and J-HMDB Sentences (928 videos), respectively; it achieves 56.6% in terms of $\mathcal{J\&F}$ on Ref-YouTube-VOS (3975 videos and 7451 objects). Particularly, compared to the best candidate method, it has a gain of 2.1% and 3.2% in terms of P$@$0.5 on the former two, respectively, while it has a gain of 2.9% in terms of $\mathcal{J}$ on the latter one.
연구 동기 및 목표
- 참조 비디오 객체 분할(RVOS)에서 기존의 픽셀 단위 분류 방법이 개체 수준의 공간 관계를 모델링하는 데 한계를 가진다는 문제를 해결한다.
- 이전 방법들이 복잡한 장면에서 상대적 개체 위치와 상호작용을 명시적으로 모델링하지 못하는 실패를 극복한다.
- 오직 트랜스포머만을 사용하여 시각적 및 텍스처 특징 인코딩, 다중 모odal 정렬, 마스크 디코딩을 통합하는 완전한 엔드 투 엔드 프레임워크를 개발한다.
- 각각의 개별 엔티티로 후보 개체를 명시적으로 모델링하고 전용 디코딩 전략을 적용하여 마스크의 다양성과 정확도를 향상시킨다.
- 객체 외형 변화, 가림, 저조도 조건과 같은 어려운 상황에서의 더 나은 일반화를 가능하게 한다.
제안 방법
- 모든 구성 요소(시각 인코더, 텍스트 인코더, 다중 모달 정렬, 마스크 디코더)에 순수한 트랜스포머를 사용하여 CNN과 RNN을 대체하는 완전한 트랜스포머 기반 아키텍처(FTEA)를 제안한다.
- 스택드 어텐션과 피드포워드 레이어를 통해 프레임 특징을 처리하여 개체 특징 맵을 생성하는 스택드 트랜스포머 기반 마스크 디코더를 도입한다.
- 스택드 어텐션(SA)과 스택드 피드포워드 네트워크(SFFN)를 사용한 점진적 개체 학습 전략을 적용하여 비디오 프레임 간의 장거리 시공간 의존성을 모델링한다.
- 각 후보 개체의 특징 표현을 향상시키면서도 공간적 맥락을 유지하기 위해 디코더에서 동적 컨볼루션을 구현한다.
- 후보 개체 간에 서로 다른 마스크 예측을 유도하기 위해 훈련 중에 다양성 손실을 도입하여 마스크 품질 향상과 개체 식별 성능 향상을 도모한다.
- 픽셀 수준의 표현과 단어 수준의 표현 간의 의미 유사도 매칭을 통해 시각적 및 텍스처적 특징을 정렬하여 정확한 다중 모달 기반을 확보한다.
실험 결과
연구 질문
- RQ1완전한 트랜스포머 기반 아키텍처가 하이브리드 CNN-RNN 파이프라인보다 엔드 투 엔드 참조 비디오 객체 분할에서 성능을 뛰어넘을 수 있는가?
- RQ2모든 후보 개체에 대해 마스크를 생성하는 개체 기반 분류 작업으로 RVOS를 모델링하는 것이 픽셀 기반 분류 대비 성능 향상을 이끌 수 있는가?
- RQ3스택드 트랜스포머가 비디오 시퀀스에서 개체 수준의 공간적 맥락과 장거리 시간적 의존성을 효과적으로 포착할 수 있는가?
- RQ4예측 마스크에 다양성을 강제 적용할 경우, 특히 여러 개체가 유사하거나 겹치는 경우에 참조된 개체 식별에 어떤 영향을 미치는가?
- RQ5제안된 방법이 저조도, 개체 가림, 외형 변화와 같은 어려운 시각 조건에 얼마나 잘 일반화되는가?
주요 결과
- A2D Sentences에서 FTEA는 45.1% mAP를 기록하며, 최고의 베이스라인 대비 P@0.5에서 2.1% 향상되어 다양한 참조 표현에 대한 강력한 일반화 능력을 입증한다.
- J-HMDB Sentences에서는 38.7% mAP를 달성하여 가장 강력한 이전 방법 대비 P@0.5에서 3.2% 향상되며, 복잡한 인간-객체 상호작용에 대한 강건성을 보여준다.
- Ref-YouTube-VOS에서는 56.6% J&F를 기록하며, 최고의 베이스라인 대비 2.9% 향상되어 대규모이고 다양한 비디오 데이터셋에서의 효과성을 입증한다.
- 절단 실험 결과 다양성 손실이 마스크 품질 향상과 개체 식별 능력 향상에 크게 기여하며, 특히 겹치거나 유사한 외형을 가진 개체가 있는 장면에서 두드러진다.
- 실패 사례 분석 결과, 작은 크기나 낮은 대비를 가진 개체(예: 새의 부리, 어두운 빛에서의 고양이)의 분할에 한계가 있음을 확인하여 세밀한 윤곽 예측 향상 여지가 있음을 시사한다.
- 모델 성능은 개체 외형 변화와 가림에 민감하게 반응하므로, 향후 연구는 상관관계 추론과 모델 압축에 초점을 맞추어야 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.