[논문 리뷰] Embracing Consistency: A One-Stage Approach for Spatio-Temporal Video Grounding
이 논문은 특징 정렬과 예측 일관성 문제를 해결하기 위해 일관성 인식 목적함수로 전역 다중모달 템플릿을 도입한 one-stage end-to-end transformer 프레임워크인 STCAT을 제안한다. 이 방법은 통합된 비디오-텍스트 모델링과 시간 상호작용 레이어를 갖춘 인코더-디코더 아키텍처를 사용하며, VidSTG 및 HC-STVG 벤치마크에서 각각 33.14% 및 30.09%의 m_vIoU 향상으로 최신 기술 수준을 달성한다.
Spatio-Temporal video grounding (STVG) focuses on retrieving the spatio-temporal tube of a specific object depicted by a free-form textual expression. Existing approaches mainly treat this complicated task as a parallel frame-grounding problem and thus suffer from two types of inconsistency drawbacks: feature alignment inconsistency and prediction inconsistency. In this paper, we present an end-to-end one-stage framework, termed Spatio-Temporal Consistency-Aware Transformer (STCAT), to alleviate these issues. Specially, we introduce a novel multi-modal template as the global objective to address this task, which explicitly constricts the grounding region and associates the predictions among all video frames. Moreover, to generate the above template under sufficient video-textual perception, an encoder-decoder architecture is proposed for effective global context modeling. Thanks to these critical designs, STCAT enjoys more consistent cross-modal feature alignment and tube prediction without reliance on any pre-trained object detectors. Extensive experiments show that our method outperforms previous state-of-the-arts with clear margins on two challenging video benchmarks (VidSTG and HC-STVG), illustrating the superiority of the proposed framework to better understanding the association between vision and natural language. Code is publicly available at https://github.com/jy0205/STCAT.
연구 동기 및 목표
- 기존 two-stage 및 one-stage STVG 방법에서의 일관성 문제, 특히 프레임 간 특징 정렬 및 예측 일관성 문제를 해결하기 위해.
- 사전 훈련된 객체 검출기 의존도를 제거하고, 전역 비디오-텍스트 컨텍스트를 활용한 end-to-end 학습을 가능하게 하기 위해.
- 통합적이고 학습 가능한 다중모달 템플릿을 통해 시간적 일관성 모델링을 통해 정렬 정확도를 향상시키기 위해.
- 통합된 인코더-디코더 프레임워크에서 전역 비디오 및 텍스트 표현을 융합하여 다중모달 정렬을 향상시키기 위해.
제안 방법
- 통합된 프레임워드 예측을 위한 공유 콘텐츠 항목과 프레임별 위치 항목으로 구성된 새로운 다중모달 템플릿을 도입하여 프레임 간 일관성 있는 예측을 유도한다.
- 장거리 비디오-텍스트 상호작용을 모델링하기 위해 교차모달 시공간 인코더를 갖춘 인코더-디코더 트랜스포머 아키텍처를 활용한다.
- 전역 비디오 컨텍스트를 집계하고 특징 정렬을 향상시키기 위해 인코더에 시간 상호작용 레이어를 통합한다.
- 디코더에서 가용 가능한 쿼리 메커니즘을 사용하며, 전역 템플릿은 콘텐츠 쿼리로, 국소 템플릿은 프레임별 정렬을 위한 위치 쿼리로 기능한다.
- 객체 검출기를 사용하지 않고, 원시 비디오 및 텍스트에서 직접 시공간 튜브를 회귀하는 end-to-end 훈련 프레임워크를 채택한다.
- 예측의 시간적 의미 일관성을 보장하기 위해 비디오 수준의 교차 어텐션을 활용한다.
실험 결과
연구 질문
- RQ1비디오 프레임 간 일관된 특징 정렬을 보장함으로써 시공간 비디오 거시정렬을 어떻게 향상시킬 수 있는가?
- RQ2통합적이고 학습 가능한 템플릿 메커니즘이 one-stage STVG 모델의 예측 일관성 문제를 줄일 수 있는가?
- RQ3사전 훈련된 객체 검출기를 사용하지 않고도 전역 비디오 컨텍스트를 모델링함으로써 정렬 성능 향상에 어느 정도 기여하는가?
- RQ4전역 및 국소 템플릿의 통합이 튜브 예측의 강건성과 정확도에 어떤 영향을 미치는가?
주요 결과
- STCAT는 VidSTG 벤치마크에서 기존 최신 기술보다 명확한 격차로 33.14%의 새로운 최고 성능 m_vIoU를 달성한다.
- 더 어려운 HC-STVG 벤치마크에서는 30.09%의 m_vIoU를 기록하여 이전 최고 성능인 23.50%를 크게 뛰어넘었다.
- 제거 실험 결과 전역 및 국소 템플릿 메커니즘이 모두 필수적임을 확인하였으며, 국소 템플릿이 성능 향상에 더 큰 기여를 하였다 (+1.64% m_vIoU).
- 시간 상호작용 레이어를 제거할 경우 성능이 크게 저하됨 (31.12% m_vIoU 대비 33.14%), 이는 전역 컨텍스트 모델링에서의 중요성을 입증한다.
- 정성적 결과에서 STCAT는 특히 장거리 및 복잡한 비디오 시나리오에서 STVGBert보다 더 정확하고 일관성 있는 시공간 튜브를 생성하는 것으로 나타났다.
- 전역 컨텍스트 인식과 일관성 메커니즘 덕분에 다수의 후보가 존재하는 상황에서도 정확한 인스턴스를 성공적으로 국소화하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.