Skip to main content
QUICK REVIEW

[논문 리뷰] Where Does It Exist: Spatio-Temporal Video Grounding for Multi-Form Sentences

Zhu Zhang, Zhou Zhao|arXiv (Cornell University)|2020. 01. 19.
Multimodal Machine Learning Applications참고 문헌 48인용 수 7
한 줄 요약

이 논문은 비정형 영상에서 문장의 형식이 다양한 객체 튜브를 정확하게 국소화하는 데 초점을 맞춘 새로운 과제인 다중형 문장에 대한 시공간 영상 기반 지정(Spatio-Temporal Video Grounding, STVG)을 제안한다. 저자들은 다중 단계의 이종 모달 그래프 추론 과정을 통해 암시적이고 명시적인 공간 관계와 시간적 동역학을 모델링하는 시공간 그래프 추론 네트워크(STGRN)를 제안하며, 튜브 사전 생성 없이도 새로운 대규모 데이터셋인 VidSTG에서 최신 기술 수준(SOTA) 성능을 달성하여 m_tIoU 47.64% 및 m_vIoU 18.96%를 기록한다.

ABSTRACT

In this paper, we consider a novel task, Spatio-Temporal Video Grounding for Multi-Form Sentences (STVG). Given an untrimmed video and a declarative/interrogative sentence depicting an object, STVG aims to localize the spatio-temporal tube of the queried object. STVG has two challenging settings: (1) We need to localize spatio-temporal object tubes from untrimmed videos, where the object may only exist in a very small segment of the video; (2) We deal with multi-form sentences, including the declarative sentences with explicit objects and interrogative sentences with unknown objects. Existing methods cannot tackle the STVG task due to the ineffective tube pre-generation and the lack of object relationship modeling. Thus, we then propose a novel Spatio-Temporal Graph Reasoning Network (STGRN) for this task. First, we build a spatio-temporal region graph to capture the region relationships with temporal object dynamics, which involves the implicit and explicit spatial subgraphs in each frame and the temporal dynamic subgraph across frames. We then incorporate textual clues into the graph and develop the multi-step cross-modal graph reasoning. Next, we introduce a spatio-temporal localizer with a dynamic selection method to directly retrieve the spatio-temporal tubes without tube pre-generation. Moreover, we contribute a large-scale video grounding dataset VidSTG based on video relation dataset VidOR. The extensive experiments demonstrate the effectiveness of our method.

연구 동기 및 목표

  • 객체가 짧게만 나타나고 구별하기 어려운 비정형 영상에서 시공간 객체 튜브를 국소화하는 과제를 해결한다.
  • 명시적인 객체를 포함한 서술문장과 알려지지 않은 객체를 포함한 의문문장 모두에 대한 기반을 가능하게 하여 관계 추론이 필요하다.
  • 튜브 사전 생성에 의존하고 객체 관계 및 시간적 동역학을 모델링하지 못하는 기존 방법의 한계를 극복한다.
  • 사전에 생성된 후보 없이 직접 튜브를 검색하는 통합 프레임워크를 제안하여 정확도와 강인성을 향상시킨다.
  • 연구를 지원하기 위해 VidOR 기반의 대규모 벤치마크 데이터셋인 VidSTG를 기여한다.

제안 방법

  • 각 프레임 내의 암시적 및 명시적 공간 부분그래프와 프레임 간의 시간적 동적 부분그래프를 포함하는 시공간 영역 그래프를 구축하여 객체의 운동과 상호작용을 모델링한다.
  • 이종 모달 융합을 통해 텍스트 정보를 그래프에 통합하여 시각적 및 언어적 표현에 대한 다단계 추론을 가능하게 한다.
  • 그래프를 통해 특징을 전파하여 고차원 관계(예: '남자가 빨간 모자를 쓴 아기를 안는다')를 모델링하는 다단계 이종 모달 그래프 추론을 수행한다.
  • 사전에 생성된 후보에 의존하지 않고 가장 관련성이 높은 시공간 튜브를 직접 예측할 수 있는 동적 선택 메커니즘을 갖춘 시공간 로컬라이저를 설계한다.
  • 관계 모델링와 특징 스무딩 간의 균형을 맞추기 위해 학습 가능한 층을 갖춘 그래프 컨volution 네트워크를 사용하며, 최적의 층 수는 T=2이며, 과도한 층 수는 특징 과도화를 유도한다.
  • 튜브 선택 과정에 동적 스무딩 전략을 적용하여 탐욕적 선택 방법보다 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1그래프 기반 방법이 비정형 영상에서 공간 관계와 시간적 동역학을 효과적으로 모델링하여 정확한 시공간 기반을 달성할 수 있는가?
  • RQ2다단계 이종 모달 추론은 알려지지 않은 객체를 포함한 의문문장의 기반 성능을 어떻게 향상시키는가?
  • RQ3튜브 사전 생성을 제거함으로써 장시간 비정형 영상에서 국소화 정확도가 얼마나 향상되는가?
  • RQ4시공간 그래프 내에서 암시적 공간 부분그래프, 명시적 공간 부분그래프 및 시간 부분그래프가 전체 성능에 기여하는 정도는 어떠한가?
  • RQ5그래프 컨volution 층의 수가 복잡한 객체 관계와 동역학을 포착하는 데 모델의 능력에 어떤 영향을 미치는가?

주요 결과

  • 전체 STGRN 모델은 VidSTG 데이터셋에서 m_tIoU 47.64% 및 m_vIoU 18.96%를 달성하여 모든 베이스라인보다 서술문장과 의문문장 모두에서 뛰어난 성능을 보였다.
  • 제거 실험을 통해 암시적 공간, 명시적 공간, 시간적 동적 부분그래프 모두가 필수적임을 확인하였으며, 특히 명시적 공간 부분그래프가 가장 큰 기여를 하였다.
  • 명시적 공간 부분그래프와 시간적 동적 부분그래프를 포함한 모델(G_exp + G_tem)은 m_tIoU 47.12% 및 m_vIoU 18.28%를 기록하여 시공간 모델링의 핵심적 역할을 입증하였다.
  • 최적의 그래프 컨볼루션 층 수는 T=2이며, 더 깊은 네트워크에서는 특징 과도화로 인해 성능 저하가 발생하였다.
  • 동적 선택 방법은 탐욕적 선택보다 우수하여 m_tIoU를 0.92% 향상시키고 m_vIoU를 0.68% 향상시켜 튜브 품질 제어의 효과성을 입증하였다.
  • 정성적 결과는 주의 히트맵이 의미론적 영역과 단어와 잘 일치함을 보여주어 모델이 관련된 시각-언어적 단서에 주의를 기울일 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.