Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting Temporal Relationships in Video Moment Localization with Natural Language

Songyang Zhang, Jinsong Su|arXiv (Cornell University)|2019. 08. 11.
Multimodal Machine Learning Applications참고 문헌 29인용 수 7
한 줄 요약

이 논문은 자연어 질의의 시간적 관계를 명시적으로 모델링하기 위해 트리 어텐션 기반 구조를 사용해 문장을 주요 사건, 맥락 사건, 시간 신호로 분해하는 시간적 조합 모듈러 네트워크(TCMN)를 제안한다. 이 방법은 시각적 유사성 매칭과 위치 유사성 매칭을 위한 별도의 모듈을 활용하며, RGB 및 옵티컬 플로우 특징을 사용한 네 개의 모델 앙상블을 통해 모odal 불일치를 다루어 TEMPO 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We address the problem of video moment localization with natural language, i.e. localizing a video segment described by a natural language sentence. While most prior work focuses on grounding the query as a whole, temporal dependencies and reasoning between events within the text are not fully considered. In this paper, we propose a novel Temporal Compositional Modular Network (TCMN) where a tree attention network first automatically decomposes a sentence into three descriptions with respect to the main event, context event and temporal signal. Two modules are then utilized to measure the visual similarity and location similarity between each segment and the decomposed descriptions. Moreover, since the main event and context event may rely on different modalities (RGB or optical flow), we use late fusion to form an ensemble of four models, where each model is independently trained by one combination of the visual input. Experiments show that our model outperforms the state-of-the-art methods on the TEMPO dataset.

연구 동기 및 목표

  • 기존 비디오 무릎 위치 지정 기술이 자연어 질의의 시간적 관계를 간과하는 한계를 해결하기 위해.
  • 질의를 주요 사건, 맥락 사건, 시간 신호 구성 요소로 분석함으로써 시간 언어의 조합적 구조를 모델링하기 위해.
  • 사건에 대한 시각적 유사성과 시간 신호에 대한 위치 유사성을 분리함으로써 교차 모odal 매칭을 향상시키기 위해.
  • 다른 이벤트가 RGB 또는 옵티컬 플로우에 의존할 수 있는 비디오 특징의 모달 불일치 문제를 해결하기 위해 RGB 및 옵티컬 플로우를 다른 조합으로 사용한 네 개의 모델 앙상블을 사용하기 위해.
  • 복잡한 질의에서 순차적 어텐션보다 구조적 파싱이 더 높은 성능을 내는지 입증하기 위해.

제안 방법

  • 트리 어텐션 네트워크를 사용해 입력 문장을 주요 사건, 맥락 사건, 시간 신호로 분해하고, 해당 구성을 위한 어휘 임베딩을 생성한다.
  • 두 가지 별도의 모듈이 매칭 점수를 계산한다: 주로 이벤트 임베딩과 비디오 세그먼트 간의 시각적 유사성에 대한 로케이션 모듈과, 시간 신호 임베딩과 세그먼트 경계 간의 위치 유사성에 대한 관계 모듈.
  • 네 개의 독립적으로 훈련된 모델을 후기 융합(late fusion) 방식으로 통합하며, 각 모델은 서로 다른 시각 입력 조합을 사용한다: (RGB, RGB), (RGB, Flow), (Flow, RGB), (Flow, Flow).
  • 시각적 유사성 모듈은 어텐션 기반 교차 모달 매칭을 통해 주요 사건 및 맥락 사건의 어휘 임베딩을 비디오 특징과 매칭한다.
  • 위치 유사성 모듈은 시간 신호 임베딩(예: 'before', 'after')을 비디오 세그먼트의 시간 경계와 매칭한다.
  • 최종 예측은 두 모듈의 출력을 합산하고, 네 개의 시각 입력 스트림에 대한 가중치 앙상블를 사용해 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1복잡한 문장에서 순차적 어텐션보다 시간 언어를 사건 및 신호 구성 요소로 구조적으로 파싱하는 것이 비디오 무릎 위치 지정 정확도를 향상시키는가?
  • RQ2사건에 대한 시각적 유사성과 시간 신호에 대한 위치 유사성을 분리하면 성능 향상이 이루어지는가?
  • RQ3RGB 및 옵티컬 플로우와 같은 다른 시각 모odal을 사용해 훈련된 모델의 앙상블이 비디오 무릎 위치 지정에서 모달 불일치 문제를 완화하는가?
  • RQ4제안된 트리 어텐션 기반 메커니즘이 복잡한 시간 질의를 다룰 때 표준 순차적 LSTM 기반 어텐션보다 우수한가?
  • RQ5TCMN의 개별 구성 요소(예: 관계 모듈, 어텐션 메커니즘)가 최종 성능에 얼마나 기여하는가?

주요 결과

  • 제안된 TCMN 모델은 기존 방법들인 MLLC 및 MLLC+conTEF를 능가하는 최신 기술 수준의 성능을 TEMPO 데이터셋에서 달성한다.
  • 시간 신호 유사성(예: 'before', 'after')을 모델링하는 관계 모듈이 성능 향상에 크게 기여하며, 추가 시 큰 성능 향상이 관찰된다.
  • (Flow, Flow) 입력을 사용한 모델이 가장 높은 단일 스트림 성능를 기록하여, 운동이나 카메라 이동을 포함한 많은 질의에서 운동 특징이 핵심임을 시사한다.
  • 모든 네 개의 시각 입력 조합을 통합한 전체 앙상블 모델은 두 개의 스트림만 사용한 모델보다 뛰어난 성능를 보이며, RGB와 옵티컬 플로우 특징이 상호 보완적임을 입증한다.
  • 1650만 개의 파라미터를 가진 'Ensemble TCMN (Small)' 모델이 1700만 개의 파라미터를 가진 SOTA 모델인 'MLLC+conTEF'를 능가함으로써, 성능 향상은 파arameter 수가 아닌 아키텍처 설계 덕분임을 시사한다.
  • 복잡한 문장에서 트리 어텐션 기반 메커니즘이 순차적 LSTM 기반 어텐션보다 뛰어난 성능를 보이며, 시간 언어의 구조적 관계를 효과적으로 인코딩할 수 있기 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.