Skip to main content
QUICK REVIEW

[논문 리뷰] Spatio-Temporal Scene Graphs for Video Dialog.

Shijie Geng, Peng Gao|arXiv (Cornell University)|2020. 07. 08.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 비디오 대화 시스템의 성능을 향상시키기 위해 시간적·공간적 시나리오 그래프 표현(STSGR)을 제안한다. 이는 비디오 프레임 간의 미세한 시각적 영역과 그 상호작용을 모델링함으로써 이루어지며, 내부 그래프 추론과 외부 그래프 간 시간적 집계, 그리고 의미 기반 제어의 트랜스포머를 결합하여 AVSD 벤치마크에서 최신 기술 수준의 성능을 달성한다. 기존 방법 대비 인간 평가에서 12%의 상대적 향상을 기록한다.

ABSTRACT

The Audio-Visual Scene-aware Dialog (AVSD) task requires an agent to indulge in a natural conversation with a human about a given video. Specifically, apart from the video frames, the agent receives the audio, brief captions, and a dialog history, and the task is to produce the correct answer to a question about the video. Due to the diversity in the type of inputs, this task poses a very challenging multimodal reasoning problem. Current approaches to AVSD either use global video-level features or those from a few sampled frames, and thus lack the ability to explicitly capture relevant visual regions or their interactions for answer generation. To this end, we propose a novel spatio-temporal scene graph representation (STSGR) modeling fine-grained information flows within videos. Specifically, on an input video sequence, STSGR (i) creates a two-stream visual and semantic scene graph on every frame, (ii) conducts intra-graph reasoning using node and edge convolutions generating visual memories, and (iii) applies inter-graph aggregation to capture their temporal evolutions. These visual memories are then combined with other modalities and the question embeddings using a novel semantics-controlled multi-head shuffled transformer, which then produces the answer recursively. Our entire pipeline is trained end-to-end. We present experiments on the AVSD dataset and demonstrate state-of-the-art results. A human evaluation on the quality of our generated answers shows 12% relative improvement against prior methods.

연구 동기 및 목표

  • 비디오 대화에서 시각적, 听각적, 언어적 입력을 이해하여 질문에 답할 수 있도록 하는 다모odal 추론의 과제를 해결한다.
  • 기존 방법이 전반적인 비디오 특징이나 희소한 프레임 샘플링에 의존하여 미세한 시각적 상호작용을 모델링하지 못하는 한계를 극복한다.
  • 비디오 프레임 간의 시각적 영역 간 공간적 관계와 그 시간적 변화를 명시적으로 모델링하는 표현 방식을 개발한다.
  • 시각적, 청각적, 캡션, 대화 기록, 질문 임베딩을 융합하여 답변 생성을 위한 통합 아키텍처를 엔드 투 엔드로 학습할 수 있도록 한다.
  • 시각적 장면에 대한 구조적 추론과 향상된 다중모odal 어텐션 메커니즘을 통해 답변 품질을 향상시킨다.

제안 방법

  • 각 비디오 프레임에 대해 시각적 및 의미적 시나리오 그래프를 이원(stream)으로 구성하여, 시각적 공간과 언어적 공간에서 객체와 그 관계를 인코딩한다.
  • 각 프레임의 그래프 내에서 노드 및 에지 컨볼루션을 적용하여 내부 그래프 추론을 수행하고 동적 시각 기억을 생성한다.
  • 연속된 프레임 간의 외부 그래프 집계를 수행하여 시각적 관계와 장면의 시간적 변화를 모델링한다.
  • 수신한 시각 기억을 청각, 캡션, 대화 기록, 질문 임베딩과 의미 기반 제어의 다중헤드 셔플드 트랜스포머를 통해 통합한다.
  • 다중모달 컨텍스트에 의해 유도되는 재귀적 디코딩을 통해 트랜스포머를 사용해 답변을 토큰 단위로 생성한다.
  • 표준 비디오 대화 손실 함수를 사용하여 전체 파이프라인을 엔드 투 엔드로 학습한다.

실험 결과

연구 질문

  • RQ1구조화된 시공간 시나리오 그래프 표현 방식이 비디오 대화 시스템의 다모달 추론을 향상시킬 수 있는가?
  • RQ2내부 그래프 컨볼루션 추론이 개별 프레임 내의 국소적 시각적 관계를 얼마나 효과적으로 포착할 수 있는가?
  • RQ3외부 그래프 간 시간적 집계가 비디오 프레임 간 장면의 동적 변화를 얼마나 잘 모델링하는가?
  • RQ4의미 기반 제어의 다중헤드 셔플드 트랜스포머가 다중모달 입력을 더 잘 정렬함으로써 답변 생성을 향상시키는가?
  • RQ5제안된 방법이 AVSD 벤치마크에서 측정 가능한 인간 평가 향상과 함께 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 제안된 STSGR 모델은 AVSD 벤치마크에서 최신 기술 수준의 성능을 달성하여 이전 방법들을 능가한다.
  • 인간 평가 결과, 최고의 이전 방법 대비 답변 품질에서 12%의 상대적 향상을 기록한다.
  • 모델는 비디오 장면 내의 공간적 관계와 시간적 동적 변화를 추론하는 데 뛰어난 능력을 보인다.
  • 내부 및 외부 그래프 추론을 통한 시각 기억 통합은 더 정확하고 맥락에 부합하는 답변을 이끌어낸다.
  • 의미 기반 제어의 다중헤드 셔플드 트랜스포머는 다중모달 입력을 효과적으로 융합하고 답변의 일관성을 향상시킨다.
  • 전체 파이프라인의 엔드 투 엔드 학습은 공동 표현 학습 과정의 최적화를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.