Skip to main content
QUICK REVIEW

[논문 리뷰] Video2Commonsense: Generating Commonsense Descriptions to Enrich Video Captioning

Zhiyuan Fang, Tejas Gokhale|arXiv (Cornell University)|2020. 03. 11.
Multimodal Machine Learning Applications참고 문헌 55인용 수 5
한 줄 요약

이 논문은 영상에서 직접 공통지식적 서술(의도, 영향, 속성)을 생성하는 새로운 프레임워크인 Video2Commonsense(V2C)를 소개한다. 이는 사실 기반 캡션을 풍부하게 하기 위한 것이다. V2C-Transformer 모델과 약 9,000개의 인간 레이블이 부여된 영상으로 구성된 새로운 데이터셋을 사용하여, 추상적인 공통지식적 추론을 시각적 입력에 기반시킴으로써 영상 이해를 향상시킨다. 이는 캡션 작성 및 개방형 영상 질의응답 작업 모두에서 성공적으로 입증되었다.

ABSTRACT

Captioning is a crucial and challenging task for video understanding. In videos that involve active agents such as humans, the agent's actions can bring about myriad changes in the scene. Observable changes such as movements, manipulations, and transformations of the objects in the scene, are reflected in conventional video captioning. Unlike images, actions in videos are also inherently linked to social aspects such as intentions (why the action is taking place), effects (what changes due to the action), and attributes that describe the agent. Thus for video understanding, such as when captioning videos or when answering questions about videos, one must have an understanding of these commonsense aspects. We present the first work on generating commonsense captions directly from videos, to describe latent aspects such as intentions, effects, and attributes. We present a new dataset "Video-to-Commonsense (V2C)" that contains $\sim9k$ videos of human agents performing various actions, annotated with 3 types of commonsense descriptions. Additionally we explore the use of open-ended video-based commonsense question answering (V2C-QA) as a way to enrich our captions. Both the generation task and the QA task can be used to enrich video captions.

연구 동기 및 목표

  • 영상 속에서 관찰할 수 없는 인간 행동의 잠재적 요소인 의도, 영향, 속성과 같은 것을 추론할 수 있는 생성 모델의 부족을 해결하기 위해.
  • 기존 영상 캡션을 공통지식적 추론을 통합함으로써 확장하는 새로운 영상 이해 작업인 영상에서 공통지식으로(V2C)를 개발하기 위해.
  • 시각적 입력에 기반한 3종류의 공통지식적 서술이 포함된 대규모 인간 레이블이 부여된 데이터셋(V2C)을 구축하기 위해.
  • 공통지식적 추론 능력을 향상시키고 평가하기 위해 개방형 영상 기반 공통지식 질문 응답(V2C-QA)을 활용할 수 있는지 탐색하기 위해.
  • 교차 모odal attention를 사용하여 캡션과 공통지식적 서술을 동시에 생성하는 강력한 기초 모델(V2C-Transformer)을 수립하기 위해.

제안 방법

  • V2C-Transformer 모델은 입력 영상 프레임에서 글로벌 시각적 표현을 추출하기 위해 영상 인코더를 사용한다.
  • Transformer 디코더는 일괄적인 시퀀스-투-시퀀스 생성 과정에서 사실 기반 캡션과 세 가지 유형의 공통지식적 서술(의도, 영향, 속성)을 동시에 생성한다.
  • 교차 모달 자체 주의 모듈은 시각적 특징과 텍스트 임bedding을 정렬하여 시각과 언어 간의 공동 추론을 가능하게 한다.
  • V2C 데이터셋은 Atomic 데이터셋에서 후보 공통지식 텍스트를 검색하고, BERT를 사용해 순위를 매기며, 영상 클립에 대해 인간 레이블을 통해 보완함으로써 구성된다.
  • V2C-QA 작업은 보조적인 설정으로 도입되며, 잠재적 공통지식적 요소에 관한 질문을 통해 모델의 추론 능력을 이끌고 평가하는 데 사용된다.
  • 이 프레임워크는 MSR-VTT의 영상-캡션 쌍과 인간 레이블이 부여된 V2C 데이터셋을 조합하여 훈련 및 평가한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델은 영상 입력에서 의미적으로 풍부하고 시각적으로 기반된 공통지식적 서술(의도, 영향, 속성)을 직접 생성할 수 있는가?
  • RQ2기본 캡션 모델 대비 V2C-Transformer 모델은 정확하고 다양한 공통지식적 서술을 생성하는 데 얼마나 효과적인가?
  • RQ3공통지식적 요소에 관한 개방형 영상 질의응답은 생성된 캡션의 품질을 향상시킬 수 있는가?
  • RQ4모델이 잠재적 정서 상태와 향후 영향을 추론하는 능력이 영상 이해 작업의 후행 단계에서 얼마나 향상되는가?
  • RQ5자동 검색(Atomic에서)과 인간 보완의 조합이 공통지식 레이블의 정확성과 관련성 향상에 얼마나 기여하는가?

주요 결과

  • V2C-Transformer 모델은 의도, 영향, 속성 서술을 강력하게 생성하여 공통지식적 추론의 종단 간 시각 기반 구현 가능성을 입증한다.
  • V2C 데이터셋에 포함된 인간 레이블 기반 공통지식적 서술은 높은 언어 다양성과 시각적 관련성을 보이며, 데이터 수집 파이프라인의 품질을 검증한다.
  • V2C-QA 작업은 공통지식적 추론을 활용하여 캡션 생성을 향상시키며, 모델이 관련된 시각-언어 작업으로의 이식 가능성을 보여준다.
  • 기본 캡션 모델이 다루지 못하는 잠재적 요소, 예를 들어 향후 결과나 주체의 동기 등을 모델이 더 잘 포착함으로써 성능이 뛰어나다.
  • BERT 기반 순위 매기기와 인간 보완의 통합은 자동 검색만으로는 달성할 수 없는 정확성과 관련성 향상을 크게 개선한다.
  • 이 프레임워크는 전이 학습 잠재력을 보이며, 공통지식적 추론이 필요한 영상 질의응답 작업에 효과적인 구성 요소로 기능한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.