Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Audio Visual Scene-Aware Dialog using Multimodal Attention-Based Video Features

Chiori Hori, Huda Alamri|arXiv (Cornell University)|2018. 06. 21.
Multimodal Machine Learning Applications참고 문헌 14인용 수 9
한 줄 요약

이 논문은 영상, 음성 및 대화 역사를 기반으로 한 다중모달 주의 메커니즘을 활용해 동적 영상 시나리오에 대해 자연어 응답을 생성하는 종단간 오디오-비주얼 시나리오 인식 대화 시스템을 제안한다. I3D 영상 특징과 VGGish 음성 임베딩을 다중모달 주의 메커니즘과 통합함으로써 기준 모델 대비 응답 품질을 크게 향상시켰으며, 9,000개의 영상 대화로 구성된 새로운 데이터셋에서 최신 기술 수준의 성능을 달성하였다.

ABSTRACT

Dialog systems need to understand dynamic visual scenes in order to have conversations with users about the objects and events around them. Scene-aware dialog systems for real-world applications could be developed by integrating state-of-the-art technologies from multiple research areas, including: end-to-end dialog technologies, which generate system responses using models trained from dialog data; visual question answering (VQA) technologies, which answer questions about images using learned image features; and video description technologies, in which descriptions/captions are generated from videos using multimodal information. We introduce a new dataset of dialogs about videos of human behaviors. Each dialog is a typed conversation that consists of a sequence of 10 question-and-answer(QA) pairs between two Amazon Mechanical Turk (AMT) workers. In total, we collected dialogs on roughly 9,000 videos. Using this new dataset for Audio Visual Scene-aware dialog (AVSD), we trained an end-to-end conversation model that generates responses in a dialog about a video. Our experiments demonstrate that using multimodal features that were developed for multimodal attention-based video description enhances the quality of generated dialog about dynamic scenes (videos). Our dataset, model code and pretrained models will be publicly available for a new Video Scene-Aware Dialog challenge.

연구 동기 및 목표

  • 실시간으로 동적 시각적 및 청각적 시나리오에 대해 대화할 수 있는 종단간 대화 시스템을 개발하는 것.
  • 인간-기계 상호작용에서 정적 이미지 기반 시각 대화와 동적 영상 이해 사이의 격차를 메우는 것.
  • 학습 및 평가를 위한 영상에 관한 인간 애너테이션 대화로 구성된 새로운 벤치마크 데이터셋을 구축하는 것.
  • 영상(I3D), 음성(VGGish), 대화 역사(QA)의 다중모달 특징이 응답 생성 품질 향상에 기여하는지 평가하는 것.
  • 더 자연스럽고 맥락에 맞는 대화 응답을 생성하기 위해 시각적, 청각적, 언어적 표현을 공동 최적화하는 종단간 학습을 가능하게 하는 것.

제안 방법

  • 모델은 영상(I3D RGB 및 플로우), 음성(VGGish), 대화 역사(질의-응답 쌍)의 특징을 융합하는 다중모달 주의 메커니즘을 갖춘 인코더-디코더 아키텍처를 사용한다.
  • 영상 특징은 Kinetics에서 사전 훈련된 I3D 네트워크를 통해 추출되며, 음성 특징은 VGGish를 통해 추출되며, 모두 융합 전에 256차원 공간으로 투영된다.
  • 다중모달 주의 메커니즘은 디코딩 중에 관련된 시각적, 청각적, 언어적 특징에 동적으로 주의를 기울여 맥락 인식 기반의 응답 생성을 가능하게 한다.
  • 시스템은 ADAM 옵timizer를 사용해 20 에포크 동안 개발 세트의 퍼플렉서티를 최소화하는 방식으로 종단간 훈련된다.
  • 디코더는 128개의 유닛을 가진 2층의 LSTM을 사용하며, 응답 생성은 n-best 후보 선택을 포함한 빔 서치 방식으로 수행된다.
  • 자동으로 추출된 시각 및 청각 특징의 필요성을 평가하기 위해 인간 애너테이션 캡션의 특징을 강력한 베이스라인으로 사용한다.

실험 결과

연구 질문

  • RQ1다중모달 입력을 활용해 종단간 대화 시스템이 동적 영상 시나리오에 대해 효과적으로 응답을 생성할 수 있는가?
  • RQ2시각적, 청각적, 대화 역사 특징의 다양한 조합이 시나리오 인식 대화의 응답 품질에 어떤 영향을 미치는가?
  • RQ3다중모달 주의 메커니즘의 통합이 모달의 조기 또는 후기 융합 대비 응답 생성 품질 향상에 기여하는가?
  • RQ4자동으로 추출된 영상 및 음성 특징이 제로샷 또는 저자원 환경에서 인간 애너테이션 캡션보다 얼마나 뛰어나게 성능을 내는가?
  • RQ5제안된 모델이 인간 애너테이션 캡션을 확보할 수 없는 실세계 응용에 일반화될 수 있는가?

주요 결과

  • 다중모달 주의 메커니즘을 사용한 QA + I3D + VGGish 모델이 CIDEr 점수 0.727로 가장 높은 성능을 기록했으며, QA 전용 기준 모델(CIDEr = 0.618)보다 유의미하게 뛰어났다.
  • I3D와 함께 VGGish 음성 특징을 추가했을 때 CIDEr 점수가 0.701에서 0.727로 상승하여 음성 모odal의 기여도가 뚜렷하게 확인되었다.
  • I3D 특징만 추가했을 때(IA + I3D) CIDEr 점수가 0.618에서 0.680으로 상승하여 영상 운동 특징이 응답 품질 향상에 기여한다는 것을 보여주었다.
  • 다중모달 주의 메커니즘이 비주목 융합 방식(0.701 대비 0.727)에 비해 CIDEr 점수에서 4.4% 상대적 향상을 이끌어내어 특징 융합의 효과성을 확인하였다.
  • QA + 캡션(인간 애너테이션) 모델이 CIDEr 0.618을 기록했지만, 자동 특징 기반 모델이 이를 능가하여 학습된 특징이 대화 생성에서 인간 캡션과 동등하거나 이를 초월할 수 있음을 보여주었다.
  • VGGish가 포함된 경우 음성 관련 응답이 더 정확하게 생성되었으며, 예를 들어 음악이나 배경 소음을 정확히 식별하는 데 성공하여 청각 모달의 영향력이 인지 정확도에 기여함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.