Skip to main content
QUICK REVIEW

[논문 리뷰] OpenViDial: A Large-Scale, Open-Domain Dialogue Dataset with Visual Contexts

Yuxian Meng, Shuhe Wang|arXiv (Cornell University)|2020. 12. 30.
Multimodal Machine Learning Applications참고 문헌 107인용 수 18
한 줄 요약

OpenViDial는 영화 및 텔레비전 시리즈에서 추출한 시각적 맥락과 함께 110만 개의 대화 전환을 포함하는 대규모 개방 도메인 대화 데이터셋을 소개한다. 대화 생성에 시각적 기반을 통합함으로써 맥락적이고 시각적으로 기반된 응답을 생성할 수 있는 다중모달 모델를 훈련시킬 수 있으며, 기존의 텍스트 중심 대화 시스템에서의 핵심적 한계를 해결한다.

ABSTRACT

When humans converse, what a speaker will say next significantly depends on what he sees. Unfortunately, existing dialogue models generate dialogue utterances only based on preceding textual contexts, and visual contexts are rarely considered. This is due to a lack of a large-scale multi-module dialogue dataset with utterances paired with visual contexts. In this paper, we release {\bf OpenViDial}, a large-scale multi-module dialogue dataset. The dialogue turns and visual contexts are extracted from movies and TV series, where each dialogue turn is paired with the corresponding visual context in which it takes place. OpenViDial contains a total number of 1.1 million dialogue turns, and thus 1.1 million visual contexts stored in images. Based on this dataset, we propose a family of encoder-decoder models leveraging both textual and visual contexts, from coarse-grained image features extracted from CNNs to fine-grained object features extracted from Faster R-CNNs. We observe that visual information significantly improves dialogue generation qualities, verifying the necessity of integrating multi-modal features for dialogue learning. Our work marks an important step towards large-scale multi-modal dialogue learning.

연구 동기 및 목표

  • 다중모달 대화 에이전트 훈련을 위해 시각적 맥락을 통합한 대규모 개방 도메인 대화 데이터셋의 부족을 보완한다.
  • 실제 시각 미디어에서 유래한 대화 전환과 시각적 맥락의 쌍을 제공하여 시각적으로 기반된 대화 생성 연구를 가능하게 한다.
  • 장면 맥락, 표정, 물체 상호작용과 같은 시각적 신호를 활용하는 대화 모델의 개발을 촉진한다.
  • 실제적이고 다양한, 확장 가능한 벤치마크를 제공함으로써 더 인간에 가까운, 맥락적이고 시각적으로 인지하는 대화 에이전트의 구축을 지원한다.
  • 특히 개방 도메인 환경에서 텍스트 중심 생성을 넘어서는 다중모달 대화 시스템의 발전을 위한 기반을 제공한다.

제안 방법

  • 영화 및 텔레비전 시리즈의 대본과 해당 영상 프레임에서 대화 전환과 시각적 맥락을 추출한다.
  • 각 대화 발화를 발생한 특정 시각 프레임(이미지)과 정렬하여 시간적·공간적 일致성을 확보한다.
  • 다양한 시각 미디어에서 유래한 총 110만 개의 대화-시각 쌍을 정제하여 구성하였다. 이는 다양한 장면, 캐릭터, 대화 맥락을 포함한다.
  • 자동 및 수동 필터링을 통해 고품질, 일관성 있고 맥락적으로 관련된 대화-시각 쌍을 확보하였다.
  • 다중모달 모델의 공동 훈련을 가능하게 하기 위해 대화 생성 및 시각적 기반 작업을 모두 지원하도록 데이터셋을 구조화하였다.
  • 공개적으로 https://github.com/ShannonAI/OpenViDial 에서 데이터셋을 배포하여 커뮤니티의 사용 및 벤치마크 작업을 지원한다.

실험 결과

연구 질문

  • RQ1시각적 맥락이 짝지어진 대규모 개방 도메인 대화 데이터셋이 다중모달 대화 생성 모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2장면 맥락, 물체 존재, 표정과 같은 시각적 신호가 생성된 응답의 관련성과 일관성에 어느 정도 기여하는가?
  • RQ3시각적 맥락을 통합함으로써 개방 도메인 환경에서 대화 응답의 다양성과 개인화는 어떻게 영향을 받는가?
  • RQ4OpenViDial로 훈련된 모델들은 언어적으로 일관되고 시각적 현실에 기반한 응답을 생성할 수 있는가?
  • RQ5정확하고 맥락적으로 적절한 대화 응답을 예측하는 데 가장 강력하게 기여하는 주요 시각적 및 텍스트 특성들은 무엇인가?

주요 결과

  • OpenViDial는 110만 개의 대화 전환과 해당하는 시각적 맥락을 포함하여, 현재까지 공개된 가장 대규모의 개방 도메인 다중모달 대화 데이터셋 중 하나이다.
  • 이 데이터셋을 통해 시각적 맥락에 기반한 응답을 생성할 수 있는 대화 모델를 훈련시킬 수 있으며, 예를 들어 '그림을 봐' 또는 '지하실로 옮기고 있어'와 같은 표현은 시각적 입력이 없으면 모호하다.
  • 시각적 맥락의 통합은 모델 출력의 질적 분석을 통해 응답의 관련성과 맥락 정확도 향상에 뚜렷한 기여를 한다.
  • 내부, 외부, 동적 장면을 포함한 다양한 시각적 설정에서 다양한 대화 시나리오를 지원하여 모델의 일반화 능력을 향상시킨다.
  • OpenViDial의 공개는 다중모달 대화 시스템 평가를 위한 표준화된 벤치마크를 제공하며, 재현 가능성과 분야 내 발전을 촉진한다.
  • 초기 실험 결과에 따르면, OpenViDial로 훈련된 모델는 특히 복잡하거나 모호한 맥락에서 텍스트 중심 기반 모델보다 더 시각적으로 기반된 응답을 생성하는 데 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.