[논문 리뷰] OpenViDial 2.0: A Larger-Scale, Open-Domain Dialogue Generation Dataset with Visual Contexts
OpenViDial 2.0은 영화 및 티비 시리즈에서 추출한 시각적 맥락과 함께 560만 개의 대화 턴을 포함하는 대규모 오픈 도메인 다중모달 대화 데이터셋입니다. OpenViDial 1.0에 비해 데이터셋 크기를 네 배로 확장하여 다중모달 대화 생성 및 다중모달 프리트레인 모델의 훈련 향상에 기여합니다.
In order to better simulate the real human conversation process, models need to generate dialogue utterances based on not only preceding textual contexts but also visual contexts. However, with the development of multi-modal dialogue learning, the dataset scale gradually becomes a bottleneck. In this report, we release OpenViDial 2.0, a larger-scale open-domain multi-modal dialogue dataset compared to the previous version OpenViDial 1.0. OpenViDial 2.0 contains a total number of 5.6 million dialogue turns extracted from either movies or TV series from different resources, and each dialogue turn is paired with its corresponding visual context. We hope this large-scale dataset can help facilitate future researches on open-domain multi-modal dialog generation, e.g., multi-modal pretraining for dialogue generation.
연구 동기 및 목표
- 제한된 규모의 데이터셋으로 인해 발생하는 다중모달 대화 학습의 증가하는 제약를 해결하기 위해.
- 문자 기반 대화 기록 외에 시각적 맥락을 통합하여 대화 생성의 현실성 향상.
- 다양한 연구를 지원하기 위해 확장 가능하고 오픈 액세스인 데이터셋 제공을 통해 다중모달 프리트레인 및 엔드 투 엔드 대화 생성 연구 지원.
- 오픈 도메인 대화에서 텍스트 및 시각 모odal리티를 동시에 고려하는 모델 개발 촉진.
- 기존 OpenViDial 1.0 데이터셋을 네 배로 늘린 대화 턴과 정렬된 시각적 맥락을 통합하여 확장.
제안 방법
- 다양한 공개 자료에서 영화 및 티비 시리즈의 대화 턴과 관련 시각 프레임을 추출.
- 각 대화 발화를 발생하는 시각적 맥락(이미지 프레임)과 정렬하여 시간적 및 맥락적 일관성 확보.
- 발화와 시각 입력 간의 고품질 쌍을 확보하기 위해 데이터셋을 정성껏 선별 및 검증.
- OpenViDial 1.0과 동일한 데이터 수집 파이프라인을 유지하면서 560만 개의 대화 턴을 포함하도록 스케일업.
- 다양하고 작업에 특화되지 않은 대화 생성을 지원하기 위해 오픈 도메인 성격을 유지.
- 재현 가능성과 커뮤니티 활용을 촉진하기 위해 GitHub를 통해 데이터셋을 공개.
실험 결과
연구 질문
- RQ1다소로 큰 규모의 다중모달 대화 데이터셋이 오픈 도메인 대화 생성 모델의 성능 향상에 기여할 수 있는가?
- RQ2시각적 맥락이 오픈 도메인 대화에서 생성된 응답의 일관성, 다양성 및 관련성에 어느 정도 기여하는가?
- RQ3110만 턴에서 560만 턴으로 데이터셋 스케일업할 경우 다중모달 대화 모델의 일반화 및 내구성에 어떤 영향을 미치는가?
- RQ4대규모로 고품질의 시각적 및 문자 기반 대화 데이터를 수집하고 정렬하는 데 발생하는 주요 과제는 무엇인가?
- RQ5제안된 데이터셋이 대화 시스템에서 다중모달 프리트레인의 강력한 기초로 기능할 수 있는가?
주요 결과
- OpenViDial 2.0은 OpenViDial 1.0 대비 네 배로 증가한 560만 개의 대화 턴과 관련 시각적 맥락을 포함.
- 다양한 영화 및 티비 시리즈 콘텐츠에서 유래하여 언어적 및 시각적 다양성 보장.
- 각 대화 턴은 소스 시각 프레임과 시간적·의미적으로 정렬되어 있어 효과적인 다중모달 모델링 가능.
- 특히 시각적 맥락을 활용하는 다중모달 대화 생성 모델의 훈련 및 평가 지원.
- OpenViDial 2.0의 공개로 향후 다중모달 대화 시스템 연구를 위한 확장 가능한 벤치마크 제공.
- 데이터셋은 https://github.com/ShannonAI/OpenViDial 에서 공개되어 있어 개방적이고 재현 가능한 연구 지원.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.