Skip to main content
QUICK REVIEW

[논문 리뷰] DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset

Youngjun Lee, Byungsoo Ko|arXiv (Cornell University)|2022. 12. 08.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 CLIP 기반 유사도를 사용해 대화를 이미지에 자동으로 매칭하는 자동화된 파이프라인을 통해 생성된 대규모 다중모달 대화 데이터셋인 DialogCC를 제시한다. 이 데이터셋은 모델의 일반화 능력을 크게 향상시키고, 이미지 및 텍스트 검색에서 최고 성능을 달성하며, 다양한 다중이미지 대화로 인해 이미지 및 텍스트 노이즈에 대한 강건성이 향상된다.

ABSTRACT

As sharing images in an instant message is a crucial factor, there has been active research on learning an image-text multi-modal dialogue models. However, training a well-generalized multi-modal dialogue model remains challenging due to the low quality and limited diversity of images per dialogue in existing multi-modal dialogue datasets. In this paper, we propose an automated pipeline to construct a multi-modal dialogue dataset, ensuring both dialogue quality and image diversity without requiring minimum human effort. In our pipeline, to guarantee the coherence between images and dialogue, we prompt GPT-4 to infer potential image-sharing moments - specifically, the utterance, speaker, rationale, and image description. Furthermore, we leverage CLIP similarity to maintain consistency between aligned multiple images to the utterance. Through this pipeline, we introduce DialogCC, a high-quality and diverse multi-modal dialogue dataset that surpasses existing datasets in terms of quality and diversity in human evaluation. Our comprehensive experiments highlight that when multi-modal dialogue models are trained using our dataset, their generalization performance on unseen dialogue datasets is significantly enhanced. We make our source code and dataset publicly available.

연구 동기 및 목표

  • 기존 다중모달 대화 데이터셋의 한계를 해결하기 위해, 소규모 규모, 제한된 주제 다양성, 대화당 이미지 수가 적다는 점을 개선하고자 한다.
  • 인간의 레이블링 없이도 고품질의 다중모달 대화 데이터셋을 생성할 수 있는 자동화되고 확장 가능한 파이프라인을 개발하고자 한다.
  • 대화 문장당 여러 다양성 있는 이미지를 사용해 훈련시킴으로써 모델의 일반화 능력을 향상시키고자 한다.
  • DialogCC로 훈련된 모델이 이미지 및 텍스트 검색 벤치마크에서 뛰어난 성능과 강건성을 보임을 입증하고자 한다.

제안 방법

  • 파이프라인은 텍스트 전용 대화에서의 문장을 CC3M 데이터셋의 관련 이미지들과 CLIP 임베딩을 활용해 의미 유사도 기반으로 자동으로 매칭한다.
  • 두 단계의 필터링을 적용한다: 원천 데이터 필터링을 통해 저품질 대화를 제거하고, 다중모달 대화 필터링을 통해 이미지-대화의 관련성을 확보한다.
  • 사전 훈련된 CLIP 인코더를 사용해 텍스트 및 이미지 특징를 추출함으로써 인간의 개입 없이도 제로샷 매칭을 가능하게 한다.
  • 최종적으로 생성된 데이터셋인 DialogCC는 평균 5.5장의 이미지가 포함된 100만 개 이상의 대화를 포함하며, 다양한 주제와 대화 기술을 커버한다.
  • 다양한 모odal 간 의미적 콘텐츠 일치를 통해 이미지 선택을 통해 높은 다양성을 확보한다.
  • 해당 데이터셋은 개방형 다중모달 대화 시스템 연구를 지원하기 위해 공개적으로 배포된다.

실험 결과

연구 질문

  • RQ1CLIP 유사도 기반 자동화된 파이프라인이 대규모, 다양한 주제를 포함하고 고품질의 다중모달 대화 데이터셋을 효과적으로 생성할 수 있는가?
  • RQ2대화 문장당 여러 장의 이미지를 사용해 훈련할 경우, 단일 또는 소수의 이미지만 사용하는 데이터셋에 비해 모델의 일반화 능력과 강건성이 향상되는가?
  • RQ3DialogCC로 미세조정된 모델이 이미지 및 텍스트 검색 작업에서 최고 성능을 달성할 수 있는가?
  • RQ4이미지 및 텍스트 증강 조건 하에서 DialogCC로 훈련된 모델의 성능는 어떻게 되는가? 이는 입력 변형에 대한 강건성을 나타낸다.
  • RQ5고정된 이미지-문장 쌍에 의존도를 줄임으로써 DialogCC가 기억화 리스크를 어느 정도 감소시키는가?

주요 결과

  • DialogCC는 100만 개 이상의 대화와 550만 개 이상의 이미지-대화 쌍을 포함하며, 규모와 다양성 면에서 기존 데이터셋을 크게 능가한다.
  • MMDD 및 PhotoChat에 비해 고유 단어 수가 1.5배, 고유 하이퍼니움 수가 2.5배 많아 주제 및 도메인 다양성이 뛰어나다.
  • DialogCC로 훈련된 모델은 이미지 및 텍스트 검색 벤치마크에서 최고 성능을 기록하며, PhotoChat 데이터셋에서 Recall@1이 7.58%에 달한다.
  • DialogCC로 훈련된 모델는 이미지 증강에 대해 뛰어난 강건성을 보이며, 동의어 기반 텍스트 증강 조건에서 Recall@1이 1.85% 감소하는 데 그치지만, 기준 모델은 2.13% 감소한다.
  • 대화 문장당 최대 이미지 수를 1에서 10으로 증가시킬 경우, R@1은 1.08점, R@10은 1.75점 향상되어 다중이미지 훈련의 유용성을 입증한다.
  • DialogCC로 훈련된 모델는 왜곡(예: 기울임, 흐림)이 가해진 이미지에서도 성능 저하가 상대적으로 낮게 나타나, 입력 변형에 대한 강건성이 향상됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.