Skip to main content
QUICK REVIEW

[논문 리뷰] MultiSubs: A Large-scale Multimodal and Multilingual Dataset

Josiah Wang, Pranava Madhyastha|arXiv (Cornell University)|2021. 03. 02.
Multimodal Machine Learning Applications참고 문헌 35인용 수 7
한 줄 요약

이 논문은 다국어 및 다중모odal 데이터셋인 MultiSubs를 소개한다. 이 데이터셋은 문맥적 문장 사용 내에서 단어나 텍스트 조각을 이미지에 대응시키며, 다국어 의미 해석 및 BabelNet을 활용해 언어 간 의미를 정렬한다. 이는 이전 연구보다 더 정밀한 국소적 이미지-텍스트 정렬을 가능하게 하며, 평가 결과 이미지는 문장 빈칸 채우기 작업에서 성능을 향상시키지만, 어휘 번역 작업에선 제한적인 기여를 보이며, 번역에서 효과적인 다중모달 통합의 과제를 드러낸다.

ABSTRACT

This paper introduces a large-scale multimodal and multilingual dataset that aims to facilitate research on grounding words to images in their contextual usage in language. The dataset consists of images selected to unambiguously illustrate concepts expressed in sentences from movie subtitles. The dataset is a valuable resource as (i) the images are aligned to text fragments rather than whole sentences; (ii) multiple images are possible for a text fragment and a sentence; (iii) the sentences are free-form and real-world like; (iv) the parallel texts are multilingual. We set up a fill-in-the-blank game for humans to evaluate the quality of the automatic image selection process of our dataset. We show the utility of the dataset on two automatic tasks: (i) fill-in-the-blank; (ii) lexical translation. Results of the human evaluation and automatic models demonstrate that images can be a useful complement to the textual context. The dataset will benefit research on visual grounding of words especially in the context of free-form sentences, and can be obtained from https://doi.org/10.5281/zenodo.5034604 under a Creative Commons licence.

연구 동기 및 목표

  • 특정 텍스트 조각을 이미지에 국소적이고 문맥에 민감한 방식으로 연결하는 대규모 자유형 다국어 데이터셋의 부족을 해결하기 위해.
  • 모델이 전체 문장의 맥락 내에서 단어-이미지 대응 관계를 학습하도록 함으로써 시각적 기반을 향상시키기 위해.
  • 실생활 언어 사용에 일반화할 수 있도록 다양한 도메인에 국한되지 않은 이미지와 다국어 병렬 텍스트 조각을 포함한 데이터셋을 구축하기 위해.
  • 사람이 평가한 빈칸 채우기 게임을 통해 데이터셋 품질을 평가하여 이미지가 문맥 이해에 얼마나 기여하는지 평가하기 위해.
  • 데이터셋의 유용성을 두 가지 작업에서 입증하기 위해: 빈칸 채우기 및 어휘 번역이며, 시각 신호 유무를 비교한 모델을 평가하기 위해.

제안 방법

  • 영어 및 다른 네 개 언어의 영화 자막 병렬 코퍼스에서 MultiSubs를 구성하고, 시각적으로 두드러지는 단어를 선택해 그림을 제시한다.
  • 다국어 다중모달 의미 해석: 병렬 텍스트를 활용해 언어 간 의미 모호성을 해결하고, BabelNet을 통해 겹치는 시넷(synsets)을 찾는다.
  • 해석된 시넷에 해당하는 BabelNet 이미지를 검색하고 정렬하여, 대상 단어의 맥락에서 시각적으로 관련성이 있도록 보장한다.
  • 각 텍스트 조각에 여러 이미지를 허용하여 의미적 및 시각적 다양성을 반영하고, 모호성에 대한 강건성을 향상시킨다.
  • 참가자가 이미지 힌트 유무로 문장의 누락된 단어를 추측하는 인간 평가 게임을 설계하여 데이터셋 품질을 평가한다.
  • 두 가지 작업에서 모델을 훈련 및 평가한다: 빈칸 채우기(이미지 유무) 및 어휘 번역(원본 문장과 이미지 신호를 사용함)으로 여러 언어에서 수행한다.

실험 결과

연구 질문

  • RQ1국소적 이미지-텍스트 정렬이 있는 대규모 다국어 다중모달 데이터셋이 자유형 문맥 언어에서 시각적 기반을 향상시키는가?
  • RQ2빈칸 채우기 작업에서 이미지가 텍스트 전용 모델 대비 단어 예측에 얼마나 효과적인 맥락적 단서인가?
  • RQ3텍스트적 맥락과 결합했을 때 시각 신호가 어휘 번역 성능을 얼마나 향상시키는가?
  • RQ4이미지-텍스트 정렬 품질이 다양한 언어와 단어 유형에서 모델 성능에 미치는 영향은 어떠한가?
  • RQ5단어 빈도와 데이터 희소성은 다중모달 작업에서 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 빈칸 채우기 작업에서 인간의 성능은 낮았다: 이미지 없이 정답을 맞힌 비율은 21.89%였고, 전체 시도 중 실패한 비율은 42.41%였다.
  • 텍스트 전용 모델이 어휘 번역 작업에서 이미지 전용 모델보다 성능이 뛰어나, 단순히 시각 신호만으로는 번역 성능 향상에 기여가 미미하다는 것을 시사한다.
  • 다중모달 모델은 이미지 전용 모델보다 일관되게 성능 향상을 보였지만, 성과는 미미했으며, 최고의 경우 ALI 점수는 0.19에서 0.81로 상승했다(독일어, intersect=4).
  • 텍스트 전용 모델은 모든 신경망 다중모달 모델보다 ALI 점수가 높았고, 유일하게 intersect=4 설정에서 가장 높은 성능을 기록한 경우를 제외하고는 그렇다. 이는 현재 모델들이 이미지 신호를 효과적으로 활용하지 못하고 있음을 시사한다.
  • 빈칸 채우기 작업은 인간에게조차 도전적인 문제였으며, 이는 데이터셋이 복잡한 실제 언어적 및 시각적 기반 과제를 잘 반영하고 있음을 의미한다.
  • BabelNet과 다국어 정렬을 활용한 데이터셋 구축 방법은 언어 간 의미 모호성을 성공적으로 해결했으며, 정확한 의미 기반 이미지 선택을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.