Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Conditionality for Natural Language Generation

Michael Sollami, Aashish Jain|arXiv (Cornell University)|2021. 09. 02.
Topic Modeling참고 문헌 32인용 수 7
한 줄 요약

이 논문은 자연어 생성을 위한 트랜스포머 기반 언어 모델을 여러 모odal(예: 이미지 및 텍스트)에 조건화하기 위한 MAnTiS를 제안한다. 각 모달리티를 별도로 인코딩하고 언어 모델의 토큰 공간으로 투영한 후, 모달리티 인식 프리픽스로 통합함으로써, 사전 훈련된 모델의 아키텍처를 수정하지 않고도 고품질의 다중모달 텍스트 생성을 가능하게 한다. 이는 자동 평가 지표와 인간 평가 지표에서 강력한 베이스라인을 능가한다.

ABSTRACT

Large scale pretrained language models have demonstrated state-of-the-art performance in language understanding tasks. Their application has recently expanded into multimodality learning, leading to improved representations combining vision and language. However, progress in adapting language models towards conditional Natural Language Generation (NLG) has been limited to a single modality, generally text. We propose MAnTiS, Multimodal Adaptation for Text Synthesis, a general approach for multimodal conditionality in transformer-based NLG models. In this method, we pass inputs from each modality through modality-specific encoders, project to textual token space, and finally join to form a conditionality prefix. We fine-tune the pretrained language model and encoders with the conditionality prefix guiding the generation. We apply MAnTiS to the task of product description generation, conditioning a network on both product images and titles to generate descriptive text. We demonstrate that MAnTiS outperforms strong baseline approaches on standard NLG scoring metrics. Furthermore, qualitative assessments demonstrate that MAnTiS can generate human quality descriptions consistent with given multimodal inputs.

연구 동기 및 목표

  • 사전 훈련된 언어 모델을 다중 모달리티(예: 이미지 및 텍스트)를 사용해 조건부 텍스트 생성에 적응시키는 데 있어 발생하는 격차를 해결하기 위해.
  • 사전 훈련된 모델의 생성 능력을 유지하면서도, 이미지 및 텍스트와 같은 다양한 입력에 조건부로 설정할 수 있는 방법을 개발하기 위해.
  • 사전 훈련된 모델의 아키텍처를 수정하지 않으면서도 일반적이고 모듈화되며 확장 가능한 다중모달 자연어 생성 프레임워크를 제공하기 위해.
  • 실제 전자상거래 상품 기술서 생성에 있어 다중모달 조건부 처리의 효과를 평가하기 위해.

제안 방법

  • 각 모달리티(예: 이미지 및 텍스트)는 모달리티 전용 인코더를 통해 처리되어 임베딩을 생성한다.
  • 이미지 및 텍스트 임베딩은 사전 훈련된 언어 모델의 텍스트 토큰 공간으로 투영된다.
  • 투영된 임베딩은 구분자 토큰과 연결되어 조건부 프리픽스를 형성한다.
  • 이 프리픽스는 디코더의 컨텍스트로 제공되며, 언어 모델의 구조는 그대로 유지된 채로 텍스트를 자동으로 순차적으로 생성한다.
  • 모델은 생성된 텍스트 토큰에만 표준 언어 모델링 목적함수를 사용해 엔드 투 엔드로 미세조정된다.
  • 이 방법은 다중 이미지 처리를 지원하며, 일반화 능력을 향상시키기 위해 모달리티 드롭아웃을 통합할 수 있다.

실험 결과

연구 질문

  • RQ1사전 훈련된 언어 모델이 아키텍처 수정 없이도 여러 모달리티(예: 이미지 및 텍스트)에 조건부로 설정되어 자연어 생성에 효과적으로 활용될 수 있는가?
  • RQ2모달리티 전용 프리픽스를 통한 다중모달 조건부 처리 방식이, 주로 어텐션 레이어에 조건부 벡터를 삽입하는 방법과 비교해 어떻게 다를까?
  • RQ3한 제품에 여러 이미지를 사용할 경우, 생성된 기술서의 품질과 관련성은 향상되는가?
  • RQ4훈련 중에 모달리티 드롭아웃을 적용하면 성능 저하 없이 일반화 능력이 향상되는가?
  • RQ5인간 평가자들은 MAnTiS가 생성한 기술서의 문법 정확도, 일관성, 매력도를 베이스라인과 비교해 어떻게 평가하는가?

주요 결과

  • 최대 5장의 이미지를 사용할 경우, MAnTiS는 BLEU4(+0.1), CIDEr(+2.2), METEOR(+0.3), ROUGE-L(+0.3) 등 모든 표준 NLG 지표에서 강력한 베이스라인을 능가했다.
  • 인간 평가 결과, MAnTiS는 문법 정확도, 중복 회피, 일관성, 매력도 점수 모두에서 유의미하게 높은 평가를 받았으며, 평균 종합 평점은 5점 만점에 4.2점이었다.
  • 모델은 이미지 고유의 특징을 정확히 반영한 기술서를 생성했으며, 예를 들어 '자수로 장식된 끝마무리'와 같은 구체적인 시각적 특징을 정확히 반영했다.
  • 여러 이미지를 통합함으로써 성능 향상이 이루어져, 다양한 시각적 시점에서의 정보 융합이 효과적으로 이루어졌음을 시사했다.
  • 모달리티 드롭아웃을 적용하면 BLEU4 및 CIDEr 점수에 약간의 향상이 있었으며, 이는 성능 저하 없이 일반화 능력을 향상시킨다는 것을 시사한다.
  • 사전 훈련된 언어 모델의 이점을 활용하지 못한 MAnTiS-scratch(초기 학습)는 MAnTiS-single에 비해 유의미하게 성능이 열 劣하므로, 대규모 사전 훈련된 언어 모델의 활용이 유의미한 이점이 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.