Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Dialog Systems with Dual Knowledge-enhanced Generative Pretrained Language Model

Xiaolin Chen, Xuemeng Song|arXiv (Cornell University)|2022. 07. 16.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 다중모달 작업 지향 대화 시스템을 위한 이중 지식 강화형 생성 미리 훈련된 언어 모델인 DKMD를 제안한다. 이 모델은 텍스트 및 시각적 맥락을 통합하여 텍스트 응답 생성을 향상시킨다. 생성 미리 훈련과 양 모odal에서의 지식 공동 선택을 활용함으로써 DKMD는 맥락 학습과 응답 생성을 향상시키며, 공개 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Text response generation for multimodal task-oriented dialog systems, which aims to generate the proper text response given the multimodal context, is an essential yet challenging task. Although existing efforts have achieved compelling success, they still suffer from two pivotal limitations: 1) overlook the benefit of generative pre-training, and 2) ignore the textual context related knowledge. To address these limitations, we propose a novel dual knowledge-enhanced generative pretrained language model for multimodal task-oriented dialog systems (DKMD), consisting of three key components: dual knowledge selection, dual knowledge-enhanced context learning, and knowledge-enhanced response generation. To be specific, the dual knowledge selection component aims to select the related knowledge according to both textual and visual modalities of the given context. Thereafter, the dual knowledge-enhanced context learning component targets seamlessly integrating the selected knowledge into the multimodal context learning from both global and local perspectives, where the cross-modal semantic relation is also explored. Moreover, the knowledge-enhanced response generation component comprises a revised BART decoder, where an additional dot-product knowledge-decoder attention sub-layer is introduced for explicitly utilizing the knowledge to advance the text response generation. Extensive experiments on a public dataset verify the superiority of the proposed DKMD over state-of-the-art competitors.

연구 동기 및 목표

  • 기존 다중모달 대화 시스템이 생성 미리 훈련과 텍스트 맥락 관련 지식을 간과하는 한계를 해결하기 위해.
  • 지식 선택을 위해 시각적 및 텍스트적 맥락을 통합함으로써 다중모달 작업 지향 대화 시스템에서 텍스트 응답 생성을 향상시키기 위해.
  • 교차 모달 어텐션을 통해 시각 및 텍스트 표현을 공동으로 개선하여 사용자 의도 모델링을 향상시키기 위해.
  • 생성 미리 훈련과 다중모달 지식 주입을 원활하게 통합하는 통합 프레임워크를 개발하기 위해.

제안 방법

  • 대화 맥락의 텍스트 및 시각적 모달을 사용하여 지식 기반에서 관련 지식을 검색하는 이중 지식 선택 기법을 제안한다.
  • 교차 모달 어텐션을 활용해 전역 및 국소적 관점에서 선택된 지식을 다중모달 맥락에 통합하는 이중 지식 강화형 맥락 학습 기법을 도입한다.
  • 응답 생성 중 지식에 명시적으로 주의를 기울이기 위해 추가된 도트 곱 지식-디코더 어텐션 서브층을 갖춘 수정된 BART 디코더를 활용한다.
  • 각 모달이 상호 보완적으로 이해를 향상시키도록 이중 교차 모달 표현 개선을 통해 시각적 및 텍스트 표현을 정교화한다.
  • BART 인코더 레이어 스택을 사용하며, 추론 실험 결과 지식 통합이 6번째 레이어에서 최적의 성능을 내는 것으로 나타났다.
  • 텍스트 및 시각 입력을 별도로 처리하는 이중 스트림 아키텍처를 도입하여 지식 인식 어텐션을 통해 융합한다.

실험 결과

연구 질문

  • RQ1생성 미리 훈련은 다중모달 작업 지향 대화 시스템에서 텍스트 응답 생성을 향상시킬 수 있는가?
  • RQ2텍스트 및 시각적 맥락 관련 지식을 통합할 경우 응답 생성 성능에 어떤 영향을 미치는가?
  • RQ3BART 인코더 아키텍처 내에서 지식 강화 표현을 삽입할 최적의 위치는 어디인가?
  • RQ4시각 중심 및 텍스트 중심 표현 개선 기법은 사용자 의도 모델링에 어떻게 다른 기여를 하는가?
  • RQ5모달 간의 의미 관계가 존재하는가, 그리고 다중모달 대화 시스템에서 효과적으로 포착될 수 있는가?

주요 결과

  • DKMD는 공개 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 기존 SOTA 방법보다 응답 생성에서 뛰어난 성능을 보였다.
  • 추론 실험 결과 DKMD-w/o-VR(시각 중심 개선 없음)는 DKMD-w/o-TR(텍스트 중심 개선 없음)보다 성능이 열 劣하므로, 시각 중심 개선이 성능 향상에 더 기여하는 것으로 나타났다.
  • 지식을 BART 인코더의 12번째 레이어에 삽입할 경우 모델 성능이 가장 열 劣했으며, 이는 후기 레이어에 지식을 삽입할 경우 원래 데이터 분포가 손상된다는 것을 시사한다.
  • 주의 가중치 분석 결과, 이미지와 의미적으로 관련된 토큰에 더 높은 신뢰도를 부여함으로써 모델이 교차 모달 의미 관계를 효과적으로 포착했다.
  • 민감도 분석 결과, 지식 삽입이 6번째 인코더 레이어에서 최적의 성능을 내며, 1~11번 레이어 사이에서도 안정적인 성능을 기록했다.
  • 이중 지식 강화형 맥락 학습 기법은 텍스트 및 시각적 맥락을 공동으로 활용하여 지식 검색 및 통합을 통해 사용자 의도 모델링을 효과적으로 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.