Skip to main content
QUICK REVIEW

[논문 리뷰] DualVD: An Adaptive Dual Encoding Model for Deep Visual Understanding in Visual Dialogue

Xiaoze Jiang, Jing Yu|arXiv (Cornell University)|2019. 11. 17.
Multimodal Machine Learning Applications참고 문헌 29인용 수 8
한 줄 요약

DualVD는 시각 대화에서 이미지 표현을 시각적(외관 수준) 및 의미적(고수준 추상화) 관점에서 모두 포착하는 새로운 적응형 이중 인코딩 모델을 제안한다. 계층적 내모odal 및 간모odal 특징 선택과 학습 가능한 게이트 메커니즘을 사용한다. 이 모델은 기준 데이터셋에서 최고 성능을 달성하면서도 어텐션 및 게이트 가중치를 통해 모odal 기여도를 해석 가능한 방식으로 시각화할 수 있다.

ABSTRACT

Different from Visual Question Answering task that requires to answer only one question about an image, Visual Dialogue involves multiple questions which cover a broad range of visual content that could be related to any objects, relationships or semantics. The key challenge in Visual Dialogue task is thus to learn a more comprehensive and semantic-rich image representation which may have adaptive attentions on the image for variant questions. In this research, we propose a novel model to depict an image from both visual and semantic perspectives. Specifically, the visual view helps capture the appearance-level information, including objects and their relationships, while the semantic view enables the agent to understand high-level visual semantics from the whole image to the local regions. Futhermore, on top of such multi-view image features, we propose a feature selection framework which is able to adaptively capture question-relevant information hierarchically in fine-grained level. The proposed method achieved state-of-the-art results on benchmark Visual Dialogue datasets. More importantly, we can tell which modality (visual or semantic) has more contribution in answering the current question by visualizing the gate values. It gives us insights in understanding of human cognition in Visual Dialogue.

연구 동기 및 목표

  • 시각 대화에서 질문이 객체, 관계, 고수준 의미를 포함하는 범위에서 포괄적이고 질문에 적응하는 이미지 표현을 학습하는 데 도전하는 것.
  • 객체와 관계에서 유도되는 외관 수준 특징과 전반적 및 국소적 이미지 캡션에서 유도되는 의미 수준 특징을 통해 시각적 이해를 모델링하는 것.
  • 내모odal 및 간모odal 특징 선택을 통해 질문 관련 시각적 및 의미적 단서를 계층적이고 적응적으로 선택하는 것.
  • 게이트 값에 의해 각 질문에 대해 어떤 모달리티(시각적 또는 의미적)가 더 많은 기여를 하는지 시각화함으로써 모델 결정의 해석 가능성 향상.
  • 다양한 다중 모달 표현 학습을 통해 기존 최고 성능 모델을 능가하는 성능을 달성하는 것.

제안 방법

  • DualVD는 이중 인코딩 아키텍처를 사용한다: 시각 모듈은 R-CNN 기반 특징을 사용해 객체 및 관계 특징을 캡처하고, 의미 모듈은 전반적 및 국소적 이미지 캡션을 인코딩하여 고수준 의미를 표현한다.
  • 내모달 선택은 어텐션 메커니즘을 사용해 질문과 관련된 영역 또는 개념을 각각 시각적 및 의미적 특징에서 식별하기 위해 별도로 적용된다.
  • 간모달 선택은 현재 질문 맥락에 기반해 학습 가능한 게이트 메커니즘을 사용해 시각적 및 의미적 특징을 적응적으로 융합한다.
  • 질문 인코딩을 위해 ELMo 임베딩을 통합하여 언어 맥락 표현을 풍부하게 한다.
  • 계층적 특징 선택 프레임워크는 답변 예측 이전에 양 모달리티에서 관련 정보를 점진적으로 정제한다.
  • 게이트 메커니즘은 모달리티 기여도를 명시적으로 시각화할 수 있게 하여 모델 결정의 해석 가능성 지원.

실험 결과

연구 질문

  • RQ1다중 대화 턴 동안 객체, 관계, 고수준 의미에 이르기까지 다양한 시각적 콘텐츠를 더 잘 포착할 수 있는 방법은 무엇인가?
  • RQ2단일 시각적 특징 추출 방식에 비해 이중 인코딩을 통한 시각적 및 의미적 표현의 융합이 시각 대화 성능 향상에 얼마나 기여하는가?
  • RQ3계층적이고 적응적인 특징 선택 메커니즘은 질문 응답에 필요한 시각적 단서의 관련성 향상에 기여하는가?
  • RQ4추론 중에 모달리티별 기여도(시각적 대비 의미적)를 정량적으로 측정하고 시각화할 수 있는가?
  • RQ5이중 관점의 통합이 표준 시각 대화 데이터셋에서 일반화 및 강인성 향상에 기여하는가?

주요 결과

  • DualVD는 기존 모델인 VisMod, RelRep, SemMod를 포함한 표준 시각 대화 벤치마크에서 최고 성능을 기록한다.
  • 시각적 및 의미적 모듈을 결합할 경우 성능 향상이 뚜렷하게 나타나 상호 보완적인 정보 획득이 가능함을 시사한다.
  • 객체 및 외관 관련 질문에서는 시각 모듈이 평균적으로 더 높은 게이트 값으로 더 큰 기여를 한다.
  • 관계나 추상 개념을 포함하는 의미 수준의 질문에서는 특히 명시적인 텍스트 단서가 존재할 경우 의미 모듈이 더 큰 기여를 한다.
  • 제거 실험 결과, DualVD의 성능 향상 요인이 ELMo 임베딩이 아닌 새로운 이중 인코딩 시각 표현에 기인함을 확인한다.
  • 게이트 값 및 어텐션 맵의 시각화 결과, DualVD가 대화 턴에 따라 모달리티 간 집중을 다이나믹하게 전환함으로써 인간의 인지 행동을 모방함을 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.