Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Visual Knowledge Memory Networks for Visual Question Answering

Su Zhou, Chen Zhu|arXiv (Cornell University)|2018. 06. 13.
Multimodal Machine Learning Applications참고 문헌 46인용 수 14
한 줄 요약

이 논문은 비시각적 지식 기반의 구조적 시각 지식을 메모리 네트워크를 통해 딥 뷰어처 특징과 통합하는 엔드 투 엔드 프레임워크인 시각 지식 메모리 네트워크(VKMN)를 제안한다. 이는 시각 질문 응답(VQA) 성능을 향상시키기 위한 것이다. VKMN은 지식 삼중항과 시각적 특징을 키-밸류 메모리 구조로 함께 임bedding하여 통합하며, 지식 추론 질문에서 기존 방법들을 크게 능가한다. VQA v2.0에서 전체 정확도 64.36%를 기록했고, '기타' 답변 유형에서는 57.79%를 달성하였다.

ABSTRACT

Visual question answering (VQA) requires joint comprehension of images and natural language questions, where many questions can't be directly or clearly answered from visual content but require reasoning from structured human knowledge with confirmation from visual content. This paper proposes visual knowledge memory network (VKMN) to address this issue, which seamlessly incorporates structured human knowledge and deep visual features into memory networks in an end-to-end learning framework. Comparing to existing methods for leveraging external knowledge for supporting VQA, this paper stresses more on two missing mechanisms. First is the mechanism for integrating visual contents with knowledge facts. VKMN handles this issue by embedding knowledge triples (subject, relation, target) and deep visual features jointly into the visual knowledge features. Second is the mechanism for handling multiple knowledge facts expanding from question and answer pairs. VKMN stores joint embedding using key-value pair structure in the memory networks so that it is easy to handle multiple facts. Experiments show that the proposed method achieves promising results on both VQA v1.0 and v2.0 benchmarks, while outperforms state-of-the-art methods on the knowledge-reasoning related questions.

연구 동기 및 목표

  • 시각 인식을 초월한 외부 지식이 필요한 질문에 대해 시각 질문 응답(VQA)의 과제를 해결하기 위해.
  • 시각 인식과 일반 지식 또는 백과 지식 간 격차를 해소하기 위해, 시각 및 지식 모odal 간의 공동 추론을 가능하게 하기 위해.
  • 주어진 질문에 대해 관련된 다수의 지식 사실을 효율적으로 저장하고 검색할 수 있는 메모리 네트워크 아키텍처를 개발하기 위해.
  • 직접적인 시각적 검토가 아닌 외부 지식 기반 추론이 필요한 '보이지 않는 목표' 질문에 대한 성능을 향상시키기 위해.

제안 방법

  • VKMN은 지식 삼중항(주어, 관계, 목적어)과 이미지에서 추출한 딥 컨볼루션 특징을 동일한 표현 공간에 함께 임베딩하여 시각 지식 특징을 구성한다.
  • 키-밸류 메모리 네트워크를 사용하여 다수의 지식 사실을 저장하고 검색하며, 키는 질문 및 이미지 조건부 표현에서 유도되고, 밸류는 공동 시각-지식 임베딩이다.
  • 이중 주의 메커니즘을 사용한다: 시각 주의는 관련된 이미지 영역에 집중하고, 질문 주의는 입력 질문의 관련 단어에 강조를 둔다.
  • 지식 사실은 질문에 기반하여 사전에 구축된 시각 지식 기반(예: Visual Genome)에서 추출되며, 이후 시각적 특징과 동일한 임베딩 공간으로 투영된다.
  • 최종 답변은 메모리 콘텐츠에 대한 주의를 통해 예측되며, 이는 시각적 정보와 외부 지식을 통합된, 미분 가능한 프레임워크에서 추론할 수 있도록 한다.
  • 전체 네트워크는 답변 카테고리에 대한 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 훈련되며, 시각적 특징 추출, 지식 검색, 답변 예측의 공동 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1구조적 외부 지식를 어떻게 깊이 있는 시각적 특징과 효과적으로 통합하여 시각 질문 응답의 추론 성능을 향상시킬 수 있는가?
  • RQ2어떤 메커니즘이 시각 콘텐츠와 지식 사실을 함께 추론할 수 있도록 하여 복잡한 지식 기반 질문을 지원하는가?
  • RQ3메모리 네트워크 아키텍처가 주어진 질문-이미지 쌍에 대해 다수의 관련 지식 사실을 효율적으로 저장하고 검색할 수 있는가?
  • RQ4이러한 방법은 시각 인식을 초월한 추론이 필요한 '보이지 않는 목표' 질문에서 어떻게 성능을 발휘하는가?
  • RQ5시각적 특징과 지식 특징의 통합은 개방형 비팩트 기반 VQA 질문에서 성능을 얼마나 향상시키는가?

주요 결과

  • VKMN은 VQA v2.0 테스트-스탠다드 세트에서 전체 정확도 64.36%를 기록했으며, 동일 벤치마크에서 MCB 및 MLB와 같은 최신 기술(SOTA) 모델들을 능가하였다.
  • '기타' 답변 유형—지식 추론 질문을 나타내며—VKMN은 57.79%의 정확도를 기록했고, 동일 세트에서 MCB(53.36%) 및 MLB(52.95%)를 크게 능가하였다.
  • 단일 모델 성능으로도 VQA v2.0 챌린지의 상위 3개 솔루션 중 최고 성능(62.27%)을 기록한 단일 모델을 초월하였으며, 특히 '기타' 유형에서 강력한 일반화 성능을 보였고, 앙상블에 대한 의존도가 낮았다.
  • SVA 모델과의 앙상블을 통해 VKMN은 전체 정확도 66.67%를 달성하였으며, 서로 다른 답변 유형에서 상호 보완적인 강점을 보였다.
  • 다양한 객체 크기 그룹에서 VKMN은 '기타' 답변 유형에서 모든 크기 범위에서 MLB를 일관되게 능가하였으며, 목표 객체의 크기 변화에 대해 강건함을 보였다.
  • 제거 실험 결과, VKMN의 성능 향상 요인이 주로 메모리 메커니즘을 통한 지식 및 시각적 특징의 효과적 통합에서 비롯되었으며, 단순히 향상된 특징 추출 때문이 아니라는 점이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.