Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Modal Answer Validation for Knowledge-Based VQA

Jialin Wu, Jiasen Lu|arXiv (Cornell University)|2021. 03. 23.
Multimodal Machine Learning Applications인용 수 16
한 줄 요약

이 논문은 지식 기반 VQA를 위한 다중 모odal 답변 검증 프레임워크인 MAVEx를 제안한다. 이는 답변 후보를 통해 시각적(구글 이미지), 텍스트적(위키백과), 공통 지식(ConceptNet) 지식 소스에서의 검색을 유도한다. 답변 전용 다중 해상도 지식 임베딩을 학습하여 답변을 검증함으로써, 단일 모델 성능이 40.3, 앙상블 성능이 41.4인 최신 기준(SOTA) 성능을 달성한다.

ABSTRACT

The problem of knowledge-based visual question answering involves answering questions that require external knowledge in addition to the content of the image. Such knowledge typically comes in various forms, including visual, textual, and commonsense knowledge. Using more knowledge sources increases the chance of retrieving more irrelevant or noisy facts, making it challenging to comprehend the facts and find the answer. To address this challenge, we propose Multi-modal Answer Validation using External knowledge (MAVEx), where the idea is to validate a set of promising answer candidates based on answer-specific knowledge retrieval. Instead of searching for the answer in a vast collection of often irrelevant facts as most existing approaches do, MAVEx aims to learn how to extract relevant knowledge from noisy sources, which knowledge source to trust for each answer candidate, and how to validate the candidate using that source. Our multi-modal setting is the first to leverage external visual knowledge (images searched using Google), in addition to textual knowledge in the form of Wikipedia sentences and ConceptNet concepts. Our experiments with OK-VQA, a challenging knowledge-based VQA dataset, demonstrate that MAVEx achieves new state-of-the-art results. Our code is available at https://github.com/jialinwu17/MAVEX

연구 동기 및 목표

  • 거대한 외부 사실이 정확한 답변 예측을 방해하는 지식 기반 VQA에서 노이즈가 많고 관련성이 없는 지식 검색 문제를 해결한다.
  • 일般 지식 검색에 의존하는 전통적인 이단계 VQA 파이프라인의 한계를 극복하여 종종 저품질의 지원 사실을 도출하는 문제를 해결한다.
  • 후보 답변에 의해 유도되는 외부 지식을 활용한 답변 검증으로 이행함으로써 답변 신뢰도를 향상시킨다.
  • 시각적, 텍스트적, 공통 지식의 다중 모odal 지식 소스를 종합적으로 활용하여 답변 검증 성능을 향상시킨다.
  • 다중 해상도 임베딩을 사용한 답변 유도 지식 검색이 더 정보가 풍부하고 신뢰할 수 있는 지원 증거를 제공함을 입증한다.

제안 방법

  • 모든 사실에 대한 완전한 검색이 필요 없도록 사전에 트레이닝된 VQA 모델(ViLBERT)을 사용해 고품질의 답변 후보 집합을 생성한다.
  • 각 답변 후보에 대해 질문과 답변에서 명사구를 추출하고, 세 가지 소스에서 지식을 검색하기 위한 타겟된 쿼리를 생성한다: 위키백과(텍스트), ConceptNet(공통 지식 개념), 구글 이미지(시각적 사실).
  • 다중 헤드 어텐션을 사용해 쿼리 수준, 명사구 수준, 질문 수준의 다중 해상도에서 검색된 지식을 임베딩한다. 이는 각 후보에 대해 핵심 정보를 강조한다.
  • 다중 해상도 임베딩에 대한 학습된 어텐션 메커니즘을 사용해, 주어진 후보에 대해 각 지식 소스의 신뢰도를 예측하는 답변 검증 모듈을 학습한다.
  • 가중치가 후보별로 예측되는 가중치 스코어링 메커니즘을 사용해 세 가지 지식 소스의 증거를 통합한다. 이는 소스 신뢰도를 반영한다.
  • 지식 검색과 검증을 함께 학습함으로써, 답변 예측에 대한 교차 엔트로피 손실을 사용해 전체 시스템을 엔드 투 엔드로 최적화한다.

실험 결과

연구 질문

  • RQ1질문이나 이미지 중심의 검색과 비교해, 답변 중심의 지식 검색이 지식 기반 VQA에서 지원 사실의 품질을 향상시키는가?
  • RQ2텍스트(위키백과), 공통 지식(ConceptNet), 시각적(이미지) 지식 소스의 다중 모달성은 후보 답변 검증에 얼마나 효과적인가?
  • RQ3쿼리, 명사구, 질문 수준의 다중 해상도 지식 임베딩은 관련성 있고 신뢰할 수 있는 증거를 식별하는 데 모델의 능력을 향상시키는가?
  • RQ4외부 지식을 사용한 답변 검증이 개방형, 지식 집약적인 VQA에서 전통적인 답변 생성 파이프라인을 능가하는가?
  • RQ5각 지식 소스의 기여도는 무엇이며, 서로 어떻게 상호보완적으로 작용하여 답변 검증을 지원하는가?

주요 결과

  • MAVEx는 OK-VQA 벤치마크에서 단일 모델 기준 최신 기준 성능 40.3을 달성하여 새로운 최고 기록을 수립했다.
  • 앙상블 모델은 41.4의 성능을 기록하여 다양한 지식 집약적인 VQA 예제에 대해 강력한 일반화 능력과 견고성을 보였다.
  • 위키백과, ConceptNet, 이미지의 세 가지 지식 소스를 모두 사용할 경우, ViLBERT 베이스라인 대비 5% 향상된 성능을 기록했으며, 각 소스의 기여도는 각각 +3.4, +3.3, +3.1 포인트였다.
  • 제거 실험 결과, 명사구 수준 또는 질문 수준의 다중 헤드 어텐션을 평균 풀링으로 대체할 경우 성능이 각각 39.77과 39.60으로 떨어지며, 해상도 어텐션의 중요성을 입증했다.
  • 답변 검증 단계만으로도, 검증 없이 검색된 지식을 사용하는 베이스라인 대비 성능이 1.1% 향상되어 그 효과를 확인했다.
  • 최고 성능 지식 소스를 각 예제에 대해 옵티마이제이션한 오라클 실험 결과 47.76의 성능을 기록하여, 향후 더 나은 소스 선택 전략에 의해 향상 가능성이 여전히 크다는 것을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.