Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-shot Visual Question Answering using Knowledge Graph

Zhuo Chen, Jiaoyan Chen|arXiv (Cornell University)|2021. 07. 12.
Multimodal Machine Learning Applications참고 문헌 29인용 수 5
한 줄 요약

이 논문은 외부 지식과 이미지-질문 쌍을 정렬하기 위해 마스크 기반 학습을 사용하는 지식 그래프 기반의 제로샷 시각질문응답(ZS-VQA) 방법을 제안한다. 이는 미리 보지 않은 답변에 대한 정확한 예측을 가능하게 한다. 제로샷 VQA에 하드 마스크를, 표준 VQA에 소프트 마스크를 활용함으로써, F-VQA 데이터셋에서 기존의 엔드 투 엔드 모델보다 크게 향상된 성능을 달성하고, 새로운 답변에 대한 최신 기술(SOTA) 성능을 확보한다.

ABSTRACT

Incorporating external knowledge to Visual Question Answering (VQA) has become a vital practical need. Existing methods mostly adopt pipeline approaches with different components for knowledge matching and extraction, feature learning, etc.However, such pipeline approaches suffer when some component does not perform well, which leads to error propagation and poor overall performance. Furthermore, the majority of existing approaches ignore the answer bias issue -- many answers may have never appeared during training (i.e., unseen answers) in real-word application. To bridge these gaps, in this paper, we propose a Zero-shot VQA algorithm using knowledge graphs and a mask-based learning mechanism for better incorporating external knowledge, and present new answer-based Zero-shot VQA splits for the F-VQA dataset. Experiments show that our method can achieve state-of-the-art performance in Zero-shot VQA with unseen answers, meanwhile dramatically augment existing end-to-end models on the normal F-VQA task.

연구 동기 및 목표

  • 오픈 월드 장면 이해에서 미리 보지 않은 답변을 가진 제로샷 VQA 문제에 대응한다.
  • 파이프라인 기반 VQA 방법에서 발생하는 오류 전파 문제를 해결하기 위해 통합적이고 엔드 투 엔드 호환 가능한 프레임워크를 도입한다.
  • 제로샷 일반화 능력을 평가하기 위해 새로운 ZS-F-VQA 데이터셋을 개발한다.
  • 적응형 마스크 전략을 통해 표준 VQA와 ZS-VQA 작업에 모두 모델을 탄력적으로 적용할 수 있도록 한다.
  • 지식 그래프 정렬을 통한 외부 지식 통합으로 기존 엔드 투 엔드 모델의 성능을 향상시킨다.

제안 방법

  • 세 가지 별도의 특징 매핑 공간(의미적 관계, 객체(지지 엔티티), 지식(답변))을 학습하여 이미지-질문 임베딩의 공동 정렬을 달성한다.
  • 모든 삼중항을 포함하는 사실 기반 지식 그래프에서, 지지 엔티티와 관계에 기반해 마스크 생성을 안내하는 매핑 테이블을 구축한다.
  • 예측된 새로운 답변에 대해 ZS-VQA 작업에서는 하드 마스크를 적용하며, 높은 신뢰도 정렬 점수를 제약 조건으로 사용한다.
  • 표준 VQA 작업에서는 소프트 마스크를 적용하여 오류 전파를 줄이고, 낮은 신뢰도 가이드를 통해 점진적인 예측 수정을 가능하게 한다.
  • 이미지-질문(I-Q) 쌍과 대상 엔티티/관계 간 유사도 점수를 기반으로 하드 마스크와 소프트 마스크 적용을 구분하기 위해 임계값(점수 ≥100)을 사용한다.
  • 지식 그래프 정렬에 기반해 예측 점수를 동적으로 조정할 수 있도록 마스크 기반 메커니즘을 답변 예측 헤드에 통합한다.

실험 결과

연구 질문

  • RQ1지식 그래프 기반 접근 방식이 훈련 중에 전혀 보지 않은 답변을 효과적으로 예측할 수 있는가?
  • RQ2제로샷 환경에서 강력한 가이드를 제공하면서도 표준 VQA에서 최소한의 간섭을 유도할 수 있도록 마스크 전략을 어떻게 설계할 수 있는가?
  • RQ3지식 그래프에서 유래한 외부 지식이 VQA에서 새로운 답변에 대한 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ4지식 그래프 내 지지 엔티티와 관계의 수가 다양할 경우 모델 성능는 어떻게 변하는가?
  • RQ5제안된 방법은 아키텍처 변경 없이 제로샷 및 표준 VQA 작업에 모두 탄력적으로 적용될 수 있는가?

주요 결과

  • 제안된 방법은 새로운 ZS-F-VQA 데이터셋에서 최신 기술 성능을 달성하였으며, 기존 방법 대비 새로운 답변 예측에서 30–40% 향상된 성능을 보였다.
  • 표준 F-VQA 벤치마크에서 기존 엔드 투 엔드 모델 대비 정확도가 6–9% 향상되어, 다양한 작업에서 일관된 성능 향상을 입증하였다.
  • 하드 마스크는 훈련 데이터가 부족한 상황에서 지식 그래프 사실과의 강력한 정렬을 강제함으로써 제로샷 환경에서 성능 향상에 기여한다.
  • 소프트 마스크는 오류 전파를 줄이기 위해 부드러운 제약 조건으로 작용함으로써, 잘못된 사전 예측에 과도하게 의존하는 것을 방지하여 표준 VQA 환경에서 더 효과적이다.
  • 모델는 높은 해석 가능성(해석 가능성)을 보이며, 시각화 결과는 기존 모델가 표면적인 패턴이나 기억된 답변에 의존하는 데 반해, 이 모델은 구조화된 지식을 활용해 예측을 유도한다는 것을 확인하였다.
  • 확률적 점수 기반 메커니즋试로 다중 답변 예측에 잘 일반화되며, 희귀하거나 전혀 보지 않은 답변까지도 다수의 타당한 답변을 순위 매김할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.