[논문 리뷰] VQA-GNN: Reasoning with Multimodal Knowledge via Graph Neural Networks for Visual Question Answering
VQA-GNN는 시각적 질문에 대한 답변을 위한 다중모odal 지식을 통합하기 위해 슈퍼 노드와 새로운 다중모달 GNN를 활용한 이방향 융합 프레임워크를 제안한다. 이는 비구조화된(예: QA 컨텍스트) 및 구조화된(예: 시나리오 그래프, 개념 그래프) 지식을 통합하며, VCR(Q-AR)에서 3.2% 및 GQA에서 4.6%의 강력한 기준 모델을 초월하는 최신 기술 성능을 달성한다. 이는 이질적인 지식 모odal 간의 향상된 공동 추론에 기인한다.
Visual question answering (VQA) requires systems to perform concept-level reasoning by unifying unstructured (e.g., the context in question and answer; "QA context") and structured (e.g., knowledge graph for the QA context and scene; "concept graph") multimodal knowledge. Existing works typically combine a scene graph and a concept graph of the scene by connecting corresponding visual nodes and concept nodes, then incorporate the QA context representation to perform question answering. However, these methods only perform a unidirectional fusion from unstructured knowledge to structured knowledge, limiting their potential to capture joint reasoning over the heterogeneous modalities of knowledge. To perform more expressive reasoning, we propose VQA-GNN, a new VQA model that performs bidirectional fusion between unstructured and structured multimodal knowledge to obtain unified knowledge representations. Specifically, we inter-connect the scene graph and the concept graph through a super node that represents the QA context, and introduce a new multimodal GNN technique to perform inter-modal message passing for reasoning that mitigates representational gaps between modalities. On two challenging VQA tasks (VCR and GQA), our method outperforms strong baseline VQA methods by 3.2% on VCR (Q-AR) and 4.6% on GQA, suggesting its strength in performing concept-level reasoning. Ablation studies further demonstrate the efficacy of the bidirectional fusion and multimodal GNN method in unifying unstructured and structured multimodal knowledge.
연구 동기 및 목표
- 기존 VQA 모델에서 비방향 융합의 한계로 인해 비구조화된 지식과 구조화된 다중모달 지식을 함께 추론하지 못하는 문제를 해결하기 위해.
- 비구조화된 지식(예: QA 컨텍스트, 시각적 영역)과 구조화된 지식(예: 시나리오 그래프, 개념 그래프)을 하나의 표현력 있는 표현으로 통합하여 추론 성능을 향상시키기 위해.
- 다양한 모달 간의 표현 갭을 줄이기 위해 상호 모달 메시지 전달 기능을 갖춘 다중모달 GNN를 도입하기 위해.
- 이방향 융합과 모달 인식 메시지 전달이 어려운 VQA 벤치마크에서 성능 향상에 크게 기여하는지 확인하기 위해.
제안 방법
- 질문과 답변를 나타내는 QA-컨텍스트 슈퍼 노드를 통해 VisualGenome에서 유래한 시나리오 그래프와 ConceptNet에서 유래한 개념 그래프를 연결함으로써 다중모달 의미 그래프를 구축한다.
- RoBERTa를 사용하여 QA 컨텍스트를 고밀도 벡터 표현으로 인코딩하고, 이를 그래프 내의 QA-컨텍스트 노드로 사용한다.
- VisualGenome에서 관련 시각적 영역를 검색하고 임베딩한 후 평균 풀링을 통해 집계하여 시나리오 그래프에 연결된 QA-개념 노드를 형성한다.
- QA-컨텍스트 노드와 시나리오 그래프 및 개념 그래프 내의 노드 간에 상호 모달 메시지 전달을 수행하는 모달 전용 GNN 모듈을 갖춘 다중모달 GNN를 도입한다.
- 시각 모달에 대한 m1 및 텍스트/개념 모달에 대한 m2와 같은 모달별 메시지 전달 메커니즘을 적용하여 표현 갭을 줄이고 이방향 정보 흐름을 가능하게 한다.
- 학습 중 RoBERTa 기반 QA-컨텍스트 노드의 가중치를 미세조정하여 다양한 모달 간의 상호 정보 집합을 가능하게 한다.

실험 결과
연구 질문
- RQ1비구조화된 지식과 구조화된 다중모달 지식 간의 이방향 융합이 시각적 질문에 대한 추론 성능을 향상시키는가?
- RQ2다중모달 GNN 아키텍처에서 상호 모달 메시지 전달이 비방향 융합 대비 VQA 벤치마크 성능에 어떤 영향을 미치는가?
- RQ3시각적 모달과 텍스트 모달 간의 표현 갭을 줄이면 답변 예측 정확도가 얼마나 향상되는가?
- RQ4모달 전용 메시지 전달 기능을 갖춘 제안된 다중모달 GNN가 일반 GNN보다 VQA 작업에서 더 우수한 성능을 내는가?
- RQ5슈퍼 노드 기반 그래프 구축 기법이 이질적인 지식 소스를 통합하여 공동 추론을 수행하는 데 얼마나 효과적인가?
주요 결과
- VQA-GNN는 강력한 기준 모델 대비 VCR 벤치마크에서 Q-AR 지표로 3.2%의 절대적 향상을 달성하여 개념 수준 추론에서의 효과성을 입증한다.
- GQA 벤치마크에서는 강력한 기준 모델 대비 4.6%의 향상을 달성하여 개방형 도메인 질문에 대한 답변에서의 강점을 보여준다.
- GQA 데이터셋에서 이방향 융합 메커니즘이 비방향 융합 변종 대비 성능을 4% 향상시키며 공동 추론에 유리함을 확인한다.
- 다중모달 GNN 기법은 모달 갭을 줄이고 VCR 벤치마크에서 일반 GNN보다 4.5% 높은 성능을 기록하며 상호 모달 메시지 전달의 유효성을 입증한다.
- 제거 실험 결과, 노드 표현의 평균 풀링은 제안된 방법(90.3%)에 비해 유의미하게 열등한 성능(62.3%)을 보이며, 모델이 중요한 구조적 관계를 포착하고 있음을 시사한다.
- 모델은 애초에 구문 기반 기능 프로그램을 사용하지 않아도 GQA에서 검증 정확도 90.3%를 달성하여 현실적인 설정에서 강력한 일반화 능력과 내구성을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.