[논문 리뷰] Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge
이 논문은 훈련 중에 외부 지식 기반(KB) 임베딩과의 정렬을 통해 시각-언어 트랜스포머의 학습된 표현을 개선하는 지식 주입 기법을 제안한다. ConceptNet과 Wikidata와의 정렬을 위해 보조 대비 목적함수를 사용함으로써, 지식 집약적 VQA 작업(예: OK-VQA에서 +1.78%)에서 성능이 크게 향상되었고, 놀랍게도 시각적 추론 벤치마크(예: NLVR2에서 +1.28%)에서도 성능 향상이 관찰되어, KB 정규화가 의미적 및 관계적 표현 학습을 향상시킨다는 것을 보여준다.
The limits of applicability of vision-and-language models are defined by the coverage of their training data. Tasks like vision question answering (VQA) often require commonsense and factual information beyond what can be learned from task-specific datasets. This paper investigates the injection of knowledge from general-purpose knowledge bases (KBs) into vision-and-language transformers. We use an auxiliary training objective that encourages the learned representations to align with graph embeddings of matching entities in a KB. We empirically study the relevance of various KBs to multiple tasks and benchmarks. The technique brings clear benefits to knowledge-demanding question answering tasks (OK-VQA, FVQA) by capturing semantic and relational knowledge absent from existing models. More surprisingly, the technique also benefits visual reasoning tasks (NLVR2, SNLI-VE). We perform probing experiments and show that the injection of additional knowledge regularizes the space of embeddings, which improves the representation of lexical and semantic similarities. The technique is model-agnostic and can expand the applicability of any vision-and-language transformer with minimal computational overhead.
연구 동기 및 목표
- 단지 쌍화된 이미지-텍스트 데이터셋으로만 훈련된 시각-언어 모델에서의 사실적 및 일반 지식의 부족 문제를 해결하기 위해.
- 일반 목적의 지식 기반(KB)에서 외부 지식을 주입함으로써 다중 모odal 트랜스포머의 추론 성능 향상 여부를 조사하기 위해.
- 다양한 시각-언어 벤치마크에서 다른 KB들(예: ConceptNet, Wikidata)의 영향을 평가하기 위해.
- 지식 주입이 외부 사실을 명시적으로 필요로 하지 않는 시각적 추론 작업에도 효과가 있는지 분석하기 위해.
- 지식 주입이 모델에 종속적이지 않고 계산 비용이 적게 들며, 넓은 적용 범위를 가짐을 보여주기 위해.
제안 방법
- 보조 대비 훈련 목적함수를 통해 외부 KB(ConceptNet, Wikidata)에서 지식을 시각-언어 트랜스포머에 주입한다.
- 사전 훈련된 그래프 임베딩 모델(예: TransE, DistMult)을 사용해 지식 기반 엔티티를 벡터 공간에 임베딩한다.
- 훈련 중에 모델의 어텐션 및 표현 레이어를 대비 손실 함수를 사용해 해당 KB 임베딩과 정렬함으로써 정규화한다.
- LXMERT 아키텍처에 이 기법을 적용하고, VQA, NLVR2, SNLI-VE, OK-VQA 데이터셋에서 미세조정을 수행한다.
- 이 방법은 모델에 종속적이지 않으며, 최소한의 계산 오버헤드로도 어떤 시각-언어 트랜스포머에나 적용 가능하다.
- 어휘적, 의미적, 관계적 표현 학습에 미치는 영향을 분석하기 위해 探색 실험을 수행한다.
실험 결과
연구 질문
- RQ1외부 KB에서 지식을 주입함으로써 시각-언어 추론 작업의 성능 향상이 가능한가?
- RQ2지식 주입이 외부 사실을 명시적으로 필요로 하지 않는 시각적 추론 작업에도 유익한가?
- RQ3다양한 지식 기반(예: ConceptNet 대비 Wikidata)은 다중 모달 표현 향상에 있어 어떤 정도로 효과적인가?
- RQ4지식 주입이 얼마나 임베딩 공간을 정규화하고 의미적 및 관계적 유사도 학습을 향상시키는가?
- RQ5이 방법은 최소한의 아키텍처 수정으로도 다양한 시각-언어 벤치마크에 효과적으로 적용 가능한가?
주요 결과
- 지식 주입 기법은 기준 LXMERT-GitHub 모델 대비 OK-VQA에서 1.78%p 향상(37.26% → 39.04%)을 기록했다.
- NLVR2에서 1.28%p 향상(71.31% → 72.59%)을 달성하여, 시각적 추론 작업에서도 유의미한 성능 향상이 있음을 보여주었다.
- 제거 실험 결과, KB에서 영양 관련 엔티티를 제거하면 영양 관련 질문에 대한 정확도가 91.11%에서 68.89%로 감소하여, 성능 향상의 원인이 지식 주입임을 입증했다.
- 탐색 실험 결과, 지식 주입이 어휘적 및 의미적 유사도를 더 잘 포착할 수 있도록 모델의 표현 학습 능력을 향상시킨다.
- 이 방법은 다양한 벤치마크에서 효과적이며, 모델에 종속적이지 않아 어떤 시각-언어 트랜스포머에나 최소한의 훈련 비용으로 통합 가능하다.
- 비록 이점이 있지만, Wikidata의 성능은 노이즈와 모호성으로 인해 제한되었으며, 대규모이고 덜 구조화된 KB를 활용하는 데 도전 과제가 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.