Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Graph Completion with Pre-trained Multimodal Transformer and Twins Negative Sampling

Yichi Zhang, Wen Zhang|arXiv (Cornell University)|2022. 09. 15.
Advanced Graph Neural Networks인용 수 7
한 줄 요약

이 논문은 피지컬베르트를 사용하여 미세조정 없이 깊이 있는 다중모달 특징을 추출하는 임베딩 기반 지식 그래프 완성 모델인 VBKGC를 제안한다. 이는 빠른 추론을 가능하게 하며, 구조적 및 다중모달 엔티티 임베딩을 정렬하기 위해 쌍둥이 음성 샘플링을 도입하여, 특히 WN9 데이터셋에서 기존 베이스라인을 모든 지표에서 능가하는 링크 예측 성능을 크게 향상시킨다.

ABSTRACT

Knowledge graphs (KGs) that modelings the world knowledge as structural triples are inevitably incomplete. Such problems still exist for multimodal knowledge graphs (MMKGs). Thus, knowledge graph completion (KGC) is of great importance to predict the missing triples in the existing KGs. As for the existing KGC methods, embedding-based methods rely on manual design to leverage multimodal information while finetune-based approaches are not superior to embedding-based methods in link prediction. To address these problems, we propose a VisualBERT-enhanced Knowledge Graph Completion model (VBKGC for short). VBKGC could capture deeply fused multimodal information for entities and integrate them into the KGC model. Besides, we achieve the co-design of the KGC model and negative sampling by designing a new negative sampling strategy called twins negative sampling. Twins negative sampling is suitable for multimodal scenarios and could align different embeddings for entities. We conduct extensive experiments to show the outstanding performance of VBKGC on the link prediction task and make further exploration of VBKGC.

연구 동기 및 목표

  • 기존 지식 그래프 완성 방법이 다중모달 정보를 효과적으로 활용하는 데에 한계가 있음을 해결하기 위해.
  • 다중모달 지식 그래프 완성에서 미세조정 기반 모델의 느린 추론 속도와 열악한 성능을 극복하기 위해.
  • 모델 아키텍처와 음성 샘플링 전략을 공동 설계하여 구조적 및 다중모달 임베딩 간의 정렬을 향상시키기 위해.
  • 수동적인 특징 융합 설계를 피하고 통합된 엔드 투 엔드 접근법을 개발하기 위해.
  • 쌍둥이 음성 샘플링이 다양한 다중모달 환경에서 서로 다른 임베딩 공간 간 정렬을 통해 성능 향상을 이끌어내는지 입증하기 위해.

제안 방법

  • VBKGC는 엔티티의 깊이 있는 융합된 시각-텍스트 특징을 추출하기 위해 사전 학습된 다중모달 트랜스포머 인코더인 VisualBERT를 사용하며, 이는 미세조정 없이 수행된다.
  • 모델은 여러 구성 요소로 이루어진 스코어 함수를 사용한다: $τ_{ss}$, $τ_{mm}$, $τ_{sm}$, $τ_{ms}$로, 이는 구조적, 다중모달, 교차모달 상호작용을 모두 포괄한다.
  • 쌍둥이 음성 샘플링은 구조적 및 다중모달 임베딩 간 정렬을 향상시키기 위해 공동 설계된 훈련 전략으로, 서로 다른 모달리티의 임베딩을 조합하여 음성 샘플을 생성한다.
  • 특히 다중모달 환경에서 효과적인 임베딩 수준의 정렬에 초점을 맞추어 엔티티 수준의 음성 샘플링을 피한다.
  • 모델는 마진 기반 손실 함수와 음성 샘플링을 사용하여 훈련되며, 쌍둥이 음성 샘플링은 다중모달 및 구조적 표현 간의 대비 학습을 강화한다.
  • 고정된 VisualBERT와 경량 스코어 함수를 사용함으로써 추론이 효율적이며, 기존 임베딩 모델과 유사한 빠른 예측을 가능하게 한다.

실험 결과

연구 질문

  • RQ1VisualBERT와 같은 사전 학습된 다중모달 트랜스포머가 미세조정 없이 지식 그래프 내 엔티티의 통합된 다중모달 표현을 효과적으로 추출할 수 있는가?
  • RQ2새로운 음성 샘플링 전략과 함께 모델을 공동 설계하면 다중모달 지식 그래프 완성에서 링크 예측 성능이 향상되는가?
  • RQ3다양한 데이터셋에서 쌍둥이 음성 샘플링은 구조적 및 다중모달 임베딩 간 정렬에 표준 음성 샘플링보다 얼마나 우월한가?
  • RQ4다양한 다중모달 KG 환경에서 음성 샘플 수의 영향은 쌍둥이 음성 샘플링의 성능에 어떤가?
  • RQ5VBKGC는 임베딩 기반 및 미세조정 기반 베이스라인과 비교해 추론 속도와 정확도 사이의 균형을 어떻게 유지하는가?

주요 결과

  • VBKGC는 WN9 데이터셋에서 최신 기준 성능을 달성하여 MRR 0.299, Hit@10 0.477, Hit@3 0.331, Hit@1 0.210을 기록하며, 모든 지표에서 기존 베이스라인을 능가한다.
  • FB15K-237 데이터셋에서는 MRR 0.299를 기록하여 높은 일반화 능력을 보였지만, 더 높은 음성 샘플 수에서 쌍둥이 음성 샘플링의 성능 향상 폭은 다소 작았다.
  • 쌍둥이 음성 샘플링은 WN9에서 성능 향상이 뚜렷했으며, 낮은 음성 샘플 수($k=1$)에서도 일반 음성 샘플링보다 뛰어난 성능을 보여, 효과적인 임베딩 정렬이 이루어졌음을 시사한다.
  • 제거 실험 결과, VisualBERT 제거(S1) 시 MRR가 0.226로 감소하여 깊이 있는 다중모달 특징 추출의 필요성을 입증한다.
  • 제거 실험 결과, 전체 스코어 함수($τ_{all}$) 또는 다중모달 구성($τ_{sm} + τ_{ms}$)을 사용할 경우 단일 구조적 또는 단모달 스코어만 사용하는 것보다 더 우수한 결과를 얻었으며, 이는 교차모달 상호작용의 중요성을 강조한다.
  • VBKGC는 TransE 및 IKRL와 유사한 빠른 추론 속도를 확보했으며, KG-BERT나 StAR와 같은 미세조정 기반 모델보다 훨씬 빠르며, 뛰어난 정확도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.