Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Learning on Multimodal Knowledge Graphs

W. X. Wilcke, Peter Bloem|arXiv (Cornell University)|2023. 09. 03.
Advanced Graph Neural Networks인용 수 6
한 줄 요약

이 논문은 지식 그래프 내의 구조적 관계와 다양한 모달리티(수치, 텍스트, 시간, 시각, 공간)를 종합적으로 고려하여 엔드 투 엔드로 학습하는 다중모달 메시지 전파 신경망을 제안한다. 이질적인 노드 특징을 공유 공간으로 매핑하기 위해 각 모달리티에 특화된 인코더를 사용함으로써, AIFB+, MUTAG, YAGO3-10+, ML100k 등의 다양한 데이터셋에서 노드 분류 및 링크 예측 성능이 유의미하게 향상되었으며, 통계적 유의성도 입증되었다.

ABSTRACT

Knowledge graphs enable data scientists to learn end-to-end on heterogeneous knowledge. However, most end-to-end models solely learn from the relational information encoded in graphs' structure: raw values, encoded as literal nodes, are either omitted completely or treated as regular nodes without consideration for their values. In either case we lose potentially relevant information which could have otherwise been exploited by our learning methods. We propose a multimodal message passing network which not only learns end-to-end from the structure of graphs, but also from their possibly divers set of multimodal node features. Our model uses dedicated (neural) encoders to naturally learn embeddings for node features belonging to five different types of modalities, including numbers, texts, dates, images and geometries, which are projected into a joint representation space together with their relational information. We implement and demonstrate our model on node classification and link prediction for artificial and real-worlds datasets, and evaluate the effect that each modality has on the overall performance in an inverse ablation study. Our results indicate that end-to-end multimodal learning from any arbitrary knowledge graph is indeed possible, and that including multimodal information can significantly affect performance, but that much depends on the characteristics of the data.

연구 동기 및 목표

  • 기존 엔드 투 엔드 모델이 지식 그래프 내의 리터럴 노드 특징을 간과하거나 과도하게 단순화하는 데서 비롯되는 한계를 해결하기 위해.
  • 숫자, 텍스트, 날짜, 이미지, 기하학적 구조 등과 같은 원시의 이질적인 다중모달 데이터를 통합된 지식 그래프 프레임워크 내에서 직접 학습할 수 있도록 하기 위해.
  • 각 모달리티에 맞는 전용 인코더를 사용하여 서로 다른 데이터 유형 간의 의미적 차이를 유지하는 메시지 전파 신경망을 설계하기 위해.
  • 역추적 분석(ablation study)을 통해 각 모달리티가 최종 작업 성능에 미치는 영향을 평가하고, 성능 향상에 기여하는 주요 특징을 파악하기 위해.

제안 방법

  • 모델은 관계 구조와 다섯 가지 별도의 모달리티(수치, 텍스트, 시간, 시각, 공간 특징)를 처리하는 다중모달 메시지 전파 프레임워크를 사용한다.
  • 각 모달리티는 전용 신경 인코더(예: 텍스트는 BERT, 이미지는 CNN, 좌표는 위치 인코딩)를 통해 모달리티 인식 표현을 생성한다.
  • 노드 표현은 이웃 노드로부터의 메시지 전파를 통해 업데이트되며, 관계 구조와 모달리티별 임베딩을 통합된 표현 공간에 통합한다.
  • 모델은 '통합 리터럴'(모든 특징을 하나의 노드로 통합)과 '분리 리터럴'(특징을 별도의 노드로 분리)이라는 두 가지 구성 방식을 지원하여 모달리티 기여도에 대한 추적 분석(ablation study)이 가능하다.
  • 기본 지식 그래프 스키마에 종속되지 않으며, 데이터 유형이 명시된 리터럴을 포함한 RDF 형식의 그래프에서 직접 작동한다.
  • 실제 및 시뮬레이션 데이터셋을 사용하여 노드 분류 및 링크 예측에 대한 평가를 수행하였으며, 반복 실행을 통한 p-값을 통해 통계적 유의성을 분석하였다.
Figure 1: A simplified and incomplete example from the Dutch Monuments Graph showing a single monument with several attributes of different modalities.
Figure 1: A simplified and incomplete example from the Dutch Monuments Graph showing a single monument with several attributes of different modalities.

실험 결과

연구 질문

  • RQ1지식 그래프에서 엔드 투 엔드 학습을 관계 구조 외에도 이질적인 다중모달 특징(수치, 텍스트, 시간, 시각, 공간)으로 효과적으로 확장할 수 있는가?
  • RQ2수치, 텍스트, 시간, 시각, 공간 등의 다양한 모달리티가 링크 예측 및 노드 분류 성능에 개별적으로 및 종합적으로 기여하는 정도는 어떠한가?
  • RQ3리터럴 값을 그 모달리티에 맞게(예: 수치 또는 이미지로) 처리하는 것이 일반적인 식별자로 간주하는 것보다 통계적으로 유의미한 성능 향상 효과를 보이는가?
  • RQ4통합 리터럴과 분리 리터럴 표현 방식의 선택이 모델 성능과 모달리티의 해석 가능성에 어떤 영향을 미치는가?
  • RQ5다양한 지식 그래프 데이터셋에서 어떤 모달리티가 가장 영향력이 크며, 이는 데이터 특성에 따라 달라지는가?

주요 결과

  • AIFB+와 ML100k에서 다중모달 특징을 포함함으로써 링크 예측 성능이 유의미하게 향상되었으며, 각각 p-값 1.24×10⁻⁴ 및 2.39×10⁻⁵로 강한 통계적 유의성을 보였다.
  • ML100k에서 다중모달 특징(구조 + 특징)을 사용한 모델은 Hits@10이 0.137을 기록했고, 구조만 사용한 경우 0.014에 그쳐 상당한 성능 향상을 보였다.
  • ML100k에서 시간 및 텍스트 특징이 가장 강력한 기여를 하였으며, Hits@10이 각각 0.146 및 0.138에 도달하여 수치 및 시각 특징을 능가했다.
  • YAGO3-10+에서는 다중모달 특징 추가로 Hits@10이 구조만 사용한 경우 0.074에서 0.044로 감소했지만, 여전히 통계적으로 유의미한(p = 9.50×10⁻⁴) 것으로 나타나, 맥락에 따라 유의미한 이점이 존재함을 시사했다.
  • 역추적 분석 결과, 성능 향상 기여도는 데이터셋에 따라 다름을 확인: ML100k에서는 텍스트 및 시간 특징이 가장 영향력 있었고, AIFB+에서는 수치 및 시간 특징이 뚜렷한 영향을 미쳤다.
  • AIFB+와 YAGO3-10+에서는 시각 및 공간 특징이 유의미한 향상 효과를 보이지 않아, 이러한 특징의 유용성은 지식 그래프 내 존재 여부 및 품질에 따라 달라질 수 있음을 시사했다.
Figure 2: Overview of how our model creates multimodal node embeddings for nodes $v_{1}$ to $v_{5}$ . Solid circles represent entities, whereas open shapes represent literals of different modalities. The nodes’ feature embeddings are learned using dedicated (neural) encoders (here $f$ , $g$ , and $h
Figure 2: Overview of how our model creates multimodal node embeddings for nodes $v_{1}$ to $v_{5}$ . Solid circles represent entities, whereas open shapes represent literals of different modalities. The nodes’ feature embeddings are learned using dedicated (neural) encoders (here $f$ , $g$ , and $h

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.