[논문 리뷰] MoSE: Modality Split and Ensemble for Multimodal Knowledge Graph Completion
MoSE는 다중모态 지식 그래프 완성(MKGC)을 위한 모odal별 표현 학습 및 앙상블 추론 프레임워크를 제안한다. 이는 관계 표현을 모달리티 수준에서 분리하여 모달리티 간 모순을 완화하고, 앙상블 방법을 통해 예측을 동적으로 가중하여 모달리티 특화 중요도를 반영한다. 실험 결과, MoSE는 세 가지 벤치마크 데이터셋에서 최신 기술을 초월하며, 텍스트 모달리티가 시각 모달리티보다 더 유용한 것으로 나타났다.
Multimodal knowledge graph completion (MKGC) aims to predict missing entities in MKGs. Previous works usually share relation representation across modalities. This results in mutual interference between modalities during training, since for a pair of entities, the relation from one modality probably contradicts that from another modality. Furthermore, making a unified prediction based on the shared relation representation treats the input in different modalities equally, while their importance to the MKGC task should be different. In this paper, we propose MoSE, a Modality Split representation learning and Ensemble inference framework for MKGC. Specifically, in the training phase, we learn modality-split relation embeddings for each modality instead of a single modality-shared one, which alleviates the modality interference. Based on these embeddings, in the inference phase, we first make modality-split predictions and then exploit various ensemble methods to combine the predictions with different weights, which models the modality importance dynamically. Experimental results on three KG datasets show that MoSE outperforms state-of-the-art MKGC methods. Codes are available at https://github.com/OreOZhao/MoSE4MKGC.
연구 동기 및 목표
- 다중모달 지식 그래프 완성(MKGC)에서 서로 다른 모달리티(예: 텍스트 대비 시각) 간 충돌하는 관계가 단일 관계 표현을 공유할 때 발생하는 모달리티 수준의 모순 문제를 해결하기 위해.
- 예측 시 모든 모달리티를 동일하게 취급하는 제한점을 극복하기 위해, 추론 과정에서 모달리티 특화 중요도를 동적으로 모델링함으로써.
- 훈련 과정에서 모달리티 간 관계 표현의 강한 결합을 분리하고, 추론 과정에서 적응형 융합을 가능하게 하는 새로운 프레임워크를 제안하기 위해.
- 텍스트 모달리티가 시각 모달리티보다 더 신뢰할 만한 정보를 제공함을 경험적으로 검증하기 위해, 특히 관계 예측에서의 성능을 고려하여.
제안 방법
- 훈련 단계에서 MoSE는 단일 공유 표현 대신 모달리티별로 분리된 관계 표현을 학습하여 모달리티 간 상호 간섭을 감소시킨다.
- 각 모달리티에 대해, 텍스트, 시각, 지식 그래프 구조에서 유도된 개체 및 관계 표현을 사용하여 별도의 표현 학습을 수행한다.
- 추론 단계에서 MoSE는 모달리티별로 분리된 표현을 사용해 각각 독립적인 예측을 생성한다.
- 예측을 모달리티 신뢰도에 따라 학습 가능한 가중치를 사용해 조합하기 위해, 초기, 후기, 적응형 추론과 같은 여러 앙상블 전략을 적용한다.
- 적응형 추론 방법은 온도 조절 소프트 어텐션 메커니즘을 사용해 모달리티 가중치를 동적으로 조정하며, 온도 스케일링을 통한 신뢰도 校정을 수행한다.
- 프레임워크는 세 가지 데이터셋(FB15K-237, WN18, WN9)에서 표준 MKGC 평가 지표(MR, MRR, Hits@10)를 사용해 평가된다.
실험 결과
연구 질문
- RQ1모달리티 간 관계 표현을 분리함으로써 다중모달 지식 그래프 완성 성능에 어떤 영향을 미치는가?
- RQ2고정되거나 공유되는 융합 전략에 비해, 모달리티 특화 예측에 대한 동적 앙상블 가중치가 MKGC 성능 향상에 기여하는가?
- RQ3텍스트 또는 시각 모달리티 중 어느 것이 엔티티 예측에 더 신뢰할 만하게 기여하는가? 이는 관계 유형에 따라 달라지는가?
- RQ4모달리티 예측의 불확실성은 최종 추론에 어떤 영향을 미치며, 이는 온도 스케일링을 통해 효과적으로 모델링될 수 있는가?
주요 결과
- MoSE는 모든 세 가지 벤치마크 데이터셋(FB15K-237, WN18, WN9)에서 최신 기술 성능을 달성하며, 9개의 기준 모델을 초월한다.
- FB15K-237에서 MoSE는 MRR 0.448과 Hits@10 0.687을 기록하여 이전 최고 기술인 RSME를 뛰어넘었다.
- 텍스트 모달리티가 시각 모달리티보다 훨씬 더 기여하며, country_of_origin 관계 사례에서 평균 모달리티 가중치는 텍스트가 70%, 시각이 0%였다.
- 온도 스케일링을 적용한 적응형 추론 방법(MoSE-AI)은 더 뛰어난 안정성과 성능 향상을 보였으며, 온도가 0.5에서 32로 증가함에 따라 성능이 안정화되고 향상되었다.
- 사례 연구 결과, MoSE-BI는 각 관계에 대해 높은 신뢰도를 가진 모달리티를 정확히 식별하여, 더 관련성이 높은 정보를 제공할 때 텍스트 모달리티에 더 높은 가중치를 할당함을 확인했다.
- 시각 모달리티는 데이터셋 간 성능이 불안정한 경향을 보였지만, 텍스트 모달리티는 일관되게 예측 품질을 향상시켰으며, 특히 맥락 이해가 필요한 관계에서 두드러진 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.