[논문 리뷰] Endowing Language Models with Multimodal Knowledge Graph Representations
이 논문은 밀도 벡터 인덱싱을 사용하여 VisualSem KG에서 엔티티 임베딩을 검색하여 다중모odal 지식 그래프(KG) 표현을 언어 모델에 통합함으로써 성능을 햖थ다. 하이브리드 튜플 기반 및 그래프 기반 모델을 통해 시각적, 텍스트적, 구조적 특징을 통합함으로써 다국어 NER에서 F1 점수 0.3–0.7% 향상되고, 다국어 시각적 의미 해석 해소 과제에서 최대 2.5% 정확도 향상됨.
We propose a method to make natural language understanding models more parameter efficient by storing knowledge in an external knowledge graph (KG) and retrieving from this KG using a dense index. Given (possibly multilingual) downstream task data, e.g., sentences in German, we retrieve entities from the KG and use their multimodal representations to improve downstream task performance. We use the recently released VisualSem KG as our external knowledge repository, which covers a subset of Wikipedia and WordNet entities, and compare a mix of tuple-based and graph-based algorithms to learn entity and relation representations that are grounded on the KG multimodal information. We demonstrate the usefulness of the learned entity representations on two downstream tasks, and show improved performance on the multilingual named entity recognition task by $0.3\%$--$0.7\%$ F1, while we achieve up to $2.5\%$ improvement in accuracy on the visual sense disambiguation task. All our code and data are available in: \url{https://github.com/iacercalixto/visualsem-kg}.
연구 동기 및 목표
- 모델 파라미터에 저장하는 대신 외부 다중모달 지식 그래프에 지식을 이관함으로써 NLU 모델의 파라미터 효율성을 향상시키기 위해.
- 시각적, 텍스트적, 구조적 신호가 어떻게 융합되어 지식 그래프 내에서 강력한 엔티티 및 관계 표현을 학습할 수 있는지 조사하기 위해.
- 이러한 학습된 표현이 다국어 및 시각-언어 설정에서의 하류 NLU 과제에서 어떻게 활용될 수 있는지 평가하기 위해.
- 향후 연구를 지원하기 위해 학습된 엔티티 및 관계 표현을 공개하기 위해.
- 다국어, 다중모달 KG에서 표현 학습을 위한 튜플 기반 및 그래프 기반 신경망 아키텍처의 성능을 비교하기 위해.
제안 방법
- 입력 문장(예: 독일어)을 기반으로 문장 검색 모델을 통해 VisualSem KG의 관련 엔티티를 밀도 벡터 인덱스를 사용해 검색함.
- 시각적 특징(ResNet-152 pool5 특징), 텍스트 기술(비트 임베딩), 구조적 그래프 정보를 동시에 인코딩하여 다중모달 엔티티 표현을 학습함.
- 링크 예측 성능 향상을 위해 튜플 기반(예: TransE 방식) 및 그래프 기반(예: GNN 기반) 방법을 융합한 하이브리드 표현 학습 프레임워크를 적용함.
- 양의 삼중항(헤드, 관계, 테일)이 음의 삼중항보다 더 가까이 임베딩되도록 대비 학습 목표를 사용함.
- 기본 언어 모델을 미세조정하지 않고, 검색된 엔티티 표현을 입력 표현과 연결하여 하류 모델에 외부 특징으로 통합함.
- 예측 성능 향상을 위해 입력에 검색된 엔티티 표현을 보완하는 두 층의 피드포워드 네트워크(ReLU 및 소프트맥스 활성화)를 적용함.
실험 결과
연구 질문
- RQ1VisualSem KG 내 엔티티 및 관계에 대한 다중모달 표현 학습에서 튜플 기반 및 그래프 기반 신경망 아키텍처는 어떻게 상호 비교되는가?
- RQ2링크 예측 맥락에서 시각적 및 텍스트적 모dal이 학습된 엔티티 표현 품질에 얼마나 기여하는가?
- RQ3추론 시 검색된 다중모달 KG 표현이 다국어 NER 및 다국어 시각적 동사 의미 해석 해소 과제 성능 향상에 기여하는가?
- RQ4외부 다중모달 지식 통합이 파라미터 효율성을 유지하면서 모델 성능에 어떻게 영향을 미치는가?
- RQ5시각적, 텍스트적, 구조적 정보 중 어떤 것이 최종 엔티티 표현 품질에 상대적으로 더 큰 영향을 미치는가?
주요 결과
- 링크 예측 성능 측정 기준으로 하이브리드 튜플-기반 및 그래프 기반 모델이 순수 튜플 기반 또는 그래프 기반 베이스라인보다 우수한 엔티티 표현 학습 성능을 보임.
- 엔티티 표현에 시각적 특징을 통합함으로써 다국어 시각적 동사 의미 해석 해소 과제에서 기준 모델 대비 정확도가 2.5%p 향상됨.
- 검색된 VisualSem 엔티티 표현을 사용할 경우 다국어 명명된 엔티티 인식 과제에서 F1 점수 0.3–0.7%p 향상됨.
- 14개 언어의 텍스트 기술 및 관련 이미지를 사용함으로써 학습된 엔티티 표현의 품질이 크게 향상되었으며, 특히 다국어 과제에서 두드러짐.
- 성능 향상 효과가 다양한 하류 아키텍처에서 일관되게 관찰되어, 검색된 표현이 강건하고 일반화 가능한 것으로 나타남.
- 공개된 엔티티 및 관계 표현이 하류 NLU 과제에서 효과적임을 입증하였으며, 향후 다중모달 지식 기반 연구의 가속화에 기여할 것으로 기대됨.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.