[논문 리뷰] KELM: Knowledge Enhanced Pre-Trained Language Representations with Message Passing on Hierarchical Relational Graphs
KELM는 BERT와 같은 사전 훈련된 언어 모델에 지식 그래프(KG)에서 동적으로 사실 지식을 통합하는 지식 강화 미세조정 프레임워크를 제안한다. 이는 통합 지식 강화 텍스트 그래프(UKET)를 통해 이루어지며, 텍스트, 실체 참조, KG 부분 그래프 간의 계층적 관계 메시지 전달을 통해 지식의 모호성을 해결하고 MRC 작업에서 최신 기술 수준의 성능을 달성한다. ReCoRD에서는 이전 모델 대비 최대 +3.2 EM, MultiRC에서는 +3.1 EM을 기록한다.
Incorporating factual knowledge into pre-trained language models (PLM) such as BERT is an emerging trend in recent NLP studies. However, most of the existing methods combine the external knowledge integration module with a modified pre-training loss and re-implement the pre-training process on the large-scale corpus. Re-pretraining these models is usually resource-consuming, and difficult to adapt to another domain with a different knowledge graph (KG). Besides, those works either cannot embed knowledge context dynamically according to textual context or struggle with the knowledge ambiguity issue. In this paper, we propose a novel knowledge-aware language model framework based on fine-tuning process, which equips PLM with a unified knowledge-enhanced text graph that contains both text and multi-relational sub-graphs extracted from KG. We design a hierarchical relational-graph-based message passing mechanism, which can allow the representations of injected KG and text to mutually update each other and can dynamically select ambiguous mentioned entities that share the same text. Our empirical results show that our model can efficiently incorporate world knowledge from KGs into existing language models such as BERT, and achieve significant improvement on the machine reading comprehension (MRC) task compared with other knowledge-enhanced models.
연구 동기 및 목표
- 기존 지식 강화 PLM가 고비용 재훈련이 필요하고 지식의 모호성 문제를 해결하기 어려운 점을 해결하기 위해.
- 재훈련이 아닌 미세조정 단계에서 동적이고 맥락 인식 지식 주입을 가능하게 하여 다양한 도메인에 대한 적응성을 향상시키기 위해.
- 다중 관계 KG에서 동일한 텍스트를 공유하는 여러 후보 실체 중 맥락적으로 가장 관련성이 높은 실체를 선택하여 지식의 모호성을 해결하기 위해.
- 기본 PLM를 재훈련하지 않고도 이질적인 텍스트 및 구조화된 지식을 통합 지식 그래프 표현을 통해 효율적으로 융합하기 위해.
제안 방법
- 텍스트 전용 시퀀스, 실체 참조-KG 실체 링크, 참조된 실체 중심의 KG 부분 그래프를 통합한 통합 지식 강화 텍스트 그래프(UKET)를 구성한다.
- 텍스트 그래프, 실체-링크 그래프, KG 부분 그래프 간을 번갈아가며 표현을 갱신하는 계층적 관계 메시지 전달 메커니즘을 적용한다.
- 텍스트 맥락에 기반해 동일한 텍스트를 공유하는 여러 후보 실체 중 가장 맥락적으로 관련성이 높은 실체를 동적으로 선택하기 위해 어텐션 기반 스코어링을 사용한다.
- 다중 관계 KG를 통해 메시지 전달 전략을 적용하여 맥락 민감한 실체 표현을 가능하게 한다.
- 기본 PLM를 대규모 코퍼스에서 재훈련할 필요 없이 미세조정 단계에서 지식 주입을 통합한다.
실험 결과
연구 질문
- RQ1미세조정 단계에서의 지식 주입이 효율성과 도메인 적응성 측면에서 재훈련 기반 방법보다 우월한가?
- RQ2텍스트 맥락에 기반해 KG에서 다수의 모호한 실체 참조 중 정확한 실체를 동적으로 선택할 수 있는가?
- RQ3통합 텍스트-KG 그래프에서의 계층적 메시지 전달이 기계 독해 이해에서 사실 기반 추론을 향상시킬 수 있는가?
- RQ4동적 지식 통합이 관련 없거나 모호한 실체 후보에서 오는 노이즈를 어느 정도 감소시킬 수 있는가?
주요 결과
- ReCoRD 데이터셋에서 KELM는 이전 SOTA 지식 강화 모델 대비 +3.2 EM 및 +1.9 F1 향상률을 기록한다.
- MultiRC에서는 BERT_large 대비 +3.1 EM 및 +0.8 F1 향상률을 기록하였으며, KT-NET 대비 EM+F1 합산에서 +1.5 향상되었다.
- 사례 연구를 통해 모델은 맥락에 따라 'ban'을 명사('ban.n.04')로 해석할지 동사('ban.v.02')로 해석할지 정확하게 선택함으로써 지식의 모호성을 효과적으로 해결한다.
- 어텐션 기반 실체 선택 메커니즘은 맥락적으로 관련성이 높은 실체에 더 높은 가중치를 할당한다. 예를 들어, 주어진 예시에서 'ban.n.04'(0.715)에 비해 'ban.v.02'(0.205)에 더 낮은 가중치를 할당한다.
- 기본 PLM의 재훈련 없이도 다양한 도메인에 대해 우수한 일반화 성능을 보이며, 새로운 지식 그래프에 빠르게 적응할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.