[논문 리뷰] KgPLM: Knowledge-guided Language Model Pre-training via Generative and Discriminative Learning
이 논문은 공유 파라미터를 사용하여 생성적 지식 보완(마스크된 스펜 예측)과 분류적 지식 검증(스펜 교체 확인)을 공동 최적화하는 지식 유도 사전 훈련 프레임워크인 KgPLM을 제안한다. 위키백과와 위키데이터 지식 구조를 활용함으로써 KgPLM는 MRQA 벤치마크에서 SOTA 성능을 달성하여 TriviaQA에서 RoBERTa보다 +1.56 F1, NewsQA에서 +1.26 F1을 기록한다.
Recent studies on pre-trained language models have demonstrated their ability to capture factual knowledge and applications in knowledge-aware downstream tasks. In this work, we present a language model pre-training framework guided by factual knowledge completion and verification, and use the generative and discriminative approaches cooperatively to learn the model. Particularly, we investigate two learning schemes, named two-tower scheme and pipeline scheme, in training the generator and discriminator with shared parameter. Experimental results on LAMA, a set of zero-shot cloze-style question answering tasks, show that our model contains richer factual knowledge than the conventional pre-trained language models. Furthermore, when fine-tuned and evaluated on the MRQA shared tasks which consists of several machine reading comprehension datasets, our model achieves the state-of-the-art performance, and gains large improvements on NewsQA (+1.26 F1) and TriviaQA (+1.56 F1) over RoBERTa.
연구 동기 및 목표
- 위키백과와 위키데이터의 구조적 지식을 통합하여 사전 훈련된 언어 모델의 사실 기반 지식 유지 능력을 향상시키기 위해.
- 생성적 및 분류적 사전 훈련 목표를 조합함으로써 지식 통합에 있어 상호보완적 이점이 있는지 조사하기 위해.
- 로버타 아키텍처를 유지하고 미세조정 시 수정이 필요 없는 파라미터 효율적인 프레임워크를 개발하기 위해.
- 지식 집약적인 최종 작업에 대해 두 가지 훈련 체계—이중 타워 및 파이프라인—의 효과를 평가하기 위해.
- 지식 유도 사전 훈련이 지식 집약적인 질의 응답 벤치마크에서 표준 MLM 미세조정보다 우수한 성능을 보이는지 입증하기 위해.
제안 방법
- 생성적 지식 보완(마스크된 스펜 예측)과 분류적 지식 검증(스펜 교체 확인)을 위한 이중 목표 사전 훈련 프레임워크를 제안한다.
- 위키백과의 링크 구조와 위키데이터 지식 그래프를 조합한 하이브리드 지식 소스를 사용하여 훈련을 위한 사실적 스펜을 식별하고 마스킹한다.
- 이중 타워(생성자와 분류자를 병렬로 훈련)와 파이프라인(생성자 출력을 분류자에 입력)의 두 가지 훈련 체계를 도입한다.
- 생성자와 분류자 간에 공유 파라미터를 사용하여 모델 효율성을 유지하고 엔드 투 엔드 훈련을 가능하게 한다.
- 검증 강도를 향상시키기 위해 지식에 가까운 실체를 사용하여 분류자를 위한 음성 샘플을 구성한다.
- 아키텍처 수정 없이 RoBERTa BASE 아키텍처에서 모델을 사전 훈련하여 최종 작업으로의 직접 전이를 가능하게 한다.
실험 결과
연구 질문
- RQ1생성적 및 분류적 목표를 함께 훈련함으로써 사전 훈련된 언어 모델의 사실 기반 지식 유지 능력이 향상될 수 있는가?
- RQ2이중 타워와 파이프라인의 다른 사전 훈련 체계는 지식 유도 모델의 성능에 어떤 영향을 미치는가?
- RQ3구조적 지식 소스를 사용한 지식 유도 사전 훈련이 제로샷 및 희소한 지식 탐색 작업에서 더 우수한 성능을 내는가?
- RQ4제안된 방법은 지식 집약적인 최종 질문 응답 작업에서 표준 MLM 사전 훈련 및 다른 지식 증강 기반 베이스라인과 비교해 어떻게 성능을 냈는가?
- RQ5생성자 및 분류자 구성 요소가 최종 모델 성능에 기여하는 상대적 기여도는 어떠한가?
주요 결과
- 파이프라인 체계로 훈련한 KgPLM는 MRQA 공동 작업 벤치마크에서 SOTA 성능을 달성하여 TriviaQA에서 RoBERTa보다 +1.56 F1, NewsQA에서 +1.26 F1을 기록했다.
- 자연어 질문에서 평균 F1이 RoBERTa 대비 0.98 향상되었고, TriviaQA에서는 1.56 향상되어 여러 데이터셋에서 일관된 성능 향상을 보였다.
- 제거 실험 결과에서 생성자나 분류자를 제거할 경우 성능 저하가 발생하여 두 구성 요소가 지식 통합에 상호보완적인 역할을 한다는 점을 확인했다.
- 스펜 교체 확인을 위한 K-Replace 모듈은 핵심적이다. 이 모듈을 제거하면 특히 파이프라인 체계에서 성능 저하가 심각하게 발생한다.
- 표준 MLM을 사용해 위키백과에서 계속 사전 훈련하면 RoBERTa의 평균 F1이 0.53 향상되지만, KgPLM는 여전히 이 베이스라인을 능가하여 지식 유도 목표의 우수성을 입증한다.
- 이중 타워 및 파이프라인 체계 모두 RoBERTa보다 성능 향상을 보였으며, 특히 TriviaQA에서 파이프라인 체계가 가장 높은 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.