[논문 리뷰] A Survey of Knowledge Enhanced Pre-trained Language Models
이 종합 검토는 자연어 이해(NLU) 및 자연어 생성(NLG)을 위한 지식 강화 사전 훈련 언어 모델(KE-PLMs)에 대한 포괄적인 분류 체계를 제공한다. NLU의 경우 지식 유형(언어적, 텍스트, 지식 그래프, 규칙)에 따라, NLG의 경우 검색 기반 또는 지식 그래프 기반 접근 방식에 따라 분류한다. 주요 과제를 규명하고 향후 연구 방향으로 해석 가능성, 지속 학습, 효율성 최적화, 출력 다양성 향상을 제안한다.
Pre-trained Language Models (PLMs) which are trained on large text corpus via self-supervised learning method, have yielded promising performance on various tasks in Natural Language Processing (NLP). However, though PLMs with huge parameters can effectively possess rich knowledge learned from massive training text and benefit downstream tasks at the fine-tuning stage, they still have some limitations such as poor reasoning ability due to the lack of external knowledge. Research has been dedicated to incorporating knowledge into PLMs to tackle these issues. In this paper, we present a comprehensive review of Knowledge Enhanced Pre-trained Language Models (KE-PLMs) to provide a clear insight into this thriving field. We introduce appropriate taxonomies respectively for Natural Language Understanding (NLU) and Natural Language Generation (NLG) to highlight these two main tasks of NLP. For NLU, we divide the types of knowledge into four categories: linguistic knowledge, text knowledge, knowledge graph (KG), and rule knowledge. The KE-PLMs for NLG are categorized into KG-based and retrieval-based methods. Finally, we point out some promising future directions of KE-PLMs.
연구 동기 및 목표
- NLU 및 NLG 작업의 특수한 요구사항을 고려하여 지식 강화 사전 훈련 언어 모델(KE-PLMs)에 대한 체계적인 리뷰를 제공하는 것.
- NLU(지식 유형 기반: 언어적, 텍스트, 지식 그래프, 규칙) 및 NLG(지식 소스 기반: 검색 기반, 지식 그래프 기반)에 특화된 KE-PLMs의 전용 분류 체계 수립.
- 해석 가능성, 치명적 잊음, 계산 효율성, 생성 다양성 등의 주요 과제를 규명하고 분석하는 것.
- 지속적인 지식 통합 및 효율적인 지식 융합과 같은 KE-PLMs의 향후 연구 방향 제안.
제안 방법
- 이중 분류 체계 프레임워크 제안: NLU는 지식 유형(언어적, 텍스트, 지식 그래프, 규칙) 기반, NLG는 지식 소스(검색 기반, 지식 그래프 기반) 기반.
- 각 카테고리의 대표 모델 검토: 예를 들어 교차 모odal 지식 통합을 위한 ERNIE-VIL과 지식 그래프 기반 다단계 추론을 위한 GRF.
- 치명적 잊음 문제 완화를 위한 지속 학습 방법 제안: ELLE(모델 확장) 및 K-adapter(어댑터 기반 지식 저장) 등.
- 지식 통합 효율성 향상을 위한 최적화 전략 제안: 메모리 오버헤드를 줄이기 위한 ZeRO 기반 파rameter 분할.
- 다양성 향상 기법 탐색: MoKGE는 전문가 집합(mixture-of-experts)과 다양화된 일반 지식 추론을 활용해 다수의 타당한 출력을 생성.
- 명시적인 추론 경로를 통한 해석 가능성 분석: GRF가 예측의 투명성과 논리 일관성을 향상시키는 데 기여함을 보여줌.
실험 결과
연구 질문
- RQ1지식는 자연어 이해(NLU) 및 자연어 생성(NLG) 작업에 체계적으로 분류되고 통합될 수 있는가?
- RQ2기존의 PLMs가 추론 및 일반 지식 생성에서 겪는 주요 한계는 무엇이며, KE-PLMs는 이를 어떻게 해결하는가?
- RQ3기존 지식을 잊지 않고 시간이 지남에 따라 새로운 지식을 통합하면서도 성능을 유지할 수 있는가?
- RQ4대규모 PLMs에서 지식 통합의 계산 효율성을 향상시키기 위한 전략은 무엇인가?
- RQ5KE-PLMs는 어떻게 다수의 다양한, 맥락에 적합하고 논리적으로 일관된 출력을 생성하도록 향상시킬 수 있는가?
주요 결과
- 외부 지식를 통합함으로써 KE-PLMs는 NLU 작업에서 사실 정확도를 크게 향상시킨다. 예를 들어, 마스킹 언어 모델링에서 'Tiananmen'을 'the'가 아닌 정확하게 예측함.
- NLG에서 지식 강화 모델은 비지능형 모델이 문법적으로는 맞지만 논리적이지 않은 출력을 생성하는 것과는 달리 더 자연스럽고 논리적인 문장을 생성한다. 예: 'man is washing his hands with soap in a sink'.
- GRF와 같은 모델은 명시적인 추론 경로를 생성함으로써 더 높은 해석 가능성과 투명성, 논리 일관성을 확보한다.
- ELLE 및 K-adapter와 같은 지속 학습 방법은 모델 용량을 확장하거나 어댑터 모듈을 사용해 지식를 점진적으로 저장함으로써 치명적 잊음을 효과적으로 줄인다.
- ZeRO 기반 프레임워크는 장치 간 모델 파라미터, 기울기, 최적화기 상태를 분할함으로써 메모리 오버헤드를 감소시킨다.
- MoKGE와 같은 다양성 향상 기법은 일반 지식 그래프 내 이질적인 경로를 활용해 다수의 타당한 출력을 생성함으로써 생성 작업에서 출력 다양성을 증가시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.