[논문 리뷰] Combining pre-trained language models and structured knowledge
이 논문은 사전에 훈련된 언어 모델에 지식 그래프에서 유래한 구조적 지식을 통합하는 방법을 조사하며, 입력, 아키텍처, 출력 주입 기법을 평가한다. 어댑터 기반 지식 주입과 다수의 방법을 조합한 하이브리드 접근 방식이 사실성 일관성과 NLP 작업 성능 향상에 유망한 길로 밝혀진다.
In recent years, transformer-based language models have achieved state of the art performance in various NLP benchmarks. These models are able to extract mostly distributional information with some semantics from unstructured text, however it has proven challenging to integrate structured information, such as knowledge graphs into these models. We examine a variety of approaches to integrate structured knowledge into current language models and determine challenges, and possible opportunities to leverage both structured and unstructured information sources. From our survey, we find that there are still opportunities at exploiting adapter-based injections and that it may be possible to further combine various of the explored approaches into one system.
연구 동기 및 목표
- 지식 그래프에서 유래한 구조적 지식을 사전에 훈련된 트랜스포머 기반 언어 모델에 통합하는 기존 접근 방식을 검토하기 위해.
- 비구조적 텍스트 표현과 지식 그래프의 엄격한 기호적 지식을 결합할 때 발생하는 과제를 규명하기 위해.
- 입력 중심, 아키텍처 중심, 출력 중심 주입 기법의 효과성을 평가하기 위해.
- 다양한 주입 전략을 통합한 단일이고 더 효과적인 시스템으로의 통합 기회를 탐색하기 위해.
- 특히 어댑터 기반 주입과 하이브리드 아키텍처를 통해 지식과 언어 모델링 간의 더 밀접한 통합을 위한 유망한 연구 방향을 식별하기 위해.
제안 방법
- 지식 주입 기법을 세 가지 범주로 분류한다: 입력 중심(입력 데이터 또는 임베딩 수정), 아키텍처 중심(모델 레이어 수정), 출력 중심(손실 함수 또는 출력 수정).
- KALM(훈련 데이터에 지식 그래프 삼중항 주입), KnowBERT(어댑터 기반 주입), GCN-XLNet(GCN을 사용해 문맥 표현 강화)와 같은 특정 방법을 검토한다.
- Malaviya 등(2020)의 하이브리드 모델 분석: BERT 임베딩과 GCN 표현을 결합하고, 지식 그래프 보완을 위해 인코더-디코더 구조를 사용한다.
- 후기 특화 리프래이밍 임베딩과 신경 메모리 모듈을 갖춘 어댑터 모듈과 같은 향후 방법 제안: 지식 검색 및 융합 향상을 위한 것이다.
- 신호 기반 기법(예: KALM)과 어댑터 기반 방법(예: KnowBERT)을 조합하여 실체 표현의 문맥화를 향상시키는 것을 제안한다.
- LIBERT의 영감을 받아 실체 임베딩과 의미 신호를 통합하여, 트랜스포머 모델과 호환되는 방식으로 입력 표현을 풍부화시키는 것을 탐색한다.
실험 결과
연구 질문
- RQ1사전에 훈련된 언어 모델의 문맥 표현을 손상시키지 않으면서 지식 그래프에서 유래한 구조적 지식을 효과적으로 통합할 수 있는 방법은 무엇인가?
- RQ2입력 중심, 아키텍처 중심, 출력 중심 주입 기법의 상대적 강점과 한계는 무엇인가?
- RQ3어댑터 기반 방법은 최소한의 파라미터 업데이트로 효율적이고 효과적인 지식 주입을 가능하게 하는가?
- RQ4입력 + 아키텍처 + 출력과 같은 다수의 주입 전략을 하나의 시스템에 통합할 경우의 이점은 무엇인가?
- RQ5어떻게 신경 메모리 모듈을 어댑터와 통합하여 언어 모델의 지식 검색 및 문맥 융합 성능을 향상시킬 수 있는가?
주요 결과
- 사전에 훈련된 언어 모델은 일부 사실적 및 의미적 지식을 인코딩하고 있지만, 환각 현상에 취약하고 구조적 사실에 대한 엄격한 강제 조건이 부족하다.
- 지식 그래프 통합은 특히 질의 응답 및 지식 그래프 보완과 같은 후행 NLP 작업에서 사실성 일관성과 성능 향상에 기여한다.
- KnowBERT와 같은 어댑터 기반 주입 방법은 낮은 파라미터 오버헤드와 지식 인식 표현의 효과적 파생 학습 덕분에 유망한 성과를 보인다.
- GCN과 언어 모델을 조합한 하이브리드 모델(GCN-XLNet 등)은 구조적 표현과 문맥적 표현을 모두 활용함으로써 향상된 추론 능력을 보여준다.
- 입력 신호(예: 지식 그래프 삼중항)와 아키텍처 수정(예: 어댑터)을 조합하면 실체 표현의 문맥화가 향상될 수 있다.
- 입력, 아키텍처, 출력 주입 기법을 동시에 활용하는 통합 시스템을 개발할 여지가 여전히 남아 있으며, 최적의 지식 통합을 위한 것이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.