[논문 리뷰] CoLAKE: Contextualized Language and Knowledge Embedding
CoLAKE는 언어와 지식을 단일어 지식 그래프 (WK 그래프)에 통합함으로써 문맥화된 언어 및 지식 표현을 공동으로 학습하는 통합 프레임워크를 제안한다. 이는 마스킹된 단어, 실체, 관계를 동시에 예측하도록 마스킹된 언어 모델링 목적을 확장한다. CoLAKE는 지식 집약적인 NLP 작업과 새로운 단어-지식 그래프 보완 작업에서 최신 기술 수준의 성능을 달성하며, 이전 모델에 비해 뛰어난 인도적 편향과 구조 인식 능력을 보여준다.
With the emerging branch of incorporating factual knowledge into pre-trained language models such as BERT, most existing models consider shallow, static, and separately pre-trained entity embeddings, which limits the performance gains of these models. Few works explore the potential of deep contextualized knowledge representation when injecting knowledge. In this paper, we propose the Contextualized Language and Knowledge Embedding (CoLAKE), which jointly learns contextualized representation for both language and knowledge with the extended MLM objective. Instead of injecting only entity embeddings, CoLAKE extracts the knowledge context of an entity from large-scale knowledge bases. To handle the heterogeneity of knowledge context and language context, we integrate them in a unified data structure, word-knowledge graph (WK graph). CoLAKE is pre-trained on large-scale WK graphs with the modified Transformer encoder. We conduct experiments on knowledge-driven tasks, knowledge probing tasks, and language understanding tasks. Experimental results show that CoLAKE outperforms previous counterparts on most of the tasks. Besides, CoLAKE achieves surprisingly high performance on our synthetic task called word-knowledge graph completion, which shows the superiority of simultaneously contextualizing language and knowledge representation.
연구 동기 및 목표
- 기존 지식 강화 언어 모델에서 정적이고 별도로 사전 학습된 실체 임베딩의 한계를 해결하기 위해.
- 실체 주변의 사실 지식 서브그래프를 통합하여 동적이고 문맥 인식 가능한 지식 표현을 가능하게 하기 위해.
- 이질적인 언어와 지식 구조를 단일이고 통합된 입력 형식으로 통합하여 공동 표현 학습을 가능하게 하기 위해.
- 모델이 미리 보지 않은 실체로 일반화하는 능력과 지식의 구조적 및 의미적 특징을 포착하는 능력을 평가하기 위해.
- 제안된 단어-지식 그래프가 지식 집약적인 NLP 응용 분야의 기초로 활용될 잠재력을 탐색하기 위해.
제안 방법
- 대규모 지식 기반에서 추출한 지식 서브그래프와 완전히 연결된 단어 그래프를 통합한 단어-지식 그래프 (WK 그래프)를 구성한다.
- 텍스트 내 실체 참조를 사용하여 해당 실체 중심의 지식 서브그래프를 검색하고 WK 그래프에 모자이크한다.
- 이질적인 WK 그래프 입력을 처리할 수 있도록 트랜스포저 인코더를 수정하며, 다양한 유형의 노드(단어, 실체, 관계)를 다룰 수 있도록 어텐션 메커니즘을 조정한다.
- 마스킹된 언어 모델링 (MLM) 목적을 확장하여 WK 그래프 내에서 마스킹된 단어, 실체, 관계를 동시에 예측하도록 한다.
- 확장된 MLM 목적을 사용하여 대규모 WK 그래프에서 CoLAKE를 사전 학습함으로써 언어 및 지식 표현의 공동 최적화를 가능하게 한다.
- 인접 행렬을 사용하여 그래프 구조를 인코딩하고 인코더 내 메시지 전달 과정에서 정보 흐름을 안내한다.
실험 결과
연구 질문
- RQ1정적 실체 임베딩을 사용하는 모델에 비해, 문맥화된 언어 및 지식 표현을 공동으로 학습하는 것이 지식 집약적인 NLP 작업 성능을 향상시키는가?
- RQ2단일 실체 임베딩이 아닌, 실체 주변의 동적 지식 컨텍스트(즉, 서브그래프)를 효과적으로 활용할 경우, 문맥 이해 능력이 얼마나 향상되는가?
- RQ3제안된 단어-지식 그래프 (WK 그래프)의 구조가 새로운 실체로의 인도적 일반화를 얼마나 잘 지원하는가?
- RQ4기존의 지식 임베딩 모델에 비해, CoLAKE는 새로운 합성 작업인 단어-지식 그래프 보완 작업에서 얼마나 잘 수행되는가?
- RQ5언어 및 지식 표현의 공동 모델링이 학습된 임베딩에서 구조적 및 의미적 특징을 얼마나 잘 유지하는가?
주요 결과
- CoLAKE는 GLUE 벤치마크의 대부분의 지식 기반 및 언어 이해 작업에서 이전의 반문맥화된 공동 모델을 능가한다.
- 이행 설정에서 단어-지식 그래프 보완 작업에서 CoLAKE는 평균 역순위 (MRR) 82.48을 기록했으며, TransE (67.30), DistMult (60.56), ComplEx (61.09), RotatE (70.90)를 크게 앞서며 성능을 뛰어나게 한다.
- 유도 설정에서는 MRR 28.10을 기록하여 DKRL의 MRR 8.18을 크게 앞서며, 새로운 실체로의 일반화 능력이 뛰어나다는 것을 입증한다.
- 합성된 단어-지식 그래프 보완 작업에서의 성능은 CoLAKE가 구조적 그래프 정보와 의미적 텍스트 컨텍스트를 모두 효과적으로 활용할 수 있음을 확인한다.
- CoLAKE는 이웃 정보에 기반해 실체 표현을 생성하므로 강력한 인도적 편향을 보이며, 고정 또는 설명 기반 임베딩에 의존하는 모델과는 다르다.
- 결과는 WK 그래프가 지식 집약적인 NLP 응용 분야에서 효과적인 전이 학습과 일반화를 가능하게 하는 강력하고 구조 인식 능력을 갖춘 표현임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.