Skip to main content
QUICK REVIEW

[논문 리뷰] Fusing Context Into Knowledge Graph for Commonsense Question Answering

Yichong Xu, Chenguang Zhu|arXiv (Cornell University)|2020. 12. 09.
Topic Modeling참고 문헌 26인용 수 8
한 줄 요약

이 논문은 ALBERT라는 사전 훈련된 언어 모델에 지식 그래프(ConceptNet)와 위키사전에서 추출한 문맥적 설명을 융합하는 DEKCOR 모델을 제안한다. 이 모델은 실체 정의와 관련 지식 삼중항을 통합하여 CommonsenseQA에서 최신 기준 성능(+1.2% 단일 모델, +3.8% 앙상블)을 달성했으며, 생성형 모델에 의존하지 않는 비생성 모델 중 OpenBookQA에서 최고 성능을 기록했다.

ABSTRACT

Commonsense question answering (QA) requires a model to grasp commonsense and factual knowledge to answer questions about world events. Many prior methods couple language modeling with knowledge graphs (KG). However, although a KG contains rich structural information, it lacks the context to provide a more precise understanding of the concepts. This creates a gap when fusing knowledge graphs into language modeling, especially when there is insufficient labeled data. Thus, we propose to employ external entity descriptions to provide contextual information for knowledge understanding. We retrieve descriptions of related concepts from Wiktionary and feed them as additional input to pre-trained language models. The resulting model achieves state-of-the-art result in the CommonsenseQA dataset and the best result among non-generative models in OpenBookQA.

연구 동기 및 목표

  • 지식 그래프(KG)에서 실체에 대한 정확한 이해를 제한하는 문맥적 설명 부족 문제를 해결한다.
  • 위키사전에서 추출한 외부 기술적 지식을 통합하여 지식 그래프 내 실체 표현을 풍부화시켜 공통지식 기반 질의 응답을 향상시킨다.
  • 사전 훈련된 언어 모델에 구조화된 지식(ConceptNet에서 유래)과 비구조화된 문맥(위키사전에서 유래)을 융합하여 더 나은 추론 성능을 달성한다.
  • 대규모 생성형 모델에 의존하지 않고 벤치마크 공통지식 기반 질의 응답 데이터셋에서 최신 기준 성능을 달성한다.

제안 방법

  • 질문과 선택지의 개념을 추출한 후, ConceptNet에서 그들 사이의 직접적인 간선을 검색한다. 만약 존재하지 않으면 선택지 실체를 포함하는 유사도가 가장 높은 삼중항을 선택한다.
  • 다중 기준 텍스트 매칭을 사용하여 위키사전에서 정확한 실체 정의를 검색하여 의미적 관련성을 확보한다.
  • 질문, 후보 선택지, 선택된 지식 삼중항, 실체 설명을 ALBERT 언어 모델에 입력하여 답변 점수를 산출한다.
  • 다양한 랜덤 시드로 초기화된 다수의 모델을 사용하여 앙상블 추론을 적용하여 정확성과 견고성을 향상시킨다.
  • OpenBookQA 모델을 CommonsenseQA의 훈련 세트에서 미리 훈련하여 대상 데이터셋에서의 성능 향상을 도모한다.
  • 제거 실험을 수행하여 실체 설명과 지식 삼중항이 최종 성능에 기여하는 정도를 분리하여 분석한다.

실험 결과

연구 질문

  • RQ1위키사전에서 유래한 외부 실체 설명은 지식 그래프 기반 QA 모델의 공통지식 추론 성능을 향상시킬 수 있는가?
  • RQ2문맥 기반 설명의 통합은 사전 훈련된 언어 모델의 공통지식 QA 성능에 어떤 영향을 미치는가?
  • RQ3ConceptNet에서 유래한 지식 삼중항과 위키사전에서 유래한 실체 설명이 답변 정확도에 독립적으로 기여하는 정도는 어느 정도인가?
  • RQ4생성형 모델에 의존하지 않는 비생성 모델이 대규모 T5 기반 생성 모델을 제외한 OpenBookQA에서 최신 기준 성능을 달성할 수 있는가?
  • RQ5지식 융합과 함께 사용될 때, 기반 사전 훈련된 언어 모델의 선택이 최종 QA 성능에 상당한 영향을 미치는가?

주요 결과

  • DEKCOR는 단일 모델로 이전 최신 기준 대비 CommonsenseQA에서 1.2%p의 절대적 성능 향상을 달성했으며, 앙상블 추론을 통해 3.8%p 향상되었다.
  • OpenBookQA에서 DEKCOR는 모든 비생성 모델 중에서 가장 높은 정확도를 기록했으며, 두 개의 대규모 T5 기반 생성 모델를 제외한 모든 베이스라인을 앞섰다.
  • 제거 실험 결과, 위키사전 실체 설명을 통합하면 CommonsenseQA의 검증 세트에서 정확도가 2.7%p 향상되었고, 지식 삼중항을 사용하면 추가로 4.4%p의 성능 향상이 있었다.
  • 사례 연구를 통해 문맥이 풍부한 설명이 추론 능력을 크게 향상시킴을 확인했으며, 예를 들어 '박쥐가 곤충을 먹는다'는 설명을 통해 '곤충을 먹는다'는 선택지를 거를 수 있었다.
  • 사전 훈련된 모델 간 성능 순위는 BERT < RoBERTa < XLNet < ALBERT < T5로 나타나, 모델 아키텍처 선택이 최종 정확도에 상당한 영향을 미친다.
  • CommonsenseQA의 훈련 데이터에서 OpenBookQA 모델을 미리 훈련하면 성능 향상이 눈에 띄게 발생했으며, 이는 유사한 공통지식 기반 QA 작업 간 데이터 전이의 이점을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.