Skip to main content
QUICK REVIEW

[논문 리뷰] Learning beyond datasets: Knowledge Graph Augmented Neural Networks for Natural language Processing

K. M. Annervaz, Somnath Basu Roy Chowdhury|arXiv (Cornell University)|2018. 02. 16.
Topic Modeling참고 문헌 33인용 수 16
한 줄 요약

이 논문은 주어진 자연어 처리(NLP) 모델의 성능을 향상시키기 위해 주의 메커니즘을 통해 동적으로 관련 세계 지식을 검색하는 지식 그래프 증강 신경망을 제안한다. 엔티티와 관계 표현을 압축하기 위해 컨볼루션 아키텍처를 사용함으로써, 이 방법은 텍스트 분류 및 자연어 추론 작업에서 성능을 크게 향상시키며, 레이블이 부여된 데이터가 30% 적은 상황에서도 효과를 보이며, 구조화된 세계 지식을 딥러닝에 통합하는 것이 효과적임을 입증한다.

ABSTRACT

Machine Learning has been the quintessential solution for many AI problems, but learning is still heavily dependent on the specific training data. Some learning models can be incorporated with a prior knowledge in the Bayesian set up, but these learning models do not have the ability to access any organised world knowledge on demand. In this work, we propose to enhance learning models with world knowledge in the form of Knowledge Graph (KG) fact triples for Natural Language Processing (NLP) tasks. Our aim is to develop a deep learning model that can extract relevant prior support facts from knowledge graphs depending on the task using attention mechanism. We introduce a convolution-based model for learning representations of knowledge graph entity and relation clusters in order to reduce the attention space. We show that the proposed method is highly scalable to the amount of prior information that has to be processed and can be applied to any generic NLP task. Using this method we show significant improvement in performance for text classification with News20, DBPedia datasets and natural language inference with Stanford Natural Language Inference (SNLI) dataset. We also demonstrate that a deep learning model can be trained well with substantially less amount of labeled training data, when it has access to organised world knowledge in the form of knowledge graph.

연구 동기 및 목표

  • 딥러닝 모델이 레이블이 부여된 훈련 데이터에만 의존하는 한계를 보완하기 위해 외부의 구조화된 세계 지식을 통합하는 것.
  • 딥러닝 모델이 추론 도중에 대규모 지식 그래프에서 관련 사실을 동적으로 액세스하고 통합할 수 있도록 하는 것.
  • 외부 지식 기반을 활용하여 대량의 레이블이 부여된 훈련 데이터에 대한 의존도를 줄이는 것.
  • 특정 데이터셋에 특화되지 않고 다양한 NLP 작업에 적용 가능한 확장성 있고 일반적인 프레임워크를 개발하는 것.
  • 구조화된 세계 지식을 통합할 경우, 전체 데이터셋으로 훈련된 표준 모델보다 뛰어난 성능을 달성할 수 있음을 입증하는 것.

제안 방법

  • 지식 그래프 내 엔티티와 관계 클러스터의 압축된 표현을 학습하기 위해 컨볼루션 신경망을 사용하여 주의 메커니즘의 공간을 줄인다.
  • 압축된 지식 그래프 표현 위에 주의 메커니즘을 적용하여 작업에 적합한 사실을 필요에 따라 검색한다.
  • 최종 예측 이전에 검색된 지식을 입력 특징과 통합함으로써 데이터와 지식의 공동 학습을 가능하게 한다.
  • 이 프레임워크는 일반적이며, 텍스트 분류 및 NLI에 적합한 LSTM과 같은 임의의 작업별 딥러닝 모델에 통합될 수 있다.
  • 소프트 주의 메커니즘을 사용하여 확률적 경사 하강법을 통한 엔드 투 엔드 학습이 가능하게 하며, 미분 가능성 보장.
  • 지식 그래프의 사실 트리플 (h, r, t)은 구조 기반 방법을 사용해 임베딩되며, 엔티티와 관계 표현은 함께 학습된다.

실험 결과

연구 질문

  • RQ1딥러닝 모델이 추론 도중 대규모 지식 그래프에서 관련 사실을 동적으로 검색함으로써 성능 향상을 이룰 수 있는가?
  • RQ2지식 증강 모델이 레이블이 부여된 데이터가 훨씬 적은 상황에서도 표준 모델을 능가할 수 있는가?
  • RQ3대규모 지식 그래프 위에 주의 메커니즘을 효율적으로 적용하여 관련 사실만 검색할 수 있는가?
  • RQ4특정 작업에 맞게 재학습이 필요 없이 어떤 NLP 모델에도 세계 지식을 통합할 수 있는 확장성 있고 일반적인 프레임워크를 설계할 수 있는가?
  • RQ5구조화된 세계 지식을 통합할 경우, 딥러닝 모델의 일반화 능력 향상과 데이터 의존도 감소를 이룰 수 있는가?

주요 결과

  • KG-증강 모델은 전체 20Newsgroups 데이터셋으로 훈련된 바보 LSTM 모델보다 더 높은 정확도를 달성했으며, 이는 레이블이 70%만 있는 상황에서도 성립한다.
  • SNLI 데이터셋에서 KG-증강 모델은 전체 데이터 기반의 베이스라인 LSTM보다 정확도에서 뛰어난 성능을 보이며, 지식 융합의 효과를 입증한다.
  • 감소된 데이터로 훈련했을 때 KG-증강 모델의 손실 값이 상당히 낮아져 빠른 수렴과 더 나은 최적화를 나타낸다.
  • 컨볼루션 인코딩을 통해 엔티티와 관계 클러스터의 압축된 표현을 학습함으로써 주의 공간을 크게 줄였다.
  • 수백만 개의 사실 트리플을 포함한 대규모 지식 기반에 대해서도 뛰어난 성능 유지를 유지하며 뛰어난 확장성을 보였다.
  • 결과적으로 지식 그래프 증강은 딥러닝에서 대량의 레이블이 부여된 데이터셋이 필요 없도록 줄일 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.