Skip to main content
QUICK REVIEW

[논문 리뷰] Building Language Models for Text with Named Entities

Rizwan Parvez, Saikat Chakraborty|arXiv (Cornell University)|2018. 05. 13.
Topic Modeling참고 문헌 17인용 수 7
한 줄 요약

이 논문은 명사명 예측 성능을 향상시키기 위해 실체 유형 정보를 활용하는 판별적 신경 언어 모델을 제안한다. 이는 어휘 크기를 줄이고 정확도를 향상시킨다. 실체 유형과 특정 이름을 함께 모델링함으로써, 최신 기술 모델보다 요리 조리법 생성에서 52.2% 낮은 퍼플렉서티, 코드 생성에서 22.06% 낮은 퍼플렉서티를 달성한다.

ABSTRACT

Text in many domains involves a significant amount of named entities. Predict- ing the entity names is often challenging for a language model as they appear less frequent on the training corpus. In this paper, we propose a novel and effective approach to building a discriminative language model which can learn the entity names by leveraging their entity type information. We also introduce two benchmark datasets based on recipes and Java programming codes, on which we evalu- ate the proposed model. Experimental re- sults show that our model achieves 52.2% better perplexity in recipe generation and 22.06% on code generation than the state-of-the-art language models.

연구 동기 및 목표

  • 학습 데이터에서 낮은 빈도로 나타나는 실체 이름으로 인해 언어 모델의 명사명 예측 성능이 떨어지는 문제를 해결하기 위해.
  • 요리 및 소스 코드와 같이 명사명이 풍부한 도메인에서 언어 모델링 성능을 향상시키기 위해.
  • 결정적 실체 유형 정보를 활용하여 어휘 크기를 줄이고 예측 정확도를 향상시키는 모델을 설계하기 위해.
  • 정제된 요리 및 코드 데이터셋을 사용하여 실체가 풍부한 텍스트 생성의 새로운 기준을 설정하기 위해.
  • 유형 인식 모델링이 표준 신경 언어 모델보다 텍스트의 내재적 패턴을 더 잘 포착할 수 있음을 보여주기 위해.

제안 방법

  • 모델은 이중 단계 아키텍처를 사용한다: 문맥을 기반으로 다음 단어의 실체 유형을 예측하는 유형 모델(Type Model).
  • 유형 모델은 동일한 유형의 모든 실체를 동일하게 취급함으로써 어휘 크기를 줄여 일반화 능력을 향상시킨다.
  • 실체 복합 모델(Entity Composite Model)은 예측된 유형을 사전 정보로 사용하여 후보 이름 집합에 대한 조건부 확률을 추정함으로써 실제 실체 이름을 예측한다.
  • 두 모델에 대한 동시 추론을 수행하여 문맥적이고 유형 일관성이 있는 실체 이름을 생성한다.
  • 온톨로지 또는 정적 타입 시스템(예: Java AST에서의 것)으로부터 실체 유형 정보를 추출하여 확장 가능하고 정확한 유형 레이블링을 가능하게 한다.
  • 모델는 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 훈련되며, 문맥과 유형을 입력으로 받아 다음 단어를 예측한다.

실험 결과

연구 질문

  • RQ1실체 유형 정보를 활용하면 낮은 빈도의 명사명에 대해 언어 모델 성능을 크게 향상시킬 수 있는가?
  • RQ2실체가 풍부한 도메인인 요리 및 코드에서, 유형 인식 언어 모델이 표준 신경 언어 모델보다 우수한 성능을 보일 수 있는가?
  • RQ3유형 정보는 국소적 문맥을 넘어서 코드의 전반적인 구조적 패턴을 어느 정도 잘 포착하는가?
  • RQ4명사명의 훈련 빈도에 따라 성능 향상 정도는 어떻게 달라지는가?
  • RQ5유형과 실체 이름 예측을 함께 모델링하는 접근 방식이 유형 특징을 추가한 모델보다 더 낮은 퍼플렉서티를 달성할 수 있는가?

주요 결과

  • 제안된 모델은 최신 기술 모델 대비 요리 조리법 생성에서 52.2% 낮은 퍼플렉서티를 달성한다.
  • 코드 생성에서는 SOTA 기준 대비 퍼플렉서티를 22.06% 낮춘다.
  • 낮은 빈도의 재료인 'Apple'과 'Tomato'에 대해, MCQ 과제에서 정확도가 50퍼센트 포인트 이상 향상되었다.
  • 모델의 성능 향상은 실체의 훈련 빈도와 반비례하므로, 희귀 실체에 대해 더 큰 성과를 보인다.
  • 유형 모델만으로도 어휘 크기 감소와 더 나은 일반화 덕분에 예측 정확도가 향상된다.
  • 지역적 문맥만으로도 모델은 전반적인 코드 패턴을 효과적으로 포착하여 SLP-Core(2.65 대 3.40)보다 낮은 퍼플렉서티를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.