Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Rich Representation of Keyphrases from Text

Mayank Kulkarni, Debanjan Mahata|arXiv (Cornell University)|2021. 12. 16.
Advanced Text Analysis Techniques인용 수 4
한 줄 요약

이 논문은 분류적 언어 모델을 위한 새로운 사전학습 목표인 KBIR과 생성적 关련어 모델링을 위한 파생된 BART 설정인 KeyBART을 제안한다. 양자 모두 풍부한 관련어 표현을 학습하도록 설계되었다. 키워드 경계 보충과 교체 분류를 마스킹 언어 모델링과 통합함으로써, KBIR은 관련어 추출에서 최대 8.16 F1 포인트 향상으로 최신 기술 수준(SOTA) 성능을 달성하였으며, KeyBART는 관련어 생성에서 최대 4.33 F1@M 향상으로 SOTA 성능을 달성하였다.

ABSTRACT

In this work, we explore how to train task-specific language models aimed towards learning rich representation of keyphrases from text documents. We experiment with different masking strategies for pre-training transformer language models (LMs) in discriminative as well as generative settings. In the discriminative setting, we introduce a new pre-training objective - Keyphrase Boundary Infilling with Replacement (KBIR), showing large gains in performance (upto 8.16 points in F1) over SOTA, when the LM pre-trained using KBIR is fine-tuned for the task of keyphrase extraction. In the generative setting, we introduce a new pre-training setup for BART - KeyBART, that reproduces the keyphrases related to the input text in the CatSeq format, instead of the denoised original input. This also led to gains in performance (upto 4.33 points in F1@M) over SOTA for keyphrase generation. Additionally, we also fine-tune the pre-trained language models on named entity recognition (NER), question answering (QA), relation extraction (RE), abstractive summarization and achieve comparable performance with that of the SOTA, showing that learning rich representation of keyphrases is indeed beneficial for many other fundamental NLP tasks.

연구 동기 및 목표

  • 관련어에 대한 임의의 작업에 특화된 표현을 학습할 수 있도록 언어 모델의 능력을 향상시키는 사전학습 목표를 개발하는 것.
  • 분류적 및 생성적 NLP 환경 모두에서 관련어 표현 학습에 특화된 사전학습 전략의 부족을 해결하는 것.
  • 관련어 인식 사전학습이 관련어 작업뿐 아니라 NER, QA, 요약과 같은 더 넓은 NLP 하류 작업에서도 성능 향상에 기여하는지 평가하는 것.
  • 관련어 표현의 이식 가능성을 탐색하여 관련어 전용 목표를 넘어서 보다 광범위한 활용 가능성을 입증하는 것.

제안 방법

  • 분류적 모델을 위한 다중 작업 사전학습 목표인 KBIR을 제안하며, 마스킹 언어 모델링(MLM), 관련어 경계 보충(KBI), 관련어 교체 분류(KRC)를 통합한다.
  • 기존 텍스트 복구가 아닌 손상된 입력에서 관련어를 CatSeq 형식으로 생성하도록 재구성한 BART 사전학습 설정인 KeyBART를 도입한다.
  • 2,300만 개의 과학 논문으로 구성된 대규모 코퍼스를 사용하여 TextRank를 활용해 자동으로 추출한 관련어를 기반으로 모델을 훈련시킨다. 이로써 광범위한 도메인 커버리지를 확보한다.
  • 관련어 추출, 관련어 생성, NER, QA, 관계 추출, 개괄 요약과 같은 하류 작업에 대해 사전학습된 모델을 미세조정한다.
  • KBIR에서는 토큰 마스킹, 경계 복원, 관련어 의미적 교체를 동시에 최적화하는 이중 훈련 전략을 적용한다.
  • 추출적 및 개괄적 관련어 데이터의 조합을 사용하여, 존재 여부에 관계없이 관련어 예측을 처리할 수 있는 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1분류적 설정에서 언어 모델이 관련어 표현을 더 잘 학습할 수 있도록 하는 사전학습 목표를 설계할 수 있는가?
  • RQ2입력 노이즈 제거가 아니라 관련어 복원에 초점을 맞춘 생성적 사전학습 설정을 개발하여 관련어 생성 성능을 향상시킬 수 있는가?
  • RQ3기존 SOTA 방법과 비교해 볼 때, 풍부한 관련어 표현 학습이 관련어 추출 및 생성 작업의 성능 향상에 기여하는가?
  • RQ4관련어 인식 표현이 NER, QA, 요약과 같은 다른 기본적인 NLP 작업으로 효과적으로 이식 가능한가?
  • RQ5관련어 전용 사전학습이 주요 주제의 의미적 이해를 향상시켜 개괄 요약 품질을 향상시킬 수 있는가?

주요 결과

  • KBIR은 SemEval 2017 벤치마크 데이터셋에서 관련어 추출 작업에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 이는 이전 SOTA 대비 최대 8.16 F1 포인트 향상이다.
  • KeyBART는 관련어 생성 작업에서 SOTA 성능을 달성하였으며, Inspec 데이터셋에서 존재하는 관련어에 대해 ONE2SEQ 모델 대비 4.33 F1@M 포인트 향상되었다.
  • 관련어 생성 목표를 통해 훈련된 모델은 표준 BART를 동일한 데이터로 미세조정한 경우와 비교해 모든 ROUGE 지표(R1, R2, RLSum)에서 높은 점수를 기록하였다.
  • 이름 있는 실체 인식, 질의 응답, 관계 추출 작업에 대해 미세조정한 결과, SOTA 모델 수준의 성능을 기록하여 관련어 표현의 이식 가능성을 입증하였다.
  • 정성적 분석 결과, 복사 메커니즘에 의존하지 않을 경우 모델이 'natural language processing'과 같이 의미 있는 부재 관련어를 생성함으로써 표면적 일치를 넘은 의미적 이해를 보였다.
  • 관련어 추출에서 높은 재현율을 기록한 것은 KRC 및 KBI 목표를 통해 관련어 경계와 의미적 역할에 대한 이해가 향상되었기 때문일 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.