Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Document Language Modeling.

Avi Caciularu, Arman Cohan|arXiv (Cornell University)|2021. 01. 02.
Topic Modeling인용 수 14
한 줄 요약

이 논문은 다중 문서 NLP 작업을 위한 마스크된 언어 모델링을 향상시키기 위해 교차 문서 마스킹과 시퀀스 수준 전역 주의 메커니즘을 갖춘 새로운 장문 맥락 주의 패턴을 사용하는 사전학습 방법인 Cross-Document Language Modeling (CD-LM)을 제안한다. CD-LM는 이전 방법들보다 훨씬 적은 파라미터로 핵심 참조 해결 및 표절 탐지와 같은 작업에서 최신 기준 성능을 달성한다.

ABSTRACT

We introduce a new pretraining approach for language models that are geared to support multi-document NLP tasks. Our cross-document language model (CD-LM) improves masked language modeling for these tasks with two key ideas. First, we pretrain with multiple related documents in a single input, via cross-document masking, which encourages the model to learn cross-document and long-range relationships. Second, extending the recent Longformer model, we pretrain with long contexts of several thousand tokens and introduce a new attention pattern that uses sequence-level global attention to predict masked tokens, while retaining the familiar local attention elsewhere. We show that our CD-LM sets new state-of-the-art results for several multi-text tasks, including cross-document event and entity coreference resolution, paper citation recommendation, and documents plagiarism detection, while using a significantly reduced number of training parameters relative to prior works.

연구 동기 및 목표

  • 장거리 및 교차 문서 간 의존성을 포착함으로써 다중 문서 NLP 작업을 위한 마스크된 언어 모델링을 향상시키기 위해.
  • 이전 접근 방식에 비해 효과적인 다중 문서 모델링을 위해 필요한 학습 파라미터 수를 줄이기 위해.
  • Longformer 아키텍처를 개선하여 시퀀스 수준 전역 주의를 지원하는 새로운 주의 패턴을 도입함으로써 더 나은 맥락 모델링을 가능하게 하기 위해.
  • 핵심 참조 해결 및 인용 추천과 같은 다운스트림 다중 문서 작업에서의 성능 향상시키기 위해.

제안 방법

  • 다양한 관련 문서를 하나의 입력 시퀀스로 통합하여 사전학습함으로써 교차 문서 마스킹을 통해 문서 간 관계를 학습할 수 있도록 한다.
  • 장문 맥락에서 마스크된 토큰을 예측하기 위해 시퀀스 수준 전역 주의를 통합한 수정된 Longformer 주의 메커니즘을 사용한다.
  • 지역 창 내에서 국소 주의를 적용하면서도 전체 시퀀스에 걸쳐 전역 주의를 유지하여 장거리 의존성을 보존한다.
  • 마스크된 언어 모델링 목적함수를 사용하여 대규모 다중 문서 코퍼스에서 모델을 엔드 투 엔드로 학습시킨다.
  • 계산 효율성과 장문 맥락 모델링 간의 균형을 고려한 새로운 주의 패턴으로 모델을 최적화한다.
  • 사전학습된 CD-LM를 특정 다중 문서 다운스트림 작업에 대해 미세조정하여 성능을 평가한다.

실험 결과

연구 질문

  • RQ1교차 문서 마스킹은 다중 문서 NLP 작업을 위한 마스크된 언어 모델링을 향상시키는가?
  • RQ2장문 맥락 모델링에 시퀀스 수준 전역 주의를 통합하면 다중 문서 작업 성능이 어떻게 향상되는가?
  • RQ3CD-LM는 이전의 다중 문서 모델들에 비해 얼마나 많은 파라미터를 줄일 수 있으며, 성능을 유지하거나 향상시키는가?
  • RQ4다중 문서 사전학습과 장문 맥락 주의의 조합이 핵심 참조 및 표절 탐지 작업에서 더 나은 일반화 성능을 이끌어내는가?

주요 결과

  • CD-LM는 교차 문서 이벤트 및 실체 핵심 참조 해결 작업에서 최신 기준 성능을 달성한다.
  • 논문 인용 추천 작업에서 이전 방법들을 능가하며, 더 나은 관련성 예측 성능을 보여준다.
  • 문서 간 표절 탐지 작업에서 뛰어난 성능을 보이며, 교차 문서 의미적 유사성 모델링이 효과적임을 시사한다.
  • 이전 접근 방식들에 비해 훨씬 적은 학습 파라미터를 사용하면서도 성능을 유지하거나 초월한다.
  • 교차 문서 마스킹과 시퀀스 수준 전역 주의의 통합은 장거리 의존성 학습 향상에 측정 가능한 기여를 한다.
  • 제거 실험 결과, 교차 문서 마스킹과 새로운 주의 패턴이 성능 향상에 독립적으로 기여하는 것으로 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.