Skip to main content
QUICK REVIEW

[논문 리뷰] ERNIE-Doc: A Retrospective Long-Document Modeling Transformer

Siyu Ding, Junyuan Shang|arXiv (Cornell University)|2020. 12. 31.
Topic Modeling참고 문헌 43인용 수 11
한 줄 요약

ERNIE-Doc는 사전 순서에 의존하는 장문서 모델링을 위한 프레임워크로, 후행 피드 기반 및 향상된 재귀 메커니즘을 도입하여 훈련 중 전체 문서의 맥락을 인지할 수 있도록 하여 장시퀀스 모델링에서 발생하는 맥락 분할 문제를 해결한다. 이는 훈련 중 전체 문서의 맥락 인식을 가능하게 하며, WikiText-103에서 16.8의 퍼플렉서티를 기록하고 여러 영어 및 중국어 NLU 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Transformers are not suited for processing long documents, due to their quadratically increasing memory and time consumption. Simply truncating a long document or applying the sparse attention mechanism will incur the context fragmentation problem or lead to an inferior modeling capability against comparable model sizes. In this paper, we propose ERNIE-Doc, a document-level language pretraining model based on Recurrence Transformers. Two well-designed techniques, namely the retrospective feed mechanism and the enhanced recurrence mechanism, enable ERNIE-Doc, which has a much longer effective context length, to capture the contextual information of a complete document. We pretrain ERNIE-Doc to explicitly learn the relationships among segments with an additional document-aware segment-reordering objective. Various experiments were conducted on both English and Chinese document-level tasks. ERNIE-Doc improved the state-of-the-art language modeling result of perplexity to 16.8 on WikiText-103. Moreover, it outperformed competitive pretraining models by a large margin on most language understanding tasks, such as text classification and question answering.

연구 동기 및 목표

  • 표준 Transformer에서 고정된 시퀀스 어텐션으로 인해 발생하는 장문서 모델링의 맥락 분할 문제를 해결한다.
  • 희소 어텐션 및 표준 재귀 Transformer의 한계를 극복하여 훈련 중 전체 문서 정보를 활용할 수 있도록 하고, 효과적인 맥락 길이를 제한하지 않는다.
  • 각 세그먼트가 훈련 중 전체 문서 맥락에 접근할 수 있도록 하여 전체 문서의 이중 방향 모델링을 가능하게 한다.
  • 세그먼트 간 관계를 모델링하기 위해 새로운 문서 인식 세그먼트 재정렬 목적함수를 도입하여 문서 수준의 표현 학습을 향상시킨다.
  • 영어 및 중국어 모두에서 장맥락 언어 모델링 및 하류 NLU 작업에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 문서 세그먼트를 두 번 처리하는 후행 피드 기반을 도입한다: 먼저 스카이밍 단계에서 초도 표현을 구축하고, 이후 후행 단계에서 각 세그먼트가 전체 문서 맥락에 어텐션을 갖도록 한다.
  • 층 간 이동을 동층 재귀로 대체하는 향상된 재귀 메커니즘을 제안하여 고차원 표현을 층 간에 재사용함으로써 효과적인 맥락 길이를 크게 증가시킨다.
  • 세그먼트 재정렬 목적함수를 설계하여 무작위로 섞인 문서 세그먼트의 올바른 순서를 예측하도록 사전 훈련함으로써 세그먼트 간 관계를 학습한다.
  • 향상된 재귀 메커니즘을 사용하여 자동회귀 언어 모델링을 수행함으로써 이론적으로 무한한 시퀀스 길이 처리가 가능하도록 ERNIE-Doc를 훈련한다.
  • 대규모 영어 및 중국어 코퍼스에서 모델을 사전 훈련하고, 텍스트 분류, 질의 응답, 의미 유사도 등 다양한 하류 NLU 작업에서 미세 조정한다.
  • 세그먼트 재정렬 목적함수에서 [CLS] 토큰을 활용하여 전반적인 문서 구조를 포착함으로써 문서 수준 분류 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1입력 시퀀스가 고정 길이 세그먼트로 분할되더라도, Transformer 기반 모델이 맥락 분할 없이 장문서를 효과적으로 모델링할 수 있는가?
  • RQ2정사각형 어텐션 및 희소 어텐션 메커니즘의 제약을 초월하여 Transformer의 효과적 맥락 길이를 어떻게 연장할 수 있는가?
  • RQ3훈련 중 전체 문서 맥락을 통합함으로써 하류 문서 수준 이해 작업 성능이 얼마나 향상되는가?
  • RQ4세그먼트 재정렬 기반의 문서 인식 사전 훈련 목적함수는 장거리 의존성 및 세그먼트 간 관계를 포착하는 데 모델의 능력을 향상시키는가?
  • RQ5향상된 재귀 메커니즘은 사전 훈련 시 최대 시퀀스 길이를 줄이면서도 성능을 유지하거나 향상시킬 수 있는가?

주요 결과

  • ERNIE-Doc는 WikiText-103 벤치마크에서 자동회귀 언어 모델링에서 최신 기술 수준의 퍼플렉서티 16.8을 기록하였다.
  • TQA 및 HYP 영어 질의 응답 작업에서 ERNIE-Doc -Small은 각각 F1 점수 64.56 및 86.10을 기록하였으며, 분석 결과 각각의 제안된 구성 요소가 성능 향상에 기여한 것으로 나타났다.
  • 세그먼트 재정렬 목적함수는 HYP 데이터셋에서 1.5%p의 성능 향상을 이끌어내어 장문 분류 작업에 효과적임을 시사한다.
  • 향상된 재귀 메커니즘 덕분에 최대 시퀀스 길이 128을 가진 ERNIE-Doc -Small이 길이 512인 모델과 유사한 정확도를 달성함으로써 계산 비용 절감의 효율성을 입증하였다.
  • 장문 분류 및 기계 독해 이해 등 7개의 중국어 NLU 작업에서, ERNIE-Doc는 기본 크기 모델 그룹에서 이전 모델들을 크게 앞서는 성능을 기록하였다.
  • 분석 결과, 후행 피드, 향상된 재귀, 세그먼트 재정렬 중 어느 하나의 핵심 구성 요소라도 제거할 경우, 모든 작업에서 일관되고 뚜렷한 성능 저하가 발생하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.