Skip to main content
QUICK REVIEW

[논문 리뷰] Z-Code++: A Pre-trained Language Model Optimized for Abstractive Summarization

Pengcheng He, Baolin Peng|arXiv (Cornell University)|2022. 08. 21.
Topic Modeling인용 수 5
한 줄 요약

Z-Code++는 두 단계의 사전 훈련 과정, 분리된 어텐션 메커니즘, 그리고 장기적 맥락 모델링을 위한 인코더 내 융합 기법을 통해 개선된 추상적 텍스트 요약을 위해 최적화된 사전 훈련된 인코더-디코더 언어 모델이다. 이 모델은 5개 언어에서 13개 요약 작업 중 9개에서 새로운 최고 성능을 기록했으며, 제로샷 및 패기샷 설정에서 훨씬 더 큰 모델인 PaLM 540B와 GPT-3 175B를 능가한다.

ABSTRACT

This paper presents Z-Code++, a new pre-trained language model optimized for abstractive text summarization. The model extends the state of the art encoder-decoder model using three techniques. First, we use a two-phase pre-training process to improve model's performance on low-resource summarization tasks. The model is first pre-trained using text corpora for language understanding, and then is continually pre-trained on summarization corpora for grounded text generation. Second, we replace self-attention layers in the encoder with disentangled attention layers, where each word is represented using two vectors that encode its content and position, respectively. Third, we use fusion-in-encoder, a simple yet effective method of encoding long sequences in a hierarchical manner. Z-Code++ creates new state of the art on 9 out of 13 text summarization tasks across 5 languages. Our model is parameter-efficient in that it outperforms the 600x larger PaLM-540B on XSum, and the finetuned 200x larger GPT3-175B on SAMSum. In zero-shot and few-shot settings, our model substantially outperforms the competing models.

연구 동기 및 목표

  • 추상적 텍스트 요약을 위해 특별히 최적화된 파라미터 효율적인 사전 훈련된 언어 모델을 개발하는 것.
  • 일반적인 이해와 기반 텍스트 생성을 조합한 두 단계의 사전 훈련 전략을 통해 저자원 요약 작업의 성능을 향상시키는 것.
  • 융합-인-인코더(Fusion-in-encoder, FiE)를 사용하여 문서 요약을 위한 장기적 맥락 모델링을 향상시키는 것.
  • 대상 지정 사전 훈련을 통해 환상적 요약을 줄이고 사실 일관성을 향상시키는 것.
  • 효율성을 유지하면서 최고 성능를 달성하고, 훨씬 더 큰 모델들을 능가하는 것.

제안 방법

  • 두 단계의 사전 훈련: 먼저 일반 웹 텍스트에서 교체 토큰 탐지(RTD)와 손상된 스펙트럼 예측(CSP)을 사용하여 훈련하고, 이후 요약 코퍼스에서 기반 생성을 위해 훈련.
  • 분리된 어텐션(DA): 표준 자기 어텐션을 대체하여 내용 임베딩과 위치 임베딩을 별도로 모델링함으로써 위치에 대한 인도크티브 비스를 향상시킴.
  • 융합-인-인코더(Fusion-in-encoder, FiE): 청크 내 국소적 어텐션과 청크 표현 간 전역 어텐션을 통해 장기 입력 시퀀스를 계층적으로 인코딩함.
  • 모델는 DeBERTaV2 어휘를 사용하며, 160GB의 영어 텍스트와 mC4 다국어 코퍼스에서 사전 훈련됨.
  • 피지컬 훈련은 최종 요약 작업에 적용되며, 일반화 능력을 평가하기 위해 제로샷 및 패기샷 평가를 실시함.
  • 모델는 5개 언어에서 13개 요약 벤치마크에서 평가되며, XSum, CNN/Daily Mail, SAMSum 포함.

실험 결과

연구 질문

  • RQ1두 단계의 사전 훈련 전략이 저자원 추상적 요약 성능을 크게 향상시킬 수 있는가?
  • RQ2분리된 어텐션은 위치 의존성을 더 잘 모델링함으로써 사실 일관성과 요약 품질을 향상시키는가?
  • RQ3융합-인-인코더는 과도한 계산 비용 없이 장기 입력 시퀀스를 효과적으로 처리할 수 있는가?
  • RQ4작은 모델이 제로샷 및 패기샷 설정에서 훨씬 더 큰 모델인 PaLM 540B와 GPT-3 175B를 얼마나 능가할 수 있는가?
  • RQ5기반 사전 훈련은 저자원 요약 작업으로의 지식 전이를 얼마나 효과적으로 가능하게 하는가?

주요 결과

  • Z-Code++는 5개 언어에서 13개 텍스트 요약 작업 중 9개에서 새로운 최고 성능를 기록했다.
  • XSum 데이터셋에서 Z-Code++는 600배 더 큰 PaLM 540B 모델보다 제로샷 및 패기샷 설정에서 성능이 뛰어나다.
  • SAMSum에서 Z-Code++는 200배 더 큰 GPT-3 175B 모델보다 뛰어나며, 1000개의 예시로 ROUGE-2 점수 18.9를 기록했다.
  • 제로샷 및 패기샷 설정에서 Z-Code++는 CNNDM, SAMSum 등에서 PEGASUS LARGE보다 평균적으로 5.7, 1.5, 3.3 ROUGE 포인트 높은 성능를 기록했다.
  • 기반 사전 훈련은 저자원 작업에서 성능 향상에 크게 기여했으며, Z-Code++는 단지 1000개의 예시로 XSum에서 ROUGE-2 점수 16.0을 기록했다.
  • 모델는 강력한 일반화 능력을 보이며, CNNDM와 SAMSum에서 제로샷 성능가지 피지컬 훈련 성능를 초월하여 분포 이탈에 대한 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.