Skip to main content
QUICK REVIEW

[논문 리뷰] Pre-training for Abstractive Document Summarization by Reinstating Source Text

Yanyan Zou, Xingxing Zhang|arXiv (Cornell University)|2020. 04. 04.
Topic Modeling참고 문헌 47인용 수 4
한 줄 요약

이 논문은 문장 재정렬, 다음 문장 생성, 마스킹 문서 생성이라는 세 가지 시퀀스 투 시퀀스 사전학습 목표를 제안하며, 원본 소스 문서를 재구성함으로써 레이블이 없는 텍스트에서 개괄적 요약 모델을 사전학습할 수 있도록 한다. 단지 19GB의 사전학습 데이터를 사용함에도 불구하고, 이 방법은 160GB 이상의 코퍼스에서 사전학습된 모델들과 비교해도 ROUGE 점수를 유사하거나 뛰어나게 달성하여, 제한된 데이터로도 뛰어난 효과를 발휘함을 보여준다.

ABSTRACT

Abstractive document summarization is usually modeled as a sequence-to-sequence (Seq2Seq) learning problem. Unfortunately, training large Seq2Seq based summarization models on limited supervised summarization data is challenging. This paper presents three pre-training objectives which allow us to pre-train a Seq2Seq based abstractive summarization model on unlabeled text. The main idea is that, given an input text artificially constructed from a document, a model is pre-trained to reinstate the original document. These objectives include sentence reordering, next sentence generation, and masked document generation, which have close relations with the abstractive document summarization task. Experiments on two benchmark summarization datasets (i.e., CNN/DailyMail and New York Times) show that all three objectives can improve performance upon baselines. Compared to models pre-trained on large-scale data (more than 160GB), our method, with only 19GB text for pre-training, achieves comparable results, which demonstrates its effectiveness.

연구 동기 및 목표

  • 감독 데이터가 제한된 상황에서 비감독 사전학습을 활용하여 대규모 개괄적 요약 모델을 훈련하는 데 도전한다.
  • 요약문의 핵심 특징인 내용 재정렬을 명시적으로 모델링하는 사전학습 목표를 설계한다.
  • 시퀀스 투 시퀀스 목표를 사용해 레이블이 없는 텍스트에서 사전학습을 통해 모델의 일반화 능력과 개괄적 요약 성능을 향상시킨다.
  • 현재 최고 수준의 모델들이 사용하는 것보다 훨씬 적은 데이터로도 개괄적 요약을 위한 효과적인 사전학습이 가능함을 입증한다.

제안 방법

  • 문장 재정렬(SR), 다음 문장 생성(NSG), 마스킹 문서 생성(MDG)이라는 세 가지 시퀀스 투 시퀀스 사전학습(_STEP_) 목표를 제안한다.
  • 각 목표는 시퀀스 투 시퀀스 모델이 인위적으로 손상된 버전—예를 들어 뒤섞인 문장, 다음 문단 예측, 마스킹된 구간—으로부터 원본 소스 문서를 재구성하도록 훈련한다.
  • 모델은 요약 데이터셋의 훈련 분할에서 온 레이블이 없는 문서에서 사전학습을 수행한 후, 감독 요약 작업에 대해 미세조정한다.
  • 공유된 인코더-디코더 구조를 가진 트랜스포머 기반의 시퀀스 투 시퀀스 아키텍처를 사용하며, 마스킹 언어 모델링과 노이즈 제거 목표를 통해 사전학습한다.
  • 이중 단계 훈련 파이프라인을 적용한다: 먼저 레이블이 없는 데이터에서 STEP 목표를 사용해 사전학습하고, 이후 감독 요약 데이터에서 미세조정한다.
  • ROUGE 및 인간 평가를 활용해 벤치마크 데이터셋에서 개별 및 병합된 STEP 목표의 효과를 평가한다.

실험 결과

연구 질문

  • RQ1원본 텍스트 복원을 통한 레이블이 없는 텍스트에서의 사전학습이 개괄적 요약 성능을 향상시킬 수 있는가?
  • RQ2내용 재정렬을 모델링하는 시퀀스 투 시퀀스 사전학습 목표는 요약 품질을 향상시키는가?
  • RQ3오직 19GB의 텍스트에서 사전학습한 모델이 160GB 이상의 데이터에서 사전학습한 모델과 유사한 성능을 달성할 수 있는가?
  • RQ4자동 평가 및 인간 평가 모두에서 BERTAbs 및 UniLM과 같은 강력한 베이스라인 모델과 비교해 본 논문의 STEP 방법은 어떻게 성능을 내는가?
  • RQ5요약 데이터셋의 훈련 분할에서 사전학습을 수행해도 일반화에 유의미한 이점이 있는가?

주요 결과

  • 제안된 STEP 사전학습 방법은 단지 19GB의 레이블이 없는 텍스트만을 사용함에도 불구하고, CNN/DailyMail에서 ROUGE-1, ROUGE-2, ROUGE-L 점수를 160GB 이상의 데이터에서 사전학습한 모델들과 유사하거나 뛰어나게 달성한다.
  • 문장 재정렬(SR) 목표만으로도 강력한 베이스라인 모델보다 성능 향상을 이룬다. 이는 동일한 감독 데이터에서 미세조정된 후에도 성립한다.
  • 인간 평가 결과, 최고의 STEP 모델이 생성한 요약문은 23%의 경우에서 최고로 평가되었으며, 인간 레퍼런스를 제외한 모든 모델보다 유의미하게 낮은 평균 순위(2.77)를 기록했다.
  • ProphetNet(16GB) 및 UniLM과 같은 16GB의 텍스트에서 사전학습된 모델들보다도 성능이 뛰어나, 뛰어난 데이터 효율성을 입증했다.
  • T5 및 PEGASUS(HugeNews)보다 ROUGE-1 및 ROUGE-L 점수에서 높은 성능을 보였지만, ROUGE-2에서는 略로 낮은 성능을 보이며 전반적인 내용과 유창성 측면에서 뛰어난 성능을 보였다.
  • 정성적 분석 결과, 모델가 생성한 요약문은 유창하고 정보가 풍부하며 간결하며, 원본 텍스트의 내용을 종종 재구성하고 재정렬함으로써 개괄적 행동을 반영하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.