Skip to main content
QUICK REVIEW

[논문 리뷰] TED: A Pretrained Unsupervised Summarization Model with Theme Modeling and Denoising

Ziyi Yang, Chenguang Zhu|arXiv (Cornell University)|2020. 01. 03.
Topic Modeling참고 문헌 35인용 수 13
한 줄 요약

TED는 2140만 개의 레이블이 없는 기사 데이터를 대규모 사전 훈련하기 위해 뉴스 기사의 리드 편향을 활용하는 사전 학습된 비지도 추상적 요약 모델이다. 이후 테마 모델링과 노이즈 제거 오토인코더를 사용한 미세조정을 거친다. 이 모델은 CNN/DM, NYT, Gigaword 데이터셋에서 최신 기술 수준의 성능을 기록하며, 모든 이전 비지도 추상적 요약 모델을 능가하는 매우 추상적이고 유창한 요약을 생성한다.

ABSTRACT

Text summarization aims to extract essential information from a piece of text and transform the text into a concise version. Existing unsupervised abstractive summarization models leverage recurrent neural networks framework while the recently proposed transformer exhibits much more capability. Moreover, most of previous summarization models ignore abundant unlabeled corpora resources available for pretraining. In order to address these issues, we propose TED, a transformer-based unsupervised abstractive summarization system with pretraining on large-scale data. We first leverage the lead bias in news articles to pretrain the model on millions of unlabeled corpora. Next, we finetune TED on target domains through theme modeling and a denoising autoencoder to enhance the quality of generated summaries. Notably, TED outperforms all unsupervised abstractive baselines on NYT, CNN/DM and English Gigaword datasets with various document styles. Further analysis shows that the summaries generated by TED are highly abstractive, and each component in the objective function of TED is highly effective.

연구 동기 및 목표

  • 인간이 작성한 参照 요약이 필요 없는 비지도 추상적 요약 모델을 개발하는 것.
  • 특히 핵심 정보가 포함된 첫 번째 문단인 리드 문단을 활용하여 뉴스 기사의 구조적 편향을 이용해 인간의 감시 없이 대규모 사전 훈련을 수행하는 것.
  • 입력 기사와 생성된 요약 간의 의미적 유사성을 강제하는 테마 모델링 손실을 통해 요약 품질을 향상시키는 것.
  • 노이즈가 첨가된 입력에서 원래 텍스트를 재구성하도록 훈련시켜 모델의 유창성과 내성적 안정성을 향상시키는 노이즈 제거 오토인코더를 활용하는 것.
  • 대규모 레이블이 없는 데이터로 사전 학습한 트랜스포머 기반 모델을 구조적 목표로 미세조정함으로써, 비지도 설정에서 기존의 지도 학습 기반 모델을 능가할 수 있음을 입증하는 것.

제안 방법

  • 2140만 개의 레이블이 없는 뉴스 기사 데이터를 대상으로 TED를 사전 훈련하며, 첫 번째 몇 문장을 요약으로 삼아 자가 지도 학습을 통해 요약 능력을 학습하는 것.
  • 장거리 의존성을 모델링하고 추상적 요약을 생성하기 위해 트랜스포머 인코더-디코더 아키텍처를 사용하는 것.
  • 입력 기사와 생성된 요약 간의 의미적 유사성을 강제하기 위해 분류기 기반의 테마 모델링 모듈을 도입하는 것.
  • 요약 생성 과정에서 argmax 연산을 미분 가능하게 최적화하기 위해 Gumbel-Softmax 추정기를 적용하여 디지털 토큰 생성의 엔드 투 엔드 훈련을 가능하게 하는 것.
  • 입력 텍스트에 노이즈(예: 마스킹, 셔플링)를 첨가하고 원래 텍스트를 재구성하도록 훈련시켜 모델의 내성적 안정성과 유창성을 향상시키는 노이즈 제거 오토인코더를 적용하는 것.
  • 사전 훈련, 테마 모델링, 노이즈 제거 목표를 조합한 다중 목표 손실을 사용해 타겟 도메인에서 모델을 미세조정하는 것.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 모델이 참조 요약이 전혀 없는 상태에서 강력한 추상적 요약 성능을 달성할 수 있는가?
  • RQ2뉴스 기사의 리드 편향을 활용해 자가 지도 사전 훈련을 수행할 경우 요약 모델의 성능 향상에 얼마나 효과적인가?
  • RQ3테마 모델링과 노이즈 제거 오토인코더는 생성된 요약의 품질과 추상적 성격에 얼마나 기여하는가?
  • RQ4순수하게 비지도 학습된 모델이 제로샷 설정에서 기존의 지도 학습 기반 추상적 요약 모델을 능가할 수 있는가?
  • RQ5목표 함수의 개별 구성 요소가 최종 요약 성능에 기여하는 정도는 어떠한가?

주요 결과

  • TED는 CNN/DM, NYT, 영어 Gigaword 데이터셋에서 최신 기술 수준의 성능을 기록하며, NYT 데이터셋에서 ROUGE-1 점수가 37.78로 이전의 모든 비지도 추상적 요약 모델을 초월한다.
  • 대규모 레이블이 없는 데이터로 사전 훈련하면, 초기 학습에서부터 훈련한 경우 대비 ROUGE-1 점수가 10%p 이상 향상되며, 자가 지도 사전 훈련의 효과를 입증한다.
  • 테마 모델링과 노이즈 제거 손실을 모두 포함한 전체 모델이 NYT 데이터셋에서 가장 높은 ROUGE-1(37.78), ROUGE-2(17.63), ROUGE-L(34.33) 점수를 기록한다.
  • TED는 지도 학습 기반 PGNet 모델보다 더 많은 새로운 n-그램을 생성하여, 비지도 학습임에도 불구하고 강력한 추상적 요약 능력을 보임을 시사한다.
  • 제거 분석 결과 각 구성 요소—사전 훈련, 테마 모델링, 노이즈 제거—가 유의미하게 기여하며, 각각 ROUGE 점수에 2%p 이상의 향상을 기여한다.
  • 모델는 문법적으로 올바르고 자연스러운 요약을 생성하며, 이는 사전 훈련과 노이즈 제거 목표 덕분으로 보인다. 다만 사건 간 시간적 관계를 잘못 표현하는 경우가 종종 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.