Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Extractive Summarization by Pre-training Hierarchical Transformers

Shusheng Xu, Xingxing Zhang|arXiv (Cornell University)|2020. 10. 16.
Topic Modeling참고 문헌 53인용 수 5
한 줄 요약

이 논문은 레이블이 부여된 요약문 없이도 훈련할 수 있는 새로운 비지도 추출 요약 방법인 STAS를 제안한다. 이 방법은 사전 훈련된 계층적 트랜스포머에서 문장 수준의 자기주의(self-attention)를 활용하여 중요 문장을 순위 매기는 데에 사용된다. 문장 순서에 의존하는 것을 줄이기 위해 문장 재배열(pre-training) 목적을 도입함으로써, CNN/DailyMail 및 NYT 데이터셋에서 기존 비지도 방법들보다 뛰어난 SOTA(최고 성능) ROUGE 점수를 달성한다.

ABSTRACT

Unsupervised extractive document summarization aims to select important sentences from a document without using labeled summaries during training. Existing methods are mostly graph-based with sentences as nodes and edge weights measured by sentence similarities. In this work, we find that transformer attentions can be used to rank sentences for unsupervised extractive summarization. Specifically, we first pre-train a hierarchical transformer model using unlabeled documents only. Then we propose a method to rank sentences using sentence-level self-attentions and pre-training objectives. Experiments on CNN/DailyMail and New York Times datasets show our model achieves state-of-the-art performance on unsupervised summarization. We also find in experiments that our model is less dependent on sentence positions. When using a linear combination of our model and a recent unsupervised model explicitly modeling sentence positions, we obtain even better results.

연구 동기 및 목표

  • 훈련 중에 레이블이 부여된 요약문이 필요로 하지 않는 비지도 추출 요약 방법을 개발하는 것.
  • 계층적 트랜스포머에서 문장 수준의 자기주의가 그래프 기반 방법이나 표준 문장 임베딩에 의존하지 않고도 문장 중요도를 효과적으로 순위 매길 수 있는지 조사하는 것.
  • 문장 순서에 대한 의존도를 줄이기 위해 문장 재배열 사전 훈련 작업을 도입하는 것.
  • 감독 없이도 표준 비지도 요약 벤치마크에서 최고 성능을 달성하는 것.

제안 방법

  • 마스크 문장 예측과 문장 재배열이라는 두 가지 새로운 사전 훈련 작업을 사용하여 대규모 레이블이 없는 문서에서 계층적 트랜스포머(확장된 HIBERT)를 사전 훈련한다.
  • 사전 훈련된 모델에서 문장 수준의 자기주의 점수를 추출 요약에서 문장 중요도의 대체 지표로 사용한다.
  • 다른 문장들에서 문장 i로 향하는 자기주의 점수의 합을 기반으로 문장을 순위 매기며, 사전 훈련 목적을 통합하여 중요도 추정을 정교화한다.
  • 사전 훈련 중에 문장 재배열 작업을 도입하여 모델이 위치가 아닌 내용에 주목하도록 유도한다.
  • 최종 문장 중요도 점수를 위치 인식 모델의 선형 조합과 결합하여 성능을 추가로 향상시킨다.
  • 학습된 중요도 점수를 기반으로 상위-k 문장을 선택하여 추출 요약에 적용한다.

실험 결과

연구 질문

  • RQ1계층적 트랜스포머에서 문장 수준의 자기주의가 비지도 추출 요약을 위한 문장 중요도 순위 매기기에 효과적으로 사용될 수 있는가?
  • RQ2문장 재배열 목적을 사용한 사전 훈련이 요약에서 모델의 문장 순서 의존도를 줄이는 데 효과적인가?
  • RQ3제안된 방법의 성능이 기존 비지도 추출 요약 모델과 표준 벤치마크에서 어떻게 비교되는가?
  • RQ4제안된 모델를 위치 인식 모델과 조합하면 요약 성능을 추가로 향상시킬 수 있는가?

주요 결과

  • 제안된 STAS 모델은 CNN/DailyMail 데이터셋에서 최고 성능을 달성하였으며, 테스트 세트에서 ROUGE-1, ROUGE-2, ROUGE-L 점수는 각각 40.90, 18.02, 37.21을 기록하였다.
  • 뉴욕 타임스(NYT) 데이터셋에서는 경쟁력 있는 성능을 기록하였으며, 기존 비지도 방법들보다 ROUGE 점수와 문장 순서 분포 유사도에서 모두 뛰어난 성능을 보였다.
  • STAS의 문장 순서 분포는 다른 모델들에 비해 ORACLE 상한선에 훨씬 더 가까워, 쿨백-라이블러 발산(Kullback-Leibler divergence) 값이 0.098로, PACSUM의 0.614보다 훨씬 낮았다.
  • 문장 재배열 사전 훈련 작업을 제거하면 위치 편향이 증가하여 KL 발산 값이 0.108로 상승하였으며, 이는 위치 의존도 감소에 효과적이라는 것을 확인하였다.
  • STAS와 최근의 위치 인식 모델의 선형 조합은 향상된 성능을 보였으며, 내용 기반 모델과 위치 기반 모델 간의 상호보완적 강점을 입증하였다.
  • 문장 재배열 작업은 위치 임베딩 제거와 같은 간단한 대안보다 우수한 성능을 보였으며, 유용한 위치 인덕티브 바이어스를 유지하면서도 위치 편향을 줄이는 데 독특한 능력을 지녔음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.