Skip to main content
QUICK REVIEW

[논문 리뷰] Abstractive Document Summarization without Parallel Data

Nikola I. Nikolov, Richard H. R. Hahnloser|arXiv (Cornell University)|2019. 07. 30.
Topic Modeling참고 문헌 28인용 수 5
한 줄 요약

이 논문은 병렬 기사-요약 쌍이 필요 없이, 예시 요약문과 일치하지 않는 기사만을 사용하여 요약을 생성하는 개괄적 문서 요약 시스템을 제안한다. 비지도 문장 추출기와 가짜 병렬 및 역역번역을 통한 합성 데이터로 훈련된 문장 개괄기의 조합을 통해 CNN/DailyMail에서 경쟁력 있는 성능을 달성하였고, 과학적 기자료 생성 과제에서도 유망한 결과를 보이며 자원이 부족한 환경에서의 실현 가능성을 입증한다.

ABSTRACT

Abstractive summarization typically relies on large collections of paired articles and summaries. However, in many cases, parallel data is scarce and costly to obtain. We develop an abstractive summarization system that relies only on large collections of example summaries and non-matching articles. Our approach consists of an unsupervised sentence extractor that selects salient sentences to include in the final summary, as well as a sentence abstractor that is trained on pseudo-parallel and synthetic data, that paraphrases each of the extracted sentences. We perform an extensive evaluation of our method: on the CNN/DailyMail benchmark, on which we compare our approach to fully supervised baselines, as well as on the novel task of automatically generating a press release from a scientific journal article, which is well suited for our system. We show promising performance on both tasks, without relying on any article-summary pairs.

연구 동기 및 목표

  • 병렬 기사-요약 쌍이 부족하거나 이용할 수 없는 저자원 환경에서의 요약 문제를 해결한다.
  • 비용이 많이 들는 병렬 코퍼스에 의존하지 않고, 예시 요약문과 일치하지 않는 기사만을 활용하는 시스템을 개발한다.
  • 정렬된 데이터가 제한된 분야, 예를 들어 과학 출판 분야에서 효과적인 요약 생성을 가능하게 한다.
  • 비지도 추출과 데이터 증강 기반의 개괄이, 감독 학습 기반 베이스라인과 경쟁할 수 있음을 입증한다.
  • 병렬 훈련 데이터 없이 과학 논문에서 기자료를 생성하는 새로운 과제를 탐색한다.

제안 방법

  • 입력 기사에서 핵심 문장을 식별하기 위해 비지도 추출 모델(예: Lead 또는 LexRank)을 사용한다.
  • 대규모 임bedding 기반 매칭을 통해 요약문의 문장과 일치하지 않는 기사의 문장을 정렬하여 가짜 병렬 문장 쌍을 구성한다.
  • 가짜 병렬 쌍을 기반으로 역역번역 모델을 훈련시어 요약문 문장에서 합성 기사 문장을 생성한다.
  • 가짜 병렬 쌍과 역역번역을 통해 생성된 합성 데이터의 조합을 사용해 문장 개괄기(P_PM)를 훈련시켜 추출된 문장을 압축 및 재구성한다.
  • 추출된 문장을 더 유창하고 압축적이며 도메인 적합한 요약으로 재구성하기 위해 개괄기를 적용한다.
  • 최종적으로 개괄된 문장을 요약 출력으로 사용하여 원본 문장을 그대로 재사용하지 않고도 개괄적 압축을 달성한다.

실험 결과

연구 질문

  • RQ1병렬 기사-요약 쌍이 전혀 없이도 개괄적 요약을 효과적으로 훈련시킬 수 있는가?
  • RQ2가짜 병렬 및 합성 데이터 기반의 시스템이 표준 벤치마크에서 완전히 감독 학습 기반 베이스라인과 비교해 얼마나 잘 성능을 내는가?
  • RQ3이러한 방법이 과학 기사에서 기자료를 생성하는 것과 같이 저자원, 도메인 특화 과제로 일반화될 수 있는가?
  • RQ4비지도 문장 추출과 데이터 증강 기반의 개괄이 얼마나 자연스럽고 정보가 풍부한 요약을 생성할 수 있는가?
  • RQ5다양한 요약 과제에서 감독 학습 기반과 비병렬 기반 방법 간의 성능 격차는 어느 정도인가?

주요 결과

  • CNN/DailyMail 벤치마크에서 제안된 방법은 병렬 훈련 데이터를 전혀 사용하지 않았음에도 불구하고 완전히 감독 학습 기반의 LSTM 기반 개괄적 모델과 경쟁 가능한 성능을 달성했다.
  • 과학 기자료 생성 과제에서 이 시스템은 비지도 추출 기반 베이스라인(LexRank 및 Lead)을 모두 능가하여, 개괄의 이점이 입증되었다.
  • 개괄기가 문장을 효과적으로 압축하고 재구성하는 데 성공하여, 종종 기술적 어휘를 더 접근성 있는 언어로 대체하는 경향을 보였다.
  • 역역번역을 통해 생성된 합성 데이터로 훈련된 모델는 보수적인 재구성 방식을 보였고, 원본 문장의 대부분의 구조를 유지하면서도 의미 있는 압축을 달성했다.
  • 추출 기반 베이스라인과 오라클(최적의 추출 요약) 간의 성능 격차가 작았기 때문에, 저자원 환경에서 고품질 요약을 얻기 위해서는 개괄적 요약이 필수적임을 시사한다.
  • 최종적으로 개괄기의 훈련 데이터셋은 860만 개의 가짜 병렬 및 합성 문장 쌍을 포함하여, 병렬 감독 없이도 효과적인 사전 훈련을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.