Skip to main content
QUICK REVIEW

[논문 리뷰] Extractive Summarization as Text Matching

Ming Zhong, Pengfei Liu|arXiv (Cornell University)|2020. 04. 19.
Topic Modeling참고 문헌 47인용 수 16
한 줄 요약

이 논문은 소스 문서와 후보 요약문 간의 의미적 텍스트 매칭을 공통 임bedding 공간에서 수행하는 새로운 추출적 요약 프레임워크인 MatchSum을 제안한다. Siamese-BERT 아키텍처를 사용해 의미적 유사도를 계산함으로써, 문서와 가장 유사한 요약문을 선택함으로써, 단지 BERT-base만을 사용하여 CNN/DailyMail에서 ROUGE-1 점수 44.41의 새로운 SOTA 성능을 달성한다. 이는 여섯 개의 데이터셋에서 강력한 기준 모델들을 능가한다.

ABSTRACT

This paper creates a paradigm shift with regard to the way we build neural extractive summarization systems. Instead of following the commonly used framework of extracting sentences individually and modeling the relationship between sentences, we formulate the extractive summarization task as a semantic text matching problem, in which a source document and candidate summaries will be (extracted from the original text) matched in a semantic space. Notably, this paradigm shift to semantic matching framework is well-grounded in our comprehensive analysis of the inherent gap between sentence-level and summary-level extractors based on the property of the dataset. Besides, even instantiating the framework with a simple form of a matching model, we have driven the state-of-the-art extractive result on CNN/DailyMail to a new level (44.41 in ROUGE-1). Experiments on the other five datasets also show the effectiveness of the matching framework. We believe the power of this matching-based summarization framework has not been fully exploited. To encourage more instantiations in the future, we have released our codes, processed dataset, as well as generated summaries in https://github.com/maszhongming/MatchSum.

연구 동기 및 목표

  • 문장 수준의 추출기들이 독립적으로 결정을 내려 중복된 요약을 생성하는 데서 비롯되는 한계를 해결하기 위해.
  • 전체 요약의 의미적 일관성을 모델링함으로써 요약 수준의 접근 방식이 문장 수준 방법을 능가할 수 있는지 조사하기 위해.
  • 요약 길이나 '펄-요약'(pearl-summaries)의 존재와 같은 데이터셋 특성에 기반해 문장 수준과 요약 수준의 추출기 간의 본질적 격차를 정량화하기 위해.
  • 대조 학습을 통한 복잡한 요약 수준 최적화를 피하는 새로운 추출적 요약의 패러다임을 제안하기 위해.
  • 개별 문장 점수화로는 식별할 수 없는 상호보완적인 문장 조합을 의미적 매칭이 효과적으로 포착할 수 있음을 입증하기 위해.

제안 방법

  • 추출적 요약을 의미적 텍스트 매칭 문제로 재정의하여, 소스 문서와 가장 유사한 후보 요약문을 의미 공간에서 찾는 것을 목표로 한다.
  • 소스 문서와 후보 요약문을 모두 컨텍스트 임베딩으로 인코딩하기 위해 Siamese-BERT 아키텍처를 사용한다.
  • 문서 임베딩과 각 후보 요약 임베딩 간의 코사인 유사도를 계산하여 요약문을 순위 매긴다.
  • 대조 학습을 적용: 좋은 요약문은 부적합한 요약문보다 문서와 더 의미적으로 유사해야 한다.
  • 가장 높은 유사도 점수를 가진 후보 요약문을 최종 추출적 요약으로 선택한다.
  • 의도된 요약문과 문서 간의 의미적 일치를 최적화하기 위해 대조 손실을 사용해 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1요약 수준의 매칭 프레임워크가 기존의 문장 수준 추출기보다 추출적 요약에서 더 우수한 성능을 내는가?
  • RQ2다양한 벤치마크 데이터셋에서 문장 수준과 요약 수준의 추출기 간의 본질적 격차는 무엇인가?
  • RQ3'펄-요약'(pearl-summaries) — 개별적으로 뛰어나지 않지만 높은 점수를 받는 문장들로 구성된 요약 — 가 존재할 경우 모델 성능에 어떤 영향을 미치는가?
  • RQ4BERT-base만을 사용하는 간단한 매칭 모델이 복잡한 디코딩이나 강화 학습 없이도 어떻게 최신 기준 성능을 달성할 수 있는가?
  • RQ5요약 길이와 높은 점수를 받는 문장의 분포가 매칭 기반 프레임워크의 효과성에 어떤 영향을 미치는가?

주요 결과

  • MatchSum는 단지 BERT-base만을 사용하여 CNN/DailyMail 데이터셋에서 ROUGE-1 점수 44.41의 새로운 SOTA 성능을 달성하며, 이는 이전의 강력한 기준 모델들을 능가한다.
  • MatchSum의 성능 향상은 '펄-요약'을 포함한 샘플에서 가장 두드러지게 나타나며, 개별적으로 평균 수준이지만 조합으로는 매우 유사한 요약을 형성하는 문장들에서 두드러진다.
  • XSum에서는 MatchSum가 학습 비율 ψ(𝒟) = 0.64를 기록하여 높은 성능 향상 잠재력을 보이며, 더 긴 요약(예: PubMed 및 Multi-News)에서는 요약 수준 최적화의 상한선이 더 높아서 ψ(𝒟)가 0.2 이하로 떨어진다.
  • 모델의 성능 향상은 '펄-요약'의 존재와 유의미하게 상관관계가 있으며, 금본 요약이 개별적으로 높은 점수를 받는 문장들로 구성된 경우에는 덜 효과적이다.
  • 이 프레임워크의 효과성은 데이터셋 특성과 정량적으로 연관되어 있으며, '펄-요약'이 많고 요약 길이가 짧은 데이터셋에서 더 큰 성과 향상이 관찰된다.
  • 분석을 통해 문장 수준과 요약 수준의 추출기 간에 측정 가능한 본질적 격차가 존재함을 확인하였으며, 이는 요약 수준 접근 방식의 필요성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.