Skip to main content
QUICK REVIEW

[논문 리뷰] AQuaMuSe: Automatically Generating Datasets for Query-Based Multi-Document Summarization

Sayali Kulkarni, Sheide Chammas|arXiv (Cornell University)|2020. 10. 23.
Topic Modeling참고 문헌 34인용 수 33
한 줄 요약

AQuaMuSe는 질문 응답 데이터와 대규모 웹 코퍼스에서 qMDS 예제를 자동으로 마이닝하여 대상 다중 문서 요약을 생성하고, 추상적 및 추출적 qMDS를 위한 5,519개의 예제와 쿼리당 평균 6개의 출처 문서를 얻습니다.

ABSTRACT

Summarization is the task of compressing source document(s) into coherent and succinct passages. This is a valuable tool to present users with concise and accurate sketch of the top ranked documents related to their queries. Query-based multi-document summarization (qMDS) addresses this pervasive need, but the research is severely limited due to lack of training and evaluation datasets as existing single-document and multi-document summarization datasets are inadequate in form and scale. We propose a scalable approach called AQuaMuSe to automatically mine qMDS examples from question answering datasets and large document corpora. Our approach is unique in the sense that it can general a dual dataset -- for extractive and abstractive summaries both. We publicly release a specific instance of an AQuaMuSe dataset with 5,519 query-based summaries, each associated with an average of 6 input documents selected from an index of 355M documents from Common Crawl. Extensive evaluation of the dataset along with baseline summarization model experiments are provided.

연구 동기 및 목표

  • 대규모의 고품질 qMDS 데이터가 학습 및 평가에 필요하다는 점을 동기 부여한다.
  • QA 데이터 세트와 웹 코퍼스로부터 qMDS 데이터셋을 구성하는 확장 가능하고 자동화된 방법을 제안한다.
  • 추상적이고 추출적 타깃을 모두 갖춘 qMDS 데이터셋의 예시를 제공한다.
  • 사람의 평가와 기초 모델 실험을 통해 데이터셋의 품질을 입증한다.

제안 방법

  • Long-form 답변과 웹 패시지 간의 의미적 유사성을 측정하기 위해 Universal Sentence Encoder로 문장을 인코딩한다.
  • 유사도 임계값을 사용해 대형 웹 코퍼스(Common Crawl)에서 답변 문장을 가장 근접 이웃으로 매칭하여 후보 입력 문서를 선택한다.
  • 입력의 다양성 및 주제성을 제어하기 위해 tunable thresholds를 갖춘 top-K 문서 집합(K=7)을 구성한다.
  • 일치하는 패시지 R로부터 긴 형태의 답변 a를 합성하여 추상적 qMDS 예제를 생성하고 비추출적 생성을 가능하게 한다.
  • 일치하는 문장을 대상 답변에 제자리에서 치환하여 추출적 qMDS 예제를 생성한다.
  • 포함 범위, 밀도, 요약 재현성(0.75로 상한), 문서 품질을 포함한 데이터셋 특성을 평가하고 기초 모델 실험을 제공한다.

실험 결과

연구 질문

  • RQ1QA 데이터와 웹 코퍼스로부터 대규모 qMDS 데이터셋을 자동으로 생성하는 방법은 무엇인가?
  • RQ2자동으로 생성된 데이터가 추상적 qMDS와 추출적 qMDS 모두를 지원할 수 있는가?
  • RQ3결과 데이터셋의 품질 특성(포괄성, 유창성, 관련성)은 어떠하고 기초 모델은 여기에 대해 어떤 성능을 보이는가?
  • RQ4임계값, K와 같은 데이터셋 구성 선택이 입력의 다양성과 관련성에 어떤 영향을 미치는가?

주요 결과

  • 저자들은 5,519개의 qMDS 예제를 생성했다(학습 4,555; 검증 440; 테스트 524)이며 예제당 입력 문서 평균은 6개이다.
  • 데이터셋은 대규모 Common Crawl 기반(355M 페이지)과 목표 요약으로 Google Natural Questions의 하위 집합을 사용한다.
  • 추상적 예제의 85.18%가 의미적 정확성 작업에서 다수에 의해 관련성으로 평가되었다.
  • 유창성 측면에서 치환된 일치 문장을 포함한 추출적 패시지의 96.20%가 평가자에 의해 긍정적으로 평가되었으며, 혼란도는 80에서 82로만 약간 증가했다.
  • 요약 재현성은 0.75로 제한되어 현실적인 도전을 보장하면서도 목표 요약의 재구성이 가능하도록 한다.
  • 기초 추상적 모델(Hi-MAP, PEGASUS)과 추출적 기초 모델(NeuSum, TextRank)을 쿼리 비의존적 및 쿼리 기반 조건에서 평가하여 여유와 쿼리 조건의 영향력을 분석한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.