Skip to main content
QUICK REVIEW

[논문 리뷰] Abstractive Summarization for Low Resource Data using Domain Transfer and Data Synthesis

Ahmed Magooda, Diane Litman|arXiv (Cornell University)|2020. 02. 09.
Topic Modeling인용 수 8
한 줄 요약

이 논문은 저자원 학생 반성 데이터를 위한 개성 요약을 향상시키기 위해 도메인 전이와 템플릿 기반 데이터 합성의 하이브리드 접근법을 제안한다. 사전 훈련된 모델을 CNN/DM 뉴스 데이터로 미세조정하고, 합성된 요약어를 보완함으로써, 도메인 내 데이터로만 훈련하는 것이나 추출 기반 기준 모델보다 더 높은 ROUGE 점수와 향상된 인간 평가 기반 일관성 향상을 달성한다.

ABSTRACT

Training abstractive summarization models typically requires large amounts of data, which can be a limitation for many domains. In this paper we explore using domain transfer and data synthesis to improve the performance of recent abstractive summarization methods when applied to small corpora of student reflections. First, we explored whether tuning state of the art model trained on newspaper data could boost performance on student reflection data. Evaluations demonstrated that summaries produced by the tuned model achieved higher ROUGE scores compared to model trained on just student reflection data or just newspaper data. The tuned model also achieved higher scores compared to extractive summarization baselines, and additionally was judged to produce more coherent and readable summaries in human evaluations. Second, we explored whether synthesizing summaries of student data could additionally boost performance. We proposed a template-based model to synthesize new data, which when incorporated into training further increased ROUGE scores. Finally, we showed that combining data synthesis with domain transfer achieved higher ROUGE scores compared to only using one of the two approaches.

연구 동기 및 목표

  • 학생 반성과 같이 충분한 훈련 데이터가 부족한 저자원 도메인에서의 개성 요약 성능이 열 劣한 문제를 해결한다.
  • 사전 훈련된 개성 요약 모델을 도메인 외 뉴스 데이터로 미세조정함으로써 도메인 내 학생 반성 데이터에서의 성능 향상 여부를 조사한다.
  • 템플릿 기반 모델을 사용해 추가 훈련 데이터를 합성함으로써 도메인 내 데이터에서의 요약 성능 향상 여부를 탐색한다.
  • 도메인 전이와 데이터 합성의 병합 효과를 평가하여 상호 보완적인 향상 여부를 판단한다.
  • 자동화된 지표(ROUGE)와 인간 평가를 통해 생성된 요약의 품질을 평가한다. (일관성 및 독해성 기준)

제안 방법

  • 사전 훈련된 개성 요약 모델(PG-net)을 도메인 내 학생 반성 데이터로 미세조정한다. 이 모델은 사전에 CNN/DailyMail 뉴스 데이터로 훈련되었다.
  • 학생 반성 문서에서 언어 패턴과 의미적 템플릿을 사용해 합성 요약어를 생성하는 템플릿 기반 데이터 합성 모델을 개발한다.
  • 합성된 요약어를 사용해 개성 모델의 사전 훈련 및 미세조정 단계의 훈련 데이터를 보완한다.
  • 세 가지 훈련 설정을 비교한다: (1) 학생 반성어로만 훈련, (2) 도메인 전이(사전 훈련: CNN/DM, 미세조정: 반성어), (3) 도메인 전이에 더해 합성 데이터 증강.
  • 효과성을 비교하기 위해 데이터 합성의 기준으로 워드넷 기반 단어 교체 방법을 구현한다.
  • 인간 평가를 실시하여 평가자가 세 가지 모델 출력 중에서 가장 일관성 있고 독해하기 쉬운 요약어를 선택하도록 한다: CNN/DM 전용, 학생 반성어 전용, 도메인 전이 모델.

실험 결과

연구 질문

  • RQ1사전 훈련된 개성 요약 모델을 도메인 외 뉴스 데이터로 미세조정하면 저자원 학생 반성 데이터에서 요약 성능이 향상되는가?
  • RQ2템플릿 기반 방법을 사용해 추가 요약어를 합성하면 도메인 내 데이터에서의 개성 요약 모델 성능이 향상되는가?
  • RQ3도메인 전이와 데이터 합성의 조합은 개별적으로 사용할 경우보다 더 효과적인가?
  • RQ4조정된 모델이 생성한 요약어는 도메인 내 데이터로만 훈련된 모델의 요약어보다 더 높은 일관성과 독해성을 보이는가?
  • RQ5제안된 템플릿 기반 합성 모델은 품질 측면에서 인간 기준 요약어와 경쟁 가능한 요약어를 생성할 수 있는가?

주요 결과

  • 학생 반성 데이터로 사전 훈련된 모델을 미세조정함으로써, 도메인 내 데이터로만 훈련하거나 추출 기반 기준 모델을 사용한 경우보다 ROUGE 점수가 뚜렷이 향상되었다.
  • 도메인 전이 모델은 네 개의 학생 반성 코퍼스 전반에서 CNN/DM 전용 모델과 도메인 내 전용 모델보다 더 높은 ROUGE 점수를 기록했다.
  • 제안된 템플릿 기반 모델을 사용해 요약어를 합성함으로써, 사전 훈련 및 미세조정 단계에서 ROUGE 점수에 일관된 향상이 있었으며, 워드넷 기반 기준보다 우수한 성능을 보였다.
  • 도메인 전이와 데이터 합성의 조합은 가장 높은 ROUGE 점수를 기록했으며, 특히 합성 데이터를 사전 훈련 및 미세조정 모두에 사용한 경우 최고의 성능를 기록했다.
  • 인간 평가 결과, CS에서 49%의 평가자가 도메인 전이 모델의 요약어를 선호했고, Stat2015에서는 41%가 선호하여, CNN/DM 전용 및 도메인 내 전용 모델을 모두 초월했다.
  • 템플릿 기반 합성 모델은 ROUGE 점수에서는 최상위 성능는 아니었지만, 인간 기준 요약어와 경쟁 가능한 요약어를 생성했으며, 향후 개선 잠재력이 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.