Skip to main content
QUICK REVIEW

[논문 리뷰] Align then Summarize: Automatic Alignment Methods for Summarization Corpus Creation

Paul Tardy, David Janiszek|arXiv (Cornell University)|2020. 07. 15.
Topic Modeling참고 문헌 24인용 수 6
한 줄 요약

이 논문은 신경망 요약을 위한 대규모 데이터 수집을 가능하게 하기 위해 회의 번역문과 해당 보고서를 자동으로 정렬하는 부트스트랩 방법을 제안한다. 인간 피드백을 통해 사전 정렬을 반복적으로 개선함으로써, annotation 작업량을 줄이고 public_meetings라는 새로운 공개 코퍼스에서 요약 성능을 약 +4 ROUGE 포인트 향상시킨다.

ABSTRACT

Summarizing texts is not a straightforward task. Before even considering text summarization, one should determine what kind of summary is expected. How much should the information be compressed? Is it relevant to reformulate or should the summary stick to the original phrasing? State-of-the-art on automatic text summarization mostly revolves around news articles. We suggest that considering a wider variety of tasks would lead to an improvement in the field, in terms of generalization and robustness. We explore meeting summarization: generating reports from automatic transcriptions. Our work consists in segmenting and aligning transcriptions with respect to reports, to get a suitable dataset for neural summarization. Using a bootstrapping approach, we provide pre-alignments that are corrected by human annotators, making a validation set against which we evaluate automatic models. This consistently reduces annotators' efforts by providing iteratively better pre-alignment and maximizes the corpus size by using annotations from our automatic alignment models. Evaluation is conducted on \publicmeetings, a novel corpus of aligned public meetings. We report automatic alignment and summarization performances on this corpus and show that automatic alignment is relevant for data annotation since it leads to large improvement of almost +4 on all ROUGE scores on the summarization task.

연구 동기 및 목표

  • 자동 텍스트 요약을 위한 다양하고 뉴스 외의 데이터셋 부족 문제를 해결하기 위해, 개성 있고 추상적 요약이 필요한 회의 데이터에 초점을 맞춘다.
  • 사전 정렬 모델을 사용해 인간의 정렬 작업량을 줄이고, 반복적으로 향상시키는 방식으로 정렬 코퍼스를 생성하는 데 목적이 있다.
  • 자동 정렬과 인간의 참여를 통한 개선을 결합한 확장 가능한 파이프라인을 개발하여 대규모 고품질 요약 데이터셋을 구축한다.
  • 새로운 공개 코퍼스를 사용해 자동으로 생성된 정렬이 최종 신경망 요약 성능에 미치는 영향을 평가한다.
  • 자동 정렬이 품질을 훼손하지 않으면서 요약 모델 성능을 크게 향상시킬 수 있음을 입증한다.

제안 방법

  • 화자 전환 지점에서 회의 번역문을 분할하여 정렬을 위한 이산 단위를 생성한다.
  • 부트스트랩 루프를 활용: 임베딩 기반 유사도를 사용해 초도 자동 정렬을 생성한 후, 인간의 정렬을 통해 이를 개선한다.
  • 단어 수준 및 세그먼트 수준의 유사도 측정 지표(예: 단어 정확도, WindowDiff)를 사용해 정렬 품질을 평가한다.
  • 골드 표준 인간 정렬 쌍과 자동 정렬 쌍 양쪽 모두를 기반으로 신경망 요약 모델을 훈련시켜 성능을 비교한다.
  • 평가 시 관련 없는 전사 세그먼트를 식별하고 제외하기 위한 필터링 메커니즘을 적용하여 공정한 비교를 확보한다.
  • 정렬 과정에서 의미 매칭을 위해 공개된 단어 임베딩(Fauconnier, 2015)을 사용한다.

실험 결과

연구 질문

  • RQ1자동 정렬 방법은 회의 요약을 위한 높은 품질의 정렬을 유지하면서 인간 정렬 작업량을 줄일 수 있는가?
  • RQ2골드 표준 인간 정렬 데이터와 비교했을 때, 자동 정렬 데이터를 사용하면 신경망 요약 성능이 얼마나 향상되는가?
  • RQ3인간 피드백을 통한 사전 정렬의 반복적 개선이 정렬 정확도와 효율성에 어떤 영향을 미치는가?
  • RQ4관련 없는 전사 세그먼트가 정렬 품질에 어떤 영향을 미치며, 평가에서 효과적으로 다룰 수 있는가?
  • RQ5정렬 신뢰도 점수를 활용해 후속 요약 작업에 사용할 수 없는 저품질 자동 정렬을 걸러낼 수 있는가?

주요 결과

  • 제안된 부트스트랩 방법은 인간 평가자 작업량을 크게 줄였으며, 인간 정렬 정확도가 첫 번째 반복 시 18.63%에서 최종 반복 시 72.67%로 상승했다.
  • 자동 정렬을 사용해 훈련 데이터를 확장함으로써, public_meetings 테스트 세트에서 모든 지표(R1, R2, RL)에 대해 약 +4 ROUGE 포인트의 일관된 향상이 이루어졌다.
  • 21,000개의 골드 표준 및 70,000개의 자동 정렬 훈련 쌍을 포함하는 public_meetings 코퍼스는 정렬 및 요약 모델의 강력한 평가를 가능하게 한다.
  • 관련 없는 세그먼트를 제거했을 때 단어 정확도가 4.7% 감소하여, 이러한 세그먼트가 정렬 평가에 상당한 영향을 미치며 반드시 고려되어야 함을 시사한다.
  • 최종 검증 세트에서 자동 정렬 모델은 세그먼트 수준 정확도 72.67%를 달성하여 실제 회의 데이터에서 뛰어난 성능을 입증했다.
  • 자동 정렬과 최소한의 인간 수정을 조합함으로써, 이 방법은 대규모 고품질 요약 데이터셋 구축을 성공적으로 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.