Skip to main content
QUICK REVIEW

[논문 리뷰] Factual Error Correction for Abstractive Summarization Models

Meng Cao, Yue Dong|arXiv (Cornell University)|2020. 10. 17.
Topic Modeling참고 문헌 18인용 수 12
한 줄 요약

이 논문은 히우리스틱적으로 손상된 기준 요약문에 사전 훈련된 신경망 모델을 활용하여 개괄적 요약 출력물의 사실 오류를 식별하고 수정하는 후처리 수정 보정 모듈을 제안한다. 모델은 일관되지 않은 실세계 요약문에서 17.74%의 수정률을 기록했으며, 일관된 요약문에서는 1.13%의 위양성률을 보이며 이전 방법들을 능가하는 사실 일관성 평가 성능을 확보했다.

ABSTRACT

Neural abstractive summarization systems have achieved promising progress, thanks to the availability of large-scale datasets and models pre-trained with self-supervised methods. However, ensuring the factual consistency of the generated summaries for abstractive summarization systems is a challenge. We propose a post-editing corrector module to address this issue by identifying and correcting factual errors in generated summaries. The neural corrector model is pre-trained on artificial examples that are created by applying a series of heuristic transformations on reference summaries. These transformations are inspired by an error analysis of state-of-the-art summarization model outputs. Experimental results show that our model is able to correct factual errors in summaries generated by other neural summarization models and outperforms previous models on factual consistency evaluation on the CNN/DailyMail dataset. We also find that transferring from artificial error correction to downstream settings is still very challenging.

연구 동기 및 목표

  • 개괄적 요약 모델에서 자주 발생하는 환각 또는 잘못된 사실로 인한 사실 일관성 문제를 해결하기 위해.
  • 주요 요약 생성 모델을 재훈련하지 않고도 사실 일관성을 향상시키기 위한 후처리 수정 보정 모듈을 개발하기 위해.
  • 기준 요약문을 히우리스틱 변환을 통해 인위적으로 생성한 사실 오류로 훈련된 보정 모델을 개발하기 위해.
  • 보정 모듈을 요약 출력물의 수정 도구이자 사실 일관성 평가자로 평가하기 위해.
  • 인위적 오류 수정과 실세계 요약 생성 모델 오류 사이의 일반화 갭을 조사하기 위해.

제안 방법

  • 보정 모듈은 최신 요약 생성 모델의 오류 분석에 영감을 얻은 히우리스틱 변환을 사용해 기준 요약문을 손상시킨 합성 데이터에서 훈련된 시퀀스-투-시퀀스 모델이다.
  • 손상 기법으로는 엔티티 교체, 시간 이동, 사실 삭제가 포함되며, 이는 개괄적 출력물에서 흔히 발생하는 사실 오류를 모방한다.
  • 원본 문서와 원래 초안 요약문을 조건으로 하여 보정된 요약문을 생성하도록 종단 간으로 미세조정된다.
  • 보정 모델(일관되지 않은 요약문이 포함된 테스트 세트에서 평가)과 일관성 평가자(편집이 필요한지 여부를 탐지함)로 두 가지 방식으로 평가된다.
  • 모델은 사전 훈련된 트랜스포머 아키텍처를 활용하며, 손상된 예시에서 마스크된 언어 모델링 목표를 사용해 훈련된다.
  • CNN/DailyMail 및 K2019 데이터셋에서 실요약 생성 모델 출력으로의 이식 가능성 테스트를 수행하였으며, 신뢰성과 정확성에 대한 인간 평가를 실시하였다.

실험 결과

연구 질문

  • RQ1신경 기반 후처리 수정 보정 모듈은 개괄적 모델이 생성한 요약문의 사실 오류를 효과적으로 식별하고 수정할 수 있는가?
  • RQ2인위적으로 생성된 오류로 훈련된 보정 모듈이 실세계 요약 생성 모델의 사실 일관성 문제에 얼마나 잘 일반화되는가?
  • RQ3보정 모듈이 개괄적 요약문에 대해 신뢰할 수 있는 사실 일관성 평가자로 기능할 수 있는 정도는 어느 정도인가?
  • RQ4사실적으로 올바른 요약문에서 수정 정확도와 부적절한 수정 사이의 트레이드오프는 어떠한가?
  • RQ5왜 인위적 오류 수정 설정과 실세계 오류 수정 설정 간의 성능 격차가 이렇게 크며, 그 이유는 무엇인가?

주요 결과

  • 인위적 테스트 세트에서 보정 모듈은 히우리스틱적으로 손상된 요약문 중 62.13%를 기준 요약문과 일치하도록 성공적으로 수정하여 62.13%의 수정률을 기록했다.
  • K2019 실세계 테스트 세트에서 보정 모듈은 일관되지 않은 요약문 62개 중 11개를 성공적으로 수정하여 17.74%의 수정률을 기록했다.
  • 일관된 요약문 441개 중 5개에서 잘못된 편집을 하여 1.13%의 위양성률을 기록했으며, 이는 올바른 요약문에서 매우 높은 신뢰도를 보임을 시사한다.
  • 실세계 요약문에서의 성능은 인위적 데이터에서의 성능보다 크게 떨어지며, 이는 합성 오류와 실세계 사실 오류 간의 분포 차이를 시사한다.
  • K2019 데이터셋에서 BERT와 FactCC보다도 보정 모듈이 사실 일관성 평가에서 뛰어난 성능을 보이며, 평가 도구로서의 효과성을 입증했다.
  • 인간 평가를 통해 보정 모듈이 사실 일관성 문제를 신뢰성 있게 수정하면서도, 이미 올바른 요약문에 대해 해로운 편집을 최소화할 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.