Skip to main content
QUICK REVIEW

[논문 리뷰] mFACE: Multilingual Summarization with Factual Consistency Evaluation

Roee Aharoni, Shashi Narayan|arXiv (Cornell University)|2022. 12. 20.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 다국어 자연어 추론(NLI) 모델을 사용하여 사실 일관성을 향상시키는 다국어 개괄 요약 프레임워크인 mFACE를 제안한다. 환각 현상을 줄이기 위해 두 가지 방법—데이터 필터링(일관성 예측된 예제만 훈련에 사용)과 제어된 생성(일관성 신호에 따라 조건화)을 적용하여, XLSum 데이터셋에서 45개 언어 전반에 걸쳐 신뢰성 있는 요약 성능 향상이 이루어졌으며, 자동 평가 및 인간 평가 모두에서 요약 품질 향상이 확인되었다.

ABSTRACT

Abstractive summarization has enjoyed renewed interest in recent years, thanks to pre-trained language models and the availability of large-scale datasets. Despite promising results, current models still suffer from generating factually inconsistent summaries, reducing their utility for real-world application. Several recent efforts attempt to address this by devising models that automatically detect factual inconsistencies in machine generated summaries. However, they focus exclusively on English, a language with abundant resources. In this work, we leverage factual consistency evaluation models to improve multilingual summarization. We explore two intuitive approaches to mitigate hallucinations based on the signal provided by a multilingual NLI model, namely data filtering and controlled generation. Experimental results in the 45 languages from the XLSum dataset show gains over strong baselines in both automatic and human evaluation.

연구 동기 및 목표

  • 다국어 추상적 요약 모델에서 발생하는 사실 일관성 결여(환각 현상) 문제를 해결하기 위해.
  • 다국어 NLI를 통한 사실 일관성 평가가 저자원 언어 및 고자원 언어 전반에서 요약 성능 향상에 기여할 수 있는지 조사하기 위해.
  • 강력한 다국어 NLI 모델을 사용하여 XLSum 다국어 요약 데이터셋의 사실 일관성 결여 정도를 분석하기 위해.
  • NLI 신호를 활용해 요약의 사실 일관성을 향상시키기 위한 두 가지 실용적 방법—데이터 필터링과 제어된 생성—을 개발하고 평가하기 위해.
  • 향후 연구를 지원하기 위해 인간이 평가한 판단과 모델을 공개하기 위해.

제안 방법

  • XNLI 벤치마크에서 다국어 NLI 모델을 미세조정하여 입력 문서와 생성된 요약 사이의 사실 일관성을 평가한다.
  • XLSum 데이터셋의 모든 훈련 예제에 대해 NLI 모델을 적용하여 사실 일관성이 없는 요약을 식별하고 제거한다.
  • NLI 모델이 '함의'로 예측한 입력-요약 쌍만을 사용해 요약 모델을 훈련함으로써 데이터 필터링을 구현한다.
  • 디코딩 중에 NLI 모델의 예측 결과(함의 또는 모순)에 따라 요약 모델을 조건화함으로써 제어된 생성을 구현한다.
  • NLI 모델의 신뢰도 점수를 활용해 훈련 및 추론을 지도함으로써 주요 요약 모델을 재학습하지 않고도 사실 일관성을 향상시킨다.
  • 45개 언어 전반에서 인간 평가를 수집하여 요약 품질, 사실 일관성, 정보량을 평가하고, 이러한 애너테이션 기반으로 자동 평가 지표를 학습한다.

실험 결과

연구 질문

  • RQ1XLSum 다국어 요약 데이터셋에서 다양한 언어에 걸쳐 사실 일관성 결여 문제가 얼마나 심각한가?
  • RQ2다국어 NLI 모델이 사실 일관성이 없는 훈련 예제를 효과적으로 탐지하고 제거하여 요약 품질 향상에 기여할 수 있는가?
  • RQ3NLI 예측 결과(함의/모순)에 따라 요약 모델을 조건화하는 것이 표준 훈련 방식에 비해 더 사실적이고 정확한 요약을 생성하는가?
  • RQ4제안된 방법들(필터링 및 제어된 생성)이 다양한 언어에서 자동 평가 및 인간 평가 지표에 얼마나 기여하는가?
  • RQ545개 언어에서 수집한 인간 평가 판단을 바탕으로 다국어 요약의 사실 일관성 평가를 위한 신뢰할 수 있는 자동 평가 지표를 학습할 수 있는가?

주요 결과

  • 일부 언어에서 XLSum 데이터셋의 훈련 예제 중 최대 70%가 다국어 NLI 모델 기준으로 사실 일관성이 없음을 확인하여 데이터 품질 문제의 심각성을 드러냈다.
  • NLI 모델을 활용한 데이터 필터링이 사실 일관성 향상에 중대한 기여를 하였으며, 인간 평가 결과 기준 기존 베이스라인 대비 더 높은 사실 일관성 확보를 확인하였다.
  • NLI 신호에 따라 모델을 조건화하는 제어된 생성 방식은 환각 현상을 줄이면서도 정보량을 유지함으로써 요약 품질을 더욱 향상시켰다.
  • 필터링과 제어된 생성의 조합이 45개 언어 전반에서 ROUGE와 같은 자동 평가 지표뿐 아니라 인간 평가 지표에서도 강력한 베이스라인을 초월하는 성능을 보였다.
  • 45개 언어에서 수집한 인간 평가 판단을 기반으로 학습된 자동 평가 지표가 요약 품질, 사실 일관성, 정보량 평가와 잘 상관관계를 보였다.
  • 저자들은 다국어 NLI 모델, 요약 모델, 인간 평가 판단을 공개하여 향후 다국어 사실 일관성 평가 연구를 지원하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.