Skip to main content
QUICK REVIEW

[논문 리뷰] Hallucinated but Factual! Inspecting the Factuality of Hallucinations in Abstractive Summarization

Meng Cao, Yue Dong|ArXiv.org|2021. 08. 30.
Topic Modeling인용 수 14
한 줄 요약

이 논문은 마스크된 언어 모델에서의 사전 및 사후 확률을 활용하여 개략 요약에서 사실적이고 비사실적인 환각을 구별하는 새로운 방법을 제안한다. 사실적 환각—최신 모델인 BART와 같은 모델에서 흔한 현상—은 종종 유익하며, 높은 정확도로 탐지 가능하며, 기존의 기준보다 뛰어나며 강화 학습 미세조정에서 사실성 향상에 기여하면서 개괄성은 손상되지 않는다.

ABSTRACT

State-of-the-art abstractive summarization systems often generate \emph{hallucinations}; i.e., content that is not directly inferable from the source text. Despite being assumed incorrect, we find that much hallucinated content is factual, namely consistent with world knowledge. These factual hallucinations can be beneficial in a summary by providing useful background information. In this work, we propose a novel detection approach that separates factual from non-factual hallucinations of entities. Our method utilizes an entity's prior and posterior probabilities according to pre-trained and finetuned masked language models, respectively. Empirical results suggest that our approach vastly outperforms two baselines %in both accuracy and F1 scores and strongly correlates with human judgments. % on factuality classification tasks. Furthermore, we show that our detector, when used as a reward signal in an off-line reinforcement learning (RL) algorithm, significantly improves the factuality of summaries while maintaining the level of abstractiveness.

연구 동기 및 목표

  • 개략 요약에서 환각된 내용이 항상 잘못된지 조사하여, 모든 환각이 해로운 것으로 간주되는 가정에 도전한다.
  • 세계 지식과 일치하는 사실적 환각(사실적으로 일관된 것)과 사실적으로 잘못된 비사실적 환각을 구별하는 방법을 개발한다.
  • XSum 데이터셋에 대한 실체 수준의 환각과 사실성에 대한 인간이 애너테이션한 데이터셋을 구축한다.
  • 제안된 탐지기가 오프라인 강화 학습에서 요약의 사실성을 향상시키기 위한 효과적인 보상 신호로 기능할 수 있는지 평가한다.
  • 사전 훈련 또는 미세조정 데이터 분포에서 기인한 사실적 환각의 기원을 추적하여 분석한다.

제안 방법

  • 이 방법은 사전 확률(사전 훈련된 마스크된 언어 모델에서의 실체 확률)과 사후 확률(소스 문서를 고려한 미세조정된 마스크된 언어 모델에서의 실체 확률)을 특성으로 조합한 KNN 분류기를 사용한다.
  • 사전 확률은 소스 텍스트와 무관하게 사전 훈련된 언어 모델의 어휘 내 실체의 가능도로 계산된다.
  • 사후 확률은 소스 문서의 맥락을 고려하여, 미세조정된 마스크된 언어 모델을 사용해 실체의 가능도를 계산한다.
  • 분류기는 XSum 데이터셋에 대한 실체 수준의 환각 및 사실성 애너테이션을 새로 제작하여 훈련되며, 실체가 환각되었는지 여부와 사실적인지 여부를 레이블로 포함한다.
  • 탐지기는 오프라인 강화 학습 프레임워크에 통합되어 요약 모델의 사실성을 높이기 위한 보상 신호로 사용된다.
  • 모델의 지식 기원은 두 개의 CMLM(컨텍스트 기반 마스크된 언어 모델)에서의 사후 확률를 비교하여 추적되며, 로그 오즈 비율을 사용해 데이터 원천을 식별한다.

실험 결과

연구 질문

  • RQ1개략 요약에서 환각된 실체는 항상 사실적으로 잘못된가, 아니면 사실적이고 유익한 경우가 있는가?
  • RQ2마스크된 언어 모델에서의 사전 및 사후 확률이 실체 수준에서 사실적 환각과 비사실적 환각을 신뢰성 있게 구별할 수 있는가?
  • RQ3제안된 탐지기를 오프라인 강화 학습에서 보상 신호로 사용할 경우 요약의 사실성이 향상되며, 개괄성은 감소하지 않는가?
  • RQ4사실적 환각은 어디에서 기인하는가—사전 훈련 데이터에서인가, 아니면 미세조정 데이터(예: XSum)에서인가?
  • RQ5기존의 기준 대비 제안된 방법이 비사실적 환각 탐지에서 얼마나 우수한가, 그리고 인간 평가와의 상관관계는 어떠한가?

주요 결과

  • 제안된 방법은 인간 애너테이션된 XSum 데이터셋과 Maynez et al. (2020)의 데이터셋에서 비사실적 환각 탐지에서 두 기준보다 뛰어난 성능을 보였다.
  • XEnt 테스트 세트에서 제안된 방법은 사실성 F1 스코어 91.91을 기록하여 기준 방법들보다 유의미하게 뛰어났다.
  • 탐지기는 인간 애너테이션된 사실성 스코어와 강한 상관관계를 보이며 인간 판단과의 신뢰성 있는 일치를 나타냈다.
  • 오프라인 RL에서 보상 신호로 사용되었을 때, 제안된 방법은 요약의 사실성을 향상시키면서도 ROUGE 스코어를 유지하여 손실 절단 기준보다 더 우수한 사실성-개괄성 트레이드오프를 보였다.
  • 아블레이션 연구에서 사전 및 사후 확률 모두가 필수적임을 확인하였으며, 특히 사후 확률이 사실성 분류에 매우 중요하다는 점이 밝혀졌다.
  • σ(eₖ) 값이 높은 사실적 환각(즉, XSum에서 CNN/DM보다 더 높은 신뢰도를 가진)은 TF-IDF 검색 및 빈도 분석을 통해 주로 XSum 훈련 세트에서 기인한 것으로 밝혀졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.