Skip to main content
QUICK REVIEW

[논문 리뷰] Inspecting the Factuality of Hallucinated Entities in Abstractive Summarization.

Meng Cao, Yue Dong|arXiv (Cornell University)|2021. 08. 30.
Topic Modeling참고 문헌 25인용 수 6
한 줄 요약

이 논문은 사전 훈련된 및 미세조정된 마스킹 언어 모델에서의 사전 및 사후 확률을 활용하여 개괄적 요약에서 사실적이고 비사실적인 환상적 실체를 구분하는 새로운 방법을 제안한다. 이 방법은 정확도와 F1에서 세 가지 베이스라인을 크게 뛰어넘으며, 사실성에 대한 인간 평가와 강한 상관관계를 보인다.

ABSTRACT

State-of-the-art abstractive summarization systems often generate \emph{hallucinations}; i.e., content that is not directly inferable from the source text. Despite being assumed incorrect, many of the hallucinated contents are consistent with world knowledge (factual hallucinations). Including these factual hallucinations into a summary can be beneficial in providing additional background information. In this work, we propose a novel detection approach that separates factual from non-factual hallucinations of entities. Our method is based on an entity's prior and posterior probabilities according to pre-trained and finetuned masked language models, respectively. Empirical results suggest that our method vastly outperforms three strong baselines in both accuracy and F1 scores and has a strong correlation with human judgments on factuality classification tasks. Furthermore, our approach can provide insight into whether a particular hallucination is caused by the summarizer's pre-training or fine-tuning step.

연구 동기 및 목표

  • 개괄적 요약에서 세계 지식과 사실적으로 일치하는 환상적 실체인 사실적 환상성을 식별하는 데 도전하는 것.
  • 사실적 환상성과 비사실적 환상성을 분리하여 더 정보가 풍부하고 신뢰할 수 있는 요약을 가능하게 하는 것.
  • 환상성이 요약 모델의 사전 훈련 단계인지, 아니면 미세조정 단계에서 발생하는지에 대한 통찰을 제공하는 것.
  • 인간이 평가한 사실성 판단과 강하게 상관관계를 가지는 탐지 방법을 개발하는 것.

제안 방법

  • 방법은 원본 텍스트에서 사전 훈련된 마스킹 언어 모델을 사용하여 실체의 사전 확률을 계산한다.
  • 미세조정된 개괄적 요약 모델을 사용하여 실체의 사후 확률를 계산한다.
  • 사후 확률와 사전 확률의 비율을 사용하여 환상적 실체가 사실적으로 근거가 있는지의 가능성을 평가한다.
  • 사전 훈련과 미세조정 사이의 확률 분포 변화를 활용하여 환상성의 기원을 추적한다.
  • 인간이 평가한 데이터를 사용하여 사실성 분류 작업에서 모델을 훈련하고 평가한다.
  • 정확도와 F1 점수를 사용하여 세 가지 강력한 베이스라인과의 비교를 통해 방법을 평가한다.

실험 결과

연구 질문

  • RQ1개괄적 요약에서 사실적 환상성과 비사실적 환상성을 효과적으로 구분할 수 있는가?
  • RQ2제안된 방법은 사실성에 대한 인간 평가와 얼마나 잘 상관되는가?
  • RQ3이 방법은 환상적 실체가 사전 훈련인지, 아니면 미세조정인지의 기원을 식별할 수 있는가?
  • RQ4기존의 베이스라인과 비교할 때, 이 방법은 사실적 환상성을 탐지하는 데 얼마나 효과적인가?

주요 결과

  • 제안된 방법은 사실적 환상성을 탐지하는 데 있어 세 가지 강력한 베이스라인보다 유의미하게 높은 정확도와 F1 점수를 달성한다.
  • 이 방법은 인간이 평가한 사실성 판단과 분류 작업에서 강한 상관관계를 보인다.
  • 이 방법은 환상적 실체가 모델의 사전 훈련 단계인지, 아니면 미세조정 단계에서 기인했는지 여부를 성공적으로 식별한다.
  • 이 방법은 다양한 요약 작업에서 뛰어난 성능을 보이며 일반화 가능성의 잠재력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.