Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Beam Search for Hallucination Mitigation in Abstractive Summarization

Arvind Krishna Sridhar, Erik Visser|arXiv (Cornell University)|2022. 12. 06.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 추상적 요약에서 환각 현상을 완화하기 위해 saliency-enhanced greedy decoding 동안 입력 컨텍스트와 중간 beam 가설 간의 함의 점수를 계산하는 NLI 보조 beam 재정렬 메커니즘을 제안한다. 이 방법은 모델의 미세조정이나 복잡한 후처리 없이도 XSum 및 CNN/DM 데이터셋에서 인간 평가에서 베이스라인을 능가하며, 사실 일致성을 향상시킨다.

ABSTRACT

Advancement in large pretrained language models has significantly improved their performance for conditional language generation tasks including summarization albeit with hallucinations. To reduce hallucinations, conventional methods proposed improving beam search or using a fact checker as a postprocessing step. In this paper, we investigate the use of the Natural Language Inference (NLI) entailment metric to detect and prevent hallucinations in summary generation. We propose an NLI-assisted beam re-ranking mechanism by computing entailment probability scores between the input context and summarization model-generated beams during saliency-enhanced greedy decoding. Moreover, a diversity metric is introduced to compare its effectiveness against vanilla beam search. Our proposed algorithm significantly outperforms vanilla beam decoding on XSum and CNN/DM datasets.

연구 동기 및 목표

  • 대규모 언어 모델이 생성하는 추상적 요약에서 지속적인 환각 문제를 해결하기 위해.
  • 모델의 미세조정이나 외부 사실 확인 파이프라인 없이도 일반화 가능한 추론 시점 방법을 개발하기 위해.
  • 기존의 사실성 평가 벤치마크인 FactCC, SummaC, QGQA의 한계를 평가하고 폭 드러내기 위해.
  • beam 디코딩 단계에서 계산된 NLI 함의 점수가 실제로 모델이 더 사실 일치성 있는 출력으로 향하도록 효과적으로 이끌 수 있는지 입증하기 위해.
  • 공개된 요약 데이터셋에서 인간 평가를 통해 방법의 효과성을 검증하기 위해.

제안 방법

  • 모델은 입력 컨텍스트의 주요 부분에 초점을 맞추기 위해 saliency-enhanced greedy decoding를 사용하여 중간 beam 가설을 생성한다.
  • 각 디코딩 단계에서 현재 부분 요약과 입력 컨텍스트 사이의 자연어 추론(NLI) 함의 점수를 계산한다.
  • 누적된 NLI 함의 확률을 기반으로 beam을 재정렬하여 입력에 더 잘 지지되는 가설을 선호한다.
  • 이 방법은 beam search에 직접 NLI 점수를 통합하여 모델 파rameter를 변경하지 않고도 토큰 수준에서 beam 확률을 수정한다.
  • 이 방법은 태스크에 특화된 미세조정 없이도 다양한 모델과 데이터셋으로 쉽게 일반화될 수 있도록 설계되었다.
  • 경향 기반 제약 조건이나 후처리 사실 확인에 의존하는 대신, 디코딩 중에 의미 매칭을 사용하여 사실 일치성 있는 생성으로 유도한다.

실험 결과

연구 질문

  • RQ1beam 디코딩 중에 계산된 NLI 함의 점수가 추상적 요약에서 환각 현상을 효과적으로 줄일 수 있는가?
  • RQ2제안된 NLI 보조 beam 재정렬 방법은 기존의 환각 현상 완화 베이스라인과 비교해 사실 일치성 측면에서 어떻게 성능을 내는가?
  • RQ3기존의 사실성 평가 벤치마크는 실제 요약 출력에서 환각 현상을 얼마나 잘 감지하지 못하는가?
  • RQ4일반적인, 추론 시점의 방법이 모델의 미세조정이나 아키텍처 변경 없이도 사실 일치성을 향상시킬 수 있는가?
  • RQ5beam 수준에서 NLI를 통합하면 기존의 beam search나 PINOCCHIO와 비교해 더 일관되고 사실 일치성 있는 요약을 얻을 수 있는가?

주요 결과

  • 제안된 NLI 보조 beam 재정렬 방법은 XSum 및 CNN/DM 데이터셋에서 인간 평가에서 기존의 beam search와 PINOCCHIO를 뛰어넘는 성능을 보였다.
  • 인간 평가자들은 제안된 방법으로 생성된 요약이 베이스라인 방법보다 사실 일치성이 더 높고 환각이 적다고 평가했다.
  • 이 방법은 다양한 입력 유형과 요약 길이에 걸쳐 일관된 향상을 보이며, 강력한 일반화 능력을 보였다.
  • 연구 결과, FactCC, SummaC, QGQA와 같은 기존의 사실성 평가 벤치마크는 특히 추상적 요약에서 복잡한 환각 현상을 감지하는 데 부족함을 드러냈다.
  • 추론 분석에서 NLI 점수가 beam 수준에서 모델이 환각된 내용을 포함한 초기 beam에서 사실에 기반한 가설로 성공적으로 유도하는 것으로 나타났다.
  • 추론 시간을 늘리거나 추가 모델 파rameter나 미세조정이 필요 없이도 사실 일치성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.