Skip to main content
QUICK REVIEW

[논문 리뷰] Don't Say What You Don't Know: Improving the Consistency of Abstractive Summarization by Constraining Beam Search

Daniel King, Zejiang Shen|arXiv (Cornell University)|2022. 03. 16.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 소스 텍스트에 의해 지지될 가능성이 높은 토큰으로 생성된 토큰을 제한함으로써 개괄적 요약 일관성을 향상시키는 비드 브레인 서치 디코딩 방법인 Pinocchio를 제안한다. 주어진 텍스트의 지지도를 검출하고 환영을 되돌리기 위해 주의(attention), 신뢰도(confidence), 빈도(frequency) 히وري스틱을 사용함으로써 Pinocchio는 두 데이터셋에서 일관성을 평균 68% 향상시키며, 유창성 손실는 최소화한다. 추가 학습이 필요로 하지 않는다.

ABSTRACT

Abstractive summarization systems today produce fluent and relevant output, but often "hallucinate" statements not supported by the source text. We analyze the connection between hallucinations and training data, and find evidence that models hallucinate because they train on target summaries that are unsupported by the source. Based on our findings, we present PINOCCHIO, a new decoding method that improves the consistency of a transformer-based abstractive summarizer by constraining beam search to avoid hallucinations. Given the model states and outputs at a given step, PINOCCHIO detects likely model hallucinations based on various measures of attribution to the source text. PINOCCHIO backtracks to find more consistent output, and can opt to produce no summary at all when no consistent generation can be found. In experiments, we find that PINOCCHIO improves the consistency of generation (in terms of F1) by an average of~67% on two abstractive summarization datasets.

연구 동기 및 목표

  • 개괄적 요약 모델이 환영을 일으키는 이유를 분석함으로써, 지원되지 않는 요약이 훈련 데이터에 어떻게 기여하는지 조사하기 위해.
  • 은은 기반의 일관성 없는 요약으로 훈련된 모델에서 환영의 근본 원인을 해결하기 위해.
  • 재학습이나 추가 모델 없이도 일관성을 향상시키는 디코딩 방법을 개발하기 위해.
  • 과학적 개념 요약을 위한 새로운 개괄적 요약 데이터셋인 과학적 개념 기술(Scientific Concept Description, SCD)을 소개하기 위해.
  • 다양한 도메인, 특히 과학문헌을 포함하여 방법의 강건성과 일반화 능력을 테스트하기 위해.

제안 방법

  • Pinocchio는 주의 분포와 모델 신뢰도 점수를 사용하여 소스 텍스트에 의해 지지될 가능성이 낮은 토큰을 걸러내는 방식으로 비드 브레인 서치를 제약한다.
  • 디코딩 중 각 후보 토큰에 대한 소스 지지도를 추정하기 위해 어휘 빈도와 주의 집중도 기반의 히وري스틱을 적용한다.
  • 디코딩 단계에서 지지되는 토큰이 없을 경우, Pinocchio는 이전 상태로 되돌아가 다른 생성 경로를 탐색한다.
  • 일관된 출력이 발견되지 않으면, 요약 생성을 완전히 생략할 수 있으며, 이는 환영 콘텐츠를 피하는 데 기여한다.
  • 재학습이나 미세조정 없이도 작동하는 후행 디코딩 기법으로, 기반 모델의 재학습이 필요로 하지 않는다.
  • 이 방법은 두 개의 개괄적 요약 데이터셋과 60,000개 샘플을 포함한 새로운 과학적 개념 기술(SCD) 데이터셋에서 평가되었다.

실험 결과

연구 질문

  • RQ1지원되지 않는 요약을 포함한 훈련 데이터가 개괄적 요약 모델의 환영에 얼마나 기여하는가?
  • RQ2재학습이나 외부 모델 없이도 비드 브레인 서치를 제약하여 일관성을 향상시킬 수 있는가?
  • RQ3모델이 출력에서 고빈도 n-그램을 선호하는 경향이 환영과 어떻게 관련되는가?
  • RQ4이 방법은 과학적 텍스트를 포함한 다양한 도메인에서 일관성을 향상시키는가?
  • RQ5자동 평가 지표인 ROUGE는 사실성 일관성과 얼마나 관련이 있으며, 잘못된 해석을 유도할 수 있는가?

주요 결과

  • Pinocchio는 CNN/DM 및 XSUM 데이터셋에서 요약 일관성을 평균 68% 향상시키며, 유창성에 거의 영향을 주지 않는다.
  • 주의와 신뢰도 히وري스틱을 사용하여 지지되지 않는 토큰 예측을 탐지하고 되돌림으로써 환영을 크게 줄였다.
  • BART가 생성한 요약은 지문보다 더 덜 꼬인 n-그램 분포를 보이며, 고빈도, 유사한 어조의 어휘 표현을 선호하는 경향이 있음을 시사한다.
  • 개괄적 데이터셋의 표적 요약 중 상당 부분(18–24%)이 소스 텍스트와 일관성이 없어, 데이터 수집 과정에서 근본 원인이 존재함을 시사한다.
  • 60,000개 샘플과 118,000개 논문 참조를 포함한 SCD 데이터셋은 과학적 개념 요약을 위한 도전적인 새로운 기준이 되었다.
  • Pinocchio의 성능은 모델별 설정에 민감하며, PEGASUS와 같은 모델에 직접 일반화되지 않으며 적응이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.