Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Improving Faithfulness in Abstractive Summarization

Xiuying Chen, Mingzhe Li|arXiv (Cornell University)|2022. 10. 04.
Topic Modeling인용 수 14
한 줄 요약

이 논문은 사실성 일관성을 향상시키기 위해 다중 작업 질문-답변(QA) 헤드를 통합하여 인코더 이해를 강화하고 언어 모델의 과신을 줄이기 위한 최대 마진 손실을 적용하는 FES라는 신뢰성 향상 요약 모델을 제안한다. CNN/DM 및 XSum에서의 실험 결과, FES는 강력한 기준 모델들보다 ROUGE 점수와 사실성 일관성 측면에서 뚜렷한 성능 향상을 보였다.

ABSTRACT

Despite the success achieved in neural abstractive summarization based on pre-trained language models, one unresolved issue is that the generated summaries are not always faithful to the input document. There are two possible causes of the unfaithfulness problem: (1) the summarization model fails to understand or capture the gist of the input text, and (2) the model over-relies on the language model to generate fluent but inadequate words. In this work, we propose a Faithfulness Enhanced Summarization model (FES), which is designed for addressing these two problems and improving faithfulness in abstractive summarization. For the first problem, we propose to use question-answering (QA) to examine whether the encoder fully grasps the input document and can answer the questions on the key information in the input. The QA attention on the proper input words can also be used to stipulate how the decoder should attend to the source. For the second problem, we introduce a max-margin loss defined on the difference between the language and the summarization model, aiming to prevent the overconfidence of the language model. Extensive experiments on two benchmark summarization datasets, CNN/DM and XSum, demonstrate that our model significantly outperforms strong baselines. The evaluation of factual consistency also shows that our model generates more faithful summaries than baselines.

연구 동기 및 목표

  • 원본 문서에 대한 인코더 이해 부족으로 인한 추상적 요약의 내재적 오류를 해결하기 위해.
  • 언어 모델의 과신으로 인한 환각적 내용 생성에 기인하는 외재적 오류를 완화하기 위해.
  • 더 나은 의미 이해를 위해 요약 작업과 보조 QA 작업을 함께 훈련시켜 모델의 신뢰성 향상시키기 위해.
  • 낮은 언어 모델 확률을 가진 토큰에 대해 특히 강력하게 작용하는 최대 마진 손실을 적용하여 언어 모델 예측의 과신을 줄이기 위해.
  • 유창성이나 핵심 정보 유지 능력에 손상 없이 생성된 요약의 사실성 일관성을 향상시키기 위해.

제안 방법

  • 입력 문서의 핵심 정보에 대해 요약과 질문-답변를 동시에 최적화할 수 있도록 다중 작업 학습 프레임워크를 도입한다.
  • QA 어텐션 가중치를 활용해 디코더의 어텐션을 관련 인코더 표현에 맞추어 정렬함으로써 어텐션 정확도를 향상시킨다.
  • 언어 모델과 요약 모델의 로짓 간 차이를 기반으로 마진 지표 $ m_t $ 를 정의하여 과신 정도를 측정한다.
  • 특히 언어 모델 확률이 낮은 토큰에 대해 과신 지표를 최소화하는 최대 마진 손실을 적용한다.
  • 요약 손실, QA 손실, 최대 마진 손실을 조합한 복합 손실을 사용해 모델을 종합적으로 훈련시킨다.
  • 기본 모델로 사전 훈련된 모델(예: BART)을 활용하고, 제안된 보조 작업과 손실을 통해 미세 조정한다.

실험 결과

연구 질문

  • RQ1보조 질문-답변 작업이 원본 문서의 핵심 의미적 내용에 대한 인코더 이해도를 향상시키는가?
  • RQ2최대 마진 손실을 통해 언어 모델의 과신을 줄이면 요약에서 환각적 또는 외재적 사실 오류가 줄어드는가?
  • RQ3QA 기반 감독과 과신 정규화를 결합하면 추상적 요약의 사실성 일관성이 함께 향상되는가?
  • RQ4제안된 FES 모델이 ROUGE 점수와 신뢰성 메트릭 모두에서 강력한 기준 모델들을 얼마나 뛰어넘는가?
  • RQ5QA 어텐션과 최대 마진 손실이 다양한 오류 유형에서 무신뢰 생성을 억제하는 데 어떻게 상호작용하는가?

주요 결과

  • FES는 CNN/DM 및 XSum 데이터셋에서 모두 최신 기준 성능을 달성하였으며, 강력한 기준 모델들보다 ROUGE 점수에서 뚜렷한 향상을 보였다.
  • BART와 비교해 음수 마진을 가진 토큰 비율을 2.33% 감소시켰고, 평균 마진을 0.11점 향상시켰다.
  • 특히 엔티티 단어에 대해 마진 값이 0에 가까운 비율이 크게 감소하여 과신 예측이 줄어들었음을 확인했다.
  • 사례 연구 결과, FES는 BART, PEGASUS, SimCLS에서 관찰된 내재적 오류(원본 내용 이해 부족)와 외재적 오류(환각 문장)를 모두 제거하였다.
  • QA 작업과 최대 마진 손실은 상호 보완적 이점을 제공한다: QA는 의미 기반 정렬을 향상시키고, 마진 손실은 언어 모델의 과신을 억제한다.
  • 오류 분석 결과, 일부 무신뢰적 이름은 훈련 데이터 泄漏로 인해 발생함을 확인하였으며, 이는 후처리 수정을 통해 추가로 신뢰성을 향상시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.