Skip to main content
QUICK REVIEW

[논문 리뷰] MoFE: Mixture of Factual Experts for Controlling Hallucinations in Abstractive Summarization.

Prafulla Kumar Choubey, Jesse Vig|arXiv (Cornell University)|2021. 10. 14.
Topic Modeling참고 문헌 36인용 수 5
한 줄 요약

MoFE는 사실 전문가의 혼합물로, 실체성 일致성 지표인 실체 간접적 중첩과 의존성 화살표 함의 지표를 사용하여 사실 일치성을 최소화하는 강화학습을 통해 개별 전문가를 훈련시어 요약 요약에서 환각을 줄인다. 이는 XSUM 및 CNN/DM에서 사실 일치성을 향상시키며 ROUGE 점수를 떨어뜨리지 않으며, 질문-답변 사실성 및 BERTScore 정밀도와 같은 새로운 평가 지표로 일반화된다.

ABSTRACT

Neural abstractive summarization models are susceptible to generating factually inconsistent content, a phenomenon known as hallucination. This limits the usability and adoption of these systems in real-world applications. To reduce the presence of hallucination, we propose the Mixture of Factual Experts (MoFE) model, which combines multiple summarization experts that each target a specific type of error. We train our experts using reinforcement learning (RL) to minimize the error defined by two factual consistency metrics: entity overlap and dependency arc entailment. We construct MoFE by combining the experts using two ensembling strategies (weights and logits) and evaluate them on two summarization datasets (XSUM and CNN/DM). Our experiments on BART models show that the MoFE improves performance according to both entity overlap and dependency arc entailment, without a significant performance drop on standard ROUGE metrics. The performance improvement also transfers to unseen factual consistency metrics, such as question answer-based factuality evaluation metric and BERTScore precision with respect to the source document.

연구 동기 및 목표

  • 신경 요약 요약 모델에서 사실 일치성, 즉 환각 문제를 해결하기 위해.
  • 요약에서 발생하는 다양한 오류 유형을 타깃으로 삼는 전문화된 전문가를 훈련시켜 환각을 줄이기 위해.
  • 실체 간접적 중첩과 의존성 화살표 함의 지표라는 두 가지 사실 일치성 지표를 사용한 강화학습을 통해 사실 일치성을 향상시키기 위해.
  • 사용된 지표 외의 새로운 평가 지표로 성능 향상이 전이되는지 평가하기 위해.
  • 요약 출력의 사실 정확성을 향상시키는 동안 강력한 ROUGE 성능을 유지하기 위해.

제안 방법

  • 각각 다른 유형의 사실 오류에 집중하는 다수의 전문화된 요약 전문가를 훈련시킨다.
  • 실체 간접적 중첩과 의존성 화살표 함의 지표를 기반으로 한 보상 신호를 최소화하기 위해 각 전문가를 강화학습으로 최적화한다.
  • 가중 평균과 로짓 수준 융합이라는 두 가지 앙상블 전략을 사용하여 전문가를 통합한다.
  • BART 기반 아키텍처를 사용하여 XSUM 및 CNN/DM이라는 두 가지 벤치마크 데이터셋에서 MoFE 모델을 평가한다.
  • 생성 품질을 평가하고 표준 자동 평가에서 성능 저하가 없는지 확인하기 위해 ROUGE 지표를 사용한다.
  • 실제로 사용되지 않은 지표, 예를 들어 질문-답변 사실성 평가 및 소스 문서 기반 BERTScore 정밀도에 대한 사실 일치성 향상의 전이 가능성 테스트를 수행한다.

실험 결과

연구 질문

  • RQ1특정 사실 오류 유형에 집중하여 전문가를 훈련시키는 것이 요약 요약에서 환각을 줄일 수 있는가?
  • RQ2가중치 및 로짓 수준 융합 전략을 통해 전문가를 통합하는 것이 ROUGE 점수를 떨어뜨리지 않고 사실 일치성을 향상시키는가?
  • RQ3실체 간접적 중첩과 의존성 화살표 함의 지표에서의 향상이 다른 사실 일치성 지표로 얼마나 일반화되는가?
  • RQ4MoFE 프레임워크는 환각을 크게 줄이면서도 강력한 생성 품질을 유지할 수 있는가?
  • RQ5모델의 사실 일치성 향상은 BERTScore 정밀도 및 질문-답변 사실성과 같은 새로운 평가 지표로 전이되는가?

주요 결과

  • MoFE는 XSUM 및 CNN/DM에서 실체 간접적 중첩과 의존성 화살표 함의 지표 점수의 향상으로 인해 사실 일치성을 향상시켰다.
  • 표준 ROUGE 지표에서 강력한 성능을 유지하여 생성 품질에 대한 성능 저하가 없음을 나타냈다.
  • 실제로 사용되지 않은 지표, 예를 들어 질문-답변 사실성 평가 및 소스 문서 기반 BERTScore 정밀도에 대해 사실 일치성 향상이 일반화됨을 보였다.
  • 사실 일치성 지표를 기반으로 한 강화학습이 다양한 평가 환경에서 환각을 효과적으로 줄였다.
  • 가중치 및 로짓 수준 융합 전략을 통해 전문가 출력을 성공적으로 통합하여 사실 정확성을 향상시켰다.
  • 훈련 중에 사용된 특정 지표 외의 지표로도 사실 일치성 향상의 전이가 가능함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.