[논문 리뷰] MoFE: Mixture of Factual Experts for Controlling Hallucinations in Abstractive Summarization.
MoFE는 사실 전문가의 혼합물로, 실체성 일致성 지표인 실체 간접적 중첩과 의존성 화살표 함의 지표를 사용하여 사실 일치성을 최소화하는 강화학습을 통해 개별 전문가를 훈련시어 요약 요약에서 환각을 줄인다. 이는 XSUM 및 CNN/DM에서 사실 일치성을 향상시키며 ROUGE 점수를 떨어뜨리지 않으며, 질문-답변 사실성 및 BERTScore 정밀도와 같은 새로운 평가 지표로 일반화된다.
Neural abstractive summarization models are susceptible to generating factually inconsistent content, a phenomenon known as hallucination. This limits the usability and adoption of these systems in real-world applications. To reduce the presence of hallucination, we propose the Mixture of Factual Experts (MoFE) model, which combines multiple summarization experts that each target a specific type of error. We train our experts using reinforcement learning (RL) to minimize the error defined by two factual consistency metrics: entity overlap and dependency arc entailment. We construct MoFE by combining the experts using two ensembling strategies (weights and logits) and evaluate them on two summarization datasets (XSUM and CNN/DM). Our experiments on BART models show that the MoFE improves performance according to both entity overlap and dependency arc entailment, without a significant performance drop on standard ROUGE metrics. The performance improvement also transfers to unseen factual consistency metrics, such as question answer-based factuality evaluation metric and BERTScore precision with respect to the source document.
연구 동기 및 목표
- 신경 요약 요약 모델에서 사실 일치성, 즉 환각 문제를 해결하기 위해.
- 요약에서 발생하는 다양한 오류 유형을 타깃으로 삼는 전문화된 전문가를 훈련시켜 환각을 줄이기 위해.
- 실체 간접적 중첩과 의존성 화살표 함의 지표라는 두 가지 사실 일치성 지표를 사용한 강화학습을 통해 사실 일치성을 향상시키기 위해.
- 사용된 지표 외의 새로운 평가 지표로 성능 향상이 전이되는지 평가하기 위해.
- 요약 출력의 사실 정확성을 향상시키는 동안 강력한 ROUGE 성능을 유지하기 위해.
제안 방법
- 각각 다른 유형의 사실 오류에 집중하는 다수의 전문화된 요약 전문가를 훈련시킨다.
- 실체 간접적 중첩과 의존성 화살표 함의 지표를 기반으로 한 보상 신호를 최소화하기 위해 각 전문가를 강화학습으로 최적화한다.
- 가중 평균과 로짓 수준 융합이라는 두 가지 앙상블 전략을 사용하여 전문가를 통합한다.
- BART 기반 아키텍처를 사용하여 XSUM 및 CNN/DM이라는 두 가지 벤치마크 데이터셋에서 MoFE 모델을 평가한다.
- 생성 품질을 평가하고 표준 자동 평가에서 성능 저하가 없는지 확인하기 위해 ROUGE 지표를 사용한다.
- 실제로 사용되지 않은 지표, 예를 들어 질문-답변 사실성 평가 및 소스 문서 기반 BERTScore 정밀도에 대한 사실 일치성 향상의 전이 가능성 테스트를 수행한다.
실험 결과
연구 질문
- RQ1특정 사실 오류 유형에 집중하여 전문가를 훈련시키는 것이 요약 요약에서 환각을 줄일 수 있는가?
- RQ2가중치 및 로짓 수준 융합 전략을 통해 전문가를 통합하는 것이 ROUGE 점수를 떨어뜨리지 않고 사실 일치성을 향상시키는가?
- RQ3실체 간접적 중첩과 의존성 화살표 함의 지표에서의 향상이 다른 사실 일치성 지표로 얼마나 일반화되는가?
- RQ4MoFE 프레임워크는 환각을 크게 줄이면서도 강력한 생성 품질을 유지할 수 있는가?
- RQ5모델의 사실 일치성 향상은 BERTScore 정밀도 및 질문-답변 사실성과 같은 새로운 평가 지표로 전이되는가?
주요 결과
- MoFE는 XSUM 및 CNN/DM에서 실체 간접적 중첩과 의존성 화살표 함의 지표 점수의 향상으로 인해 사실 일치성을 향상시켰다.
- 표준 ROUGE 지표에서 강력한 성능을 유지하여 생성 품질에 대한 성능 저하가 없음을 나타냈다.
- 실제로 사용되지 않은 지표, 예를 들어 질문-답변 사실성 평가 및 소스 문서 기반 BERTScore 정밀도에 대해 사실 일치성 향상이 일반화됨을 보였다.
- 사실 일치성 지표를 기반으로 한 강화학습이 다양한 평가 환경에서 환각을 효과적으로 줄였다.
- 가중치 및 로짓 수준 융합 전략을 통해 전문가 출력을 성공적으로 통합하여 사실 정확성을 향상시켰다.
- 훈련 중에 사용된 특정 지표 외의 지표로도 사실 일치성 향상의 전이가 가능함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.