Skip to main content
QUICK REVIEW

[논문 리뷰] On Hallucination and Predictive Uncertainty in Conditional Language Generation

Yijun Xiao, William Yang Wang|arXiv (Cornell University)|2021. 03. 28.
Multimodal Machine Learning Applications참고 문헌 34인용 수 16
한 줄 요약

이 논문은 조건부 자연어 생성(NLG) 작업에서 환각과 예측 불확실성 간의 관계를 조사하며, 복원 과정에서 지식 불확실성(epistemic uncertainty)을 페널티 처리하는 불확실성 인식 비트 서치(UABS)를 제안하여 환각을 감소시킨다. 결과적으로 지식 불확실성이 높을수록 환각이 더 빈번하게 발생하며, UABS는 표준 비트 서치 대비 생성 품질과 사실 일관성 사이의 균형을 더 잘 달성한다.

ABSTRACT

Despite improvements in performances on different natural language generation tasks, deep neural models are prone to hallucinating facts that are incorrect or nonexistent. Different hypotheses are proposed and examined separately for different tasks, but no systematic explanations are available across these tasks. In this study, we draw connections between hallucinations and predictive uncertainty in conditional language generation. We investigate their relationship in both image captioning and data-to-text generation and propose a simple extension to beam search to reduce hallucination. Our analysis shows that higher predictive uncertainty corresponds to a higher chance of hallucination. Epistemic uncertainty is more indicative of hallucination than aleatoric or total uncertainties. It helps to achieve better results of trading performance in standard metric for less hallucination with the proposed beam search variant.

연구 동기 및 목표

  • 이미지 캡션 생성 및 데이터에서 텍스트 생성과 같은 조건부 자연어 생성(NLG) 작업 전반에서 환각과 예측 불확실성 간의 관계를 조사하는 것.
  • 불확실성 정량화가 다양한 NLG 작업 전반에서 환각을 통합적으로 설명할 수 있는지 여부를 규명하는 것.
  • 비트 서치에 불확실성 추정치를 통합하여 환각을 감소시키는 복원 방법을 개발하는 것.
  • 불확실성 분해(지식 불확실성 대비 임의 불확실성)가 성능-환각 균형을 향상시키는지 평가하는 것.

제안 방법

  • 저자는 예측 불확실성을 베이지안 신경망을 통해 토큰 확률 분포의 엔트로피로 모델링하고, 이를 지식 불확실성과 임의 불확실성 성분으로 분해한다.
  • 저자는 예측 불확실성 기반의 페널티 항을 추가하여 스코어 함수를 수정한 불확실성 인식 비트 서치(UABS)를 제안한다.
  • 페널티 항은 총 불확실성, 지식 불확실성, 또는 임의 불확실성에 적용되며, 목표는 낮은 불확실성, 더 신뢰할 수 있는 생성 결과를 선호하는 데 있다.
  • UABS는 표준 지표와 작업별 히우리스틱을 활용한 환각 탐지 방법을 사용하여 이미지 캡션 생성 및 데이터에서 텍스트 생성 벤치마크에서 평가된다.
  • 지식 불확실성은 몬테카를로 드롭아웃을 통해 추정되며, 임의 불확실성은 다중 순방향 전파 동안 예측의 분산으로 유도된다.
  • 생성 품질(예: BLEU, ROUGE)과 다양한 불확실성 페널티 하에서의 환각 비율을 비교하여 방법의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1다양한 조건부 NLG 작업 간에 예측 불확실성과 환각 간에 일관된 관계가 존재하는가?
  • RQ2환각을 가장 잘 예측하는 불확실성 유형은 지식 불확실성, 임의 불확실성, 총 불확실성 중 어느 것인가?
  • RQ3비트 서치 복원 과정에 불확실성을 통합함으로써 환각을 효과적으로 감소시킬 수 있는가, 이는 생성 품질을 심각하게 떨어뜨리지 않는가?
  • RQ4불확실성 분해가 NLG에서 성능과 사실 일관성 간의 균형을 향상시키는 데 기여하는가?

주요 결과

  • 특히 지식 불확실성이 높을수록 생성 텍스트에서 환각 발생 확률이 크게 증가하는 것으로 나타났다.
  • 복원 과정에서 지식 불확실성을 페널티 처리하면, 임의 불확실성 또는 총 불확실성에 비해 환각 비율이 유의미하게 낮아진다.
  • 제안된 불확실성 인식 비트 서치(UABS)는 표준 비트 서치 대비 표준 생성 지표와 환각 감소 사이의 균형을 더 잘 달성한다.
  • UABS는 특히 지식 불확실성을 페널티 처리할 경우 더 짧지만 더 자신감 있고 사실 일관성이 높은 출력을 생성한다.
  • 결과적으로 지식 불확실성은 임의 불확실성보다 환각을 더 신뢰할 수 있는 지표로 나타나며, 이는 입력 맥락에 대한 모델의 불확실성을 반영하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.