Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning Reduces Hallucination in Conversations

Weiwei Sun, Zhengliang Shi|arXiv (Cornell University)|2022. 12. 20.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 대규모 언어모델(LM) 기반 대화 시스템에서 환상적 발언을 줄이기 위해 검색된 지식과 모델이 생성한 지식에서 하드 음성 샘플링을 활용한 혼합 대비 학습을 적용한 MixCL이라는 대비 학습 프레임워크를 제안한다. MixCL은 응답의 사실성과 관련성을 향상시키며, 외부 지식 기반(KB) 방법과 유사한 성능을 달성하면서도 추론 시 검색이 필요 없고 5배 빠르며 더 스케일러블하다.

ABSTRACT

Pre-trained language models (LMs) store knowledge in their parameters and can generate informative responses when used in conversational systems. However, LMs suffer from the problem of "hallucination:" they may generate plausible-looking statements that are irrelevant or factually incorrect. To address this problem, we propose a contrastive learning scheme, named MixCL. A novel mixed contrastive objective is proposed to explicitly optimize the implicit knowledge elicitation process of LMs, and thus reduce their hallucination in conversations. We also examine negative sampling strategies of retrieved hard negatives and model-generated negatives. We conduct experiments on Wizard-of-Wikipedia, a public, open-domain knowledge-grounded dialogue benchmark, and assess the effectiveness of MixCL. MixCL effectively reduces the hallucination of LMs in conversations and achieves the highest performance among LM-based dialogue agents in terms of relevancy and factuality. We show that MixCL achieves comparable performance to state-of-the-art KB-based approaches while enjoying notable advantages in terms of efficiency and scalability.

연구 동기 및 목표

  • 대규모 언어모델(LM) 기반 대화 시스템에서 모델이 사실적으로 들리지만 사실과 어긋나 있거나 관련 없는 응답을 생성하는 환상적 발언 문제를 해결하기 위해.
  • 개방형 도메인, 지식 기반 대화에서 내재적 환상(예: 잘못된 사실)과 외재적 환상(예: 주제에서 벗어난 응답)을 줄이기 위해.
  • 추론 시 외부 지식 기반 시스템이나 검색을 의존하지 않고도 LM이 생성한 응답의 신뢰성과 관련성을 향상시키기 위해.
  • LM의 파라미터에서 암묵적 지식을 효과적으로 이끌어내는 데에 특별히 최적화된 대비 학습 프레임워크를 개발하기 위해.
  • KB 기반 방법과 유사한 성능을 달성하면서도 추론 효율성과 확장성을 크게 향상시키기 위해.

제안 방법

  • 믹스업 데이터 증강에 영감을 얻은 새로운 혼합 대비 학습 목표를 제안하여, 훈련 중에 양성 및 음성 지식 스펙트럼을 결합한다.
  • 두 가지 유형의 음성 샘플링을 도입한다: (1) 밀도 기반 검색을 통해 코퍼스에서 추출한 하드 음성 샘플, (2) 자기부트래핑을 통해 모델이 생성한 음성 샘플로, 유사하게 혼동될 수 있는 지식을 시뮬레이션한다.
  • 엔티티 기반 및 구성 구조 기반 믹스업 전략을 활용해 스펙트럼 수준에서 다양한, 도전적인 음성 예제를 생성한다.
  • 혼합 대비 손실, LM 사전학습 손실(MLE), 음성 샘플링 목표를 조합한 다목적 손실을 사용해 모델을 종합적으로 최적화한다.
  • 이중 브랜치 아키텍처를 활용해 모델이 생성한 응답을 참값과 하드 음성 지식 표현과 대비시킨다.
  • 훈련 과정에서 지식을 내재화함으로써 추론 시 검색이 필요 없도록 하여 효율적인 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1암묵적으로 잘못된 지식와 유사한 지식를 대비함으로써 대비 학습이 LM 기반 대화 시스템에서 환상적 발언을 줄일 수 있는가?
  • RQ2검색에서 유도한 하드 음성 샘플링과 모델이 생성한 음성 샘플링이 모두 모델이 정확한 지식과 유사한 지식을 구분하는 능력을 향상시키는 데 얼마나 효과적인가?
  • RQ3표준 대비 학습 또는 MLE 학습 대비 스펙트럼 수준에서의 혼합 대비 학습이 응답의 사실성과 관련성 향상에 기여하는가?
  • RQ4순수한 LM 기반 접근이 지식 기반 대화에서 KB 기반 방법의 성능을 따라잡으면서도 상당히 더 효율적인가?
  • RQ5MixCL은 대화 전용 데이터로 파인튜닝하는 동안 지식의 잊힘 현상을 어느 정도 완화하는가?

주요 결과

  • Wizard-of-Wikipedia 데이터셋에서 전문가가 평가한 응답을 기반으로, MixCL은 기준 BART 모델 대비 내재적 환상 24% 감소, 외재적 환상 27% 감소를 기록했다.
  • KF1 및 F1과 같은 자동 평가 지표에서 이전의 LM 기반 방법 대비 응답의 관련성과 사실성은 각각 5%에서 15% 향상되었다.
  • 응답 품질에서 최신 KB 기반 방법(예: KnowledGPT)과 유사한 성능을 달성했으며, 추론 시간이 5배 빨라졌다.
  • 제거 실험 결과, 혼합 대비 목표와 하드 음성 샘플링이 모두 필수적임을 확인하였으며, 이들을 제거할 경우 성능이 최대 15% 하락했다.
  • 인간 평가 결과, MixCL은 기준 모델 대비 더 매력적이고 사실적이고 인간다운 응답을 생성함을 확인했다.
  • 모델는 뛰어난 확장성 보여줌: 더 큰 모델 크기에서의 성능 향상이 KB 기반 방법보다 뚜렷하게 두드러져 사전학습된 지식를 더 효과적으로 활용함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.