Skip to main content
QUICK REVIEW

[논문 리뷰] Retrieval Augmentation Reduces Hallucination in Conversation

Kurt Shuster, Spencer Poff|arXiv (Cornell University)|2021. 04. 15.
Topic Modeling참고 문헌 50인용 수 5
한 줄 요약

이 논문은 지식 기반 대화에서 대규모 언어 모델의 환각 현상을 줄이기 위해 검색 보강 생성(RAG) 아키텍처를 제안한다. 검색기, 랭커, 반복적 디코딩을 사용하여 신경 검색을 시퀀스-투-시퀀스 모델과 통합함으로써, Wizard of Wikipedia 및 CMU_DoG에서 최신 기술 수준의 성능을 달성하였으며, 인간 평가에서 환각 현상이 60% 이상 감소하였다. 특히 분포 외 주제에서 두드러진 성능 향상을 보였다.

ABSTRACT

Despite showing increasingly human-like conversational abilities, state-of-the-art dialogue models often suffer from factual incorrectness and hallucination of knowledge (Roller et al., 2020). In this work we explore the use of neural-retrieval-in-the-loop architectures - recently shown to be effective in open-domain QA (Lewis et al., 2020b; Izacard and Grave, 2020) - for knowledge-grounded dialogue, a task that is arguably more challenging as it requires querying based on complex multi-turn dialogue context and generating conversationally coherent responses. We study various types of architectures with multiple components - retrievers, rankers, and encoder-decoders - with the goal of maximizing knowledgeability while retaining conversational ability. We demonstrate that our best models obtain state-of-the-art performance on two knowledge-grounded conversational tasks. The models exhibit open-domain conversational capabilities, generalize effectively to scenarios not within the training data, and, as verified by human evaluations, substantially reduce the well-known problem of knowledge hallucination in state-of-the-art chatbots.

연구 동기 및 목표

  • 최신 기술 수준의 대화 모델에서 지속적인 사실 환각 문제를 해결한다. 이는 타당해 보이지만 잘못된 응답을 생성하기 때문이다.
  • 외부 지식 소스에 기반한 검색 기반 메커니즘을 통합하여 지식 기반 대화 시스템의 성능을 향상시킨다.
  • 특히 분포 외 및 미리 보지 않은 주제에서 사실 정확성을 향상시키면서도 높은 대화 유창성을 유지한다.
  • 다양한 검색 보강 아키텍처 및 구성 요소(검색기, 랭커, 인코더-디코더)가 환각 현상을 줄이는 데 미치는 영향을 평가한다.

제안 방법

  • 대화 맥락을 기반으로 대규모 코퍼스(예: 위키백과)에서 관련 문서를 검색하는 신경 검색기 기반의 검색 보강 생성(RAG) 프레임워크를 사용한다.
  • 대화 역사와 후보 문서 간의 세밀하고 맥락 인식 가능한 점수를 부여하기 위해 폴리-에코더 트랜스포머를 사용한다.
  • 다중 라운드의 검색과 생성을 반복함으로써 검색된 문서를 개선하는 반복적 검색 메커니즘을 구현한다.
  • 디코딩 중에 여러 개의 검색된 문서를 동시에 고려할 수 있도록, 퍼지온-인-디코더(FiD) 기법을 사용해 종단 간 검색기를 통합한다.
  • 대화 이력의 각 턴을 일일이 모델링하는 터너 기반 검색 메커니즘을 설계하여, 표준 검색 대비 맥락 유지 능력을 향상시킨다.
  • 대화 이력과 검색된 문서를 조건으로 삼는 시퀀스-투-시퀀스 모델(예: BART)을 사용해 전체 파ip라인을 종단 간으로 훈련한다.

실험 결과

연구 질문

  • RQ1기본 언어 모델 대비 검색 보강 생성이 개방형, 지식 기반 대화 시스템에서 환각 현상을 줄일 수 있는가?
  • RQ2다양한 아키텍처 구성 요소(검색기, 랭커, 디코더 아키텍처)가 사실 일관성과 대화 품질에 미치는 영향은 어떠한가?
  • RQ3훈련 중에 볼 수 없었던 분포 외 주제로의 일반화 능력이 검색 보강에 의해 향상되는가?
  • RQ4실제 정확도, 유창성, 계산 비용을 고려할 때 최적의 검색 문서 수는 얼마인가?
  • RQ5반복적 검색과 터너 기반 문서 검색이 복잡한 다단계 대화 맥락을 다룰 때 표준 검색보다 어떻게 다른가?

주요 결과

  • 제안된 RAG 기반 모델은 인간 평가를 통해 기준 언어 모델 대비 환각 현상이 60% 이상 감소함을 확인하였다.
  • 분포 외 테스트 데이터에서 지식 수준 향상률이 기준 모델 대비 85%에 이를 정도로 뚜렷하게 뛰어난 성능을 보였다.
  • 내부 분포 데이터에서는 지식 F1 점수가 70% 향상되었고, 분포 외 데이터에서는 85% 향상되어 강력한 일반화 능력을 입증하였다.
  • 25개의 검색 문서를 사용할 경우 성능과 계산 비용의 최적의 균형을 이룬다. 더 높은 수의 문서는 일부 아키텍처에서 환각 현상을 증가시킨다.
  • 문서를 개별적으로 처리하는 RAG-Sequence 모델은 문서 수가 증가함에 따라 F1 및 BLEU 점수가 높은 편을 유지하지만, RAG-Token 및 FiD-RAG는 스케일이 증가함에 따라 환각 현상으로 인해 성능 저하를 보였다.
  • 터너 기반 검색 메커니즘은 표준 검색에 비해 맥락 모델링 능력과 환각 현상 감소에 뚜렷한 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.