Skip to main content
QUICK REVIEW

[논문 리뷰] RetGen: A Joint framework for Retrieval and Grounded Text Generation Modeling

Yizhe Zhang, Siqi Sun|arXiv (Cornell University)|2021. 05. 14.
Topic Modeling인용 수 6
한 줄 요약

RetGen는 언어 모델 신호를 사용하여 문서 검색기와 근거 기반 텍스트 생성기를 종합적으로 훈련하는 프레임워크를 제안한다. 이는 고비용의 병렬 훈련 데이터가 필요 없도록 하며, 상호 정보 최대화를 통한 검색 및 생성의 상호 보완적 최적화로 사실 일致성과 관련성 향상을 이룬다. 대화 및 텍스트 완성 작업에서 인간 평가에서 인간 수준의 성능을 달성한다.

ABSTRACT

Recent advances in large-scale pre-training such as GPT-3 allow seemingly high quality text to be generated from a given prompt. However, such generation systems often suffer from problems of hallucinated facts, and are not inherently designed to incorporate useful external information. Grounded generation models appear to offer remedies, but their training typically relies on rarely-available parallel data where information-relevant documents are provided for context. We propose a framework that alleviates this data constraint by jointly training a grounded generator and document retriever on the language model signal. The model learns to reward retrieval of the documents with the highest utility in generation, and attentively combines them using a Mixture-of-Experts (MoE) ensemble to generate follow-on text. We demonstrate that both generator and retriever can take advantage of this joint training and work synergistically to produce more informative and relevant text in both prose and dialogue generation.

연구 동기 및 목표

  • 대규모 언어 모델에서 발생하는 환각적 사실 문제를 외부 문서에 근거한 생성을 통해 해결하기 위해.
  • 희소한 병렬 데이터(예: 문서-응답 쌍)에 대한 의존도를 줄이기 위해.
  • 언어 모델 신호를 사용하여 검색기와 생성기를 종합적으로 최적화하여 텍스트 생성의 사실 정확성과 관련성을 향상시키기 위해.
  • 서로 상호 보완적으로 향상시키는 검색 및 생성 구성 요소를 종합적으로 훈련할 수 있도록 하기 위해.
  • 대화 및 텍스트 완성 작업에서 프레임워크를 평가하여 일관성, 정보성 및 인간 수준의 품질 향상을 입증하기 위해.

제안 방법

  • 병렬 데이터 오라클에 의존하지 않고 언어 모델 신호를 사용하여 밀도 있는 파assage 검색기와 다중 문서 기반 생성기를 종합적으로 훈련한다.
  • 디코딩 중에 복수의 검색된 문서에서 정보를 접근하고 통합하기 위해 전문가의 혼합(MoE) 기법을 사용한다.
  • 생성 품질 향상에 기여하는 문서를 검색하도록 언어 모델의 생성 신호를 사용해 검색기를 최적화한다.
  • 검색된 문서와 생성된 텍스트 간의 정렬을 향상시키기 위해 상호 정보 최대화(MMI)를 적용한다.
  • 생성기를 고정하고 검색기만 별도로 미세 조정하여 Recall@10 및 기대 보상 지표를 사용해 검색 성능을 평가한다.
  • 자동 평가 지표(예: BLEU, ROUGE)와 인간 평가를 사용해 생성 품질 및 검색 효과성을 평가한다.

실험 결과

연구 질문

  • RQ1병렬 훈련 데이터가 필요 없이도 종합 훈련 프레임워크가 검색 및 생성 품질을 향상시킬 수 있는가?
  • RQ2언어 모델 신호를 사용해 검색을 최적화하면 생성 텍스트의 사실 일치성이 어떻게 향상되는가?
  • RQ3단일 문서 또는 비주의적 접근 기반 방법에 비해, 복수의 검색된 문서를 MoE 기반 융합으로 처리할 경우 생성 품질 향상 정도는 어느 정도인가?
  • RQ4종합 훈련이 생성기와 검색기를 별도로 훈련하는 것보다 성능을 더 좋게 만드는가?
  • RQ5모델은 대화 및 개방형 텍스트 완성 작업에서 인간 수준의 품질을 달성할 수 있는가?

주요 결과

  • MMI를 적용한 RetGen는 인간 평가에서 일관성 측면에서 40.5%의 선호도를 기록했으며, 일반 RetGen(33.1%) 및 기타 기준 모델들을 초월했다.
  • Reddit 데이터셋에서 인간 평가 결과, RetGen는 일관성 측면에서 33.7%의 경우 인간 응답보다 선호되었고, 정보성 측면에서 38.9%, 인간-텍스트 유사성 측면에서 27.5%의 경우 선호되었다.
  • arXiv 데이터셋에서, 검색기 전용 훈련 중 기대 보상 지표가 향상되어 언어 모델 신호를 활용해 검색기가 더 관련성이 높은 문서를 검색하는 데에 학습한 것으로 나타났다.
  • 배치당 훈련 예제 수가 많아질수록 검색 성능이 향상되었지만, 검색 문서 수(K)를 4에서 8로 늘여도 Recall@10에서의 성능 향상은 미미했다.
  • 종합 훈련 프레임워크는 생성기 전용 훈련 대비 더 나은 자동 평가 지표(예: BLEU, ROUGE)를 기록하여 종합 최적화의 유용성을 입증했다.
  • Reddit에서 Recall@10로 측정한 검색기 성능은 훈련 과정에서 꾸준히 향상되었으며, 언어 모델 신호가 검색을 효과적으로 이끄는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.