Skip to main content
QUICK REVIEW

[논문 리뷰] RARR: Researching and Revising What Language Models Say, Using Language Models

Luyu Gao, Zhuyun Dai|arXiv (Cornell University)|2022. 10. 17.
Topic Modeling인용 수 13
한 줄 요약

RARR는 원본 스타일과 구조를 유지하면서 사실적 인용을 향상시키기 위해 외부 증거를 자동으로 조사하고 텍스트를 수정하는 모델에 종속되지 않는 프레임워크입니다. 소수의 예시 프롬프팅과 대규모 언어 모델, 웹 검색을 활용하여 최소한의 미세조정으로 높은 정밀도의 수정을 달성하며, 다양한 생성 작업에서 사실적 인용 정확도를 크게 향상시킵니다.

ABSTRACT

Language models (LMs) now excel at many tasks such as few-shot learning, question answering, reasoning, and dialog. However, they sometimes generate unsupported or misleading content. A user cannot easily determine whether their outputs are trustworthy or not, because most LMs do not have any built-in mechanism for attribution to external evidence. To enable attribution while still preserving all the powerful advantages of recent generation models, we propose RARR (Retrofit Attribution using Research and Revision), a system that 1) automatically finds attribution for the output of any text generation model and 2) post-edits the output to fix unsupported content while preserving the original output as much as possible. When applied to the output of several state-of-the-art LMs on a diverse set of generation tasks, we find that RARR significantly improves attribution while otherwise preserving the original input to a much greater degree than previously explored edit models. Furthermore, the implementation of RARR requires only a handful of training examples, a large language model, and standard web search.

연구 동기 및 목표

  • 언어 모델 출력에서 근거 없거나 환각된 내용을 해결하기 위해 자동 인용을 가능하게 하기 위해.
  • 수집된 증거와 일치하도록 생성된 텍스트를 수정하면서도 원본 스타일, 구조, 의도를 유지하는 방법을 개발하기 위해.
  • 아ーイ텍처 변경 없이도 어떤 사전 훈련된 언어 모델과도 작동하는 모델에 종속되지 않는 시스템을 만들기 위해.
  • 수정 모델의 성능을 사실적 인용 품질과 원본 텍스트 속성 유지 정도 측면에서 평가하기 위해.
  • 소수의 예시 프롬프팅을 사용한 대규모 언어 모델이 다양한 생성 작업에 걸쳐 강력한 일반화 능력을 보일 수 있음을 입증하기 위해.

제안 방법

  • RARR는 두 단계로 구성됩니다: 연구(질문 생성 및 증거 수집)와 수정(불일치 탐지 및 텍스트 편집).
  • 질문 생성기(질문 생성기)는 입력 텍스트의 다양한 측면에 대해 질문을 생성하여 타겟된 웹 검색을 유도합니다.
  • 수집기(수집기)는 표준 웹 검색을 사용하여 각 질문에 관련된 증거 조각을 수집합니다.
  • 일치 모델(일치 모델)은 원본 텍스트와 수집된 증거 사이의 모순 여부를 확인합니다.
  • 편집 모델(편집 모델)은 불일치가 감지될 경우에만 소수의 예시 프롬프팅을 사용한 대규모 언어 모델을 활용해 대상별 수정을 수행합니다.
  • 증거 조각은 선택되고 종합되어 추적 가능하고 투명한 인용 보고서로 구성됩니다.

실험 결과

연구 질문

  • RQ1기존 모델을 수정하지 않고 후행 수정 시스템이 언어 모델 출력의 사실적 인용을 향상시킬 수 있는가?
  • RQ2LLM을 사용한 소수의 예시 프롬프팅이 지식 기반, 추론, 대화와 같은 다양한 생성 작업에 얼마나 잘 일반화되는가?
  • RQ3RARR가 근거 없는 주장을 수정하면서도 원본 텍스트의 스타일과 구조를 얼마나 잘 유지하는가?
  • RQ4RARR는 기존의 편집 모델과 비교해 사실적 인용 정확도와 원본 콘텐츠 유지 정밀도 측면에서 어떻게 다른가?
  • RQ5표준 웹 검색과 LLM을 기반으로 한 증거 보강 수정 시스템이 최소한의 감독으로 미세조정된 모델을 능가할 수 있는가?

주요 결과

  • RARR는 지식 집약적인 질문, 추론 체인, 대화 응답과 같은 다양한 작업에서 사실적 인용 성능을 크게 향상시킵니다.
  • 보존 성능 지표로 측정했을 때, 기존의 편집 모델보다 RARR가 원본 텍스트의 스타일과 구조를 더 효과적으로 유지합니다.
  • RARR는 소수의 학습 예시만으로도 효과적인 소수의 예시 일반화를 보여주며 뛰어난 성능을 달성합니다.
  • RARR는 사실적 인용 품질과 원본 콘텐츠 유지 정도 측면에서 기존의 수정 모델을 모두 능가합니다.
  • 후처리 단계의 증거 수집 및 수정을 통해 모델에 종속되지 않는 인용이 가능해져, 기존의 어떤 언어 모델에도 적용 가능합니다.
  • 평가 결과, RARR의 인용 보고서가 수집된 증거와 매우 관련성이 높고 일관되며, 모델 출력에 대한 신뢰도를 향상시킵니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.