Skip to main content
QUICK REVIEW

[논문 리뷰] "According to ...": Prompting Language Models Improves Quoting from Pre-Training Data

Orion Weller, Marc Marone|arXiv (Cornell University)|2023. 05. 22.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 'According-to 프롬프팅'을 소개한다—대규모 언어 모델의 사실 기반 성능을 향상시키기 위해 사전 훈련 데이터(예: 위키백과)에서 직접 인용하도록 유도하는 방법이다. 새로운 평가 지표인 QUIP-Score를 사용하여, 이러한 프롬프팅이 정확한 인용 일치도를 5–105% 향상시키며, 특히 모델 크기가 증가할수록 유사한 또는 향상된 최종 작업 성능 유지함을 입증한다.

ABSTRACT

Large Language Models (LLMs) may hallucinate and generate fake information, despite pre-training on factual data. Inspired by the journalistic device of "according to sources", we propose according-to prompting: directing LLMs to ground responses against previously observed text. To quantify this grounding, we propose a novel evaluation metric (QUIP-Score) that measures the extent to which model-produced answers are directly found in underlying text corpora. We illustrate with experiments on three corpora (Wikipedia, PubMed, and the U.S. legal tax code) that these prompts improve grounding under our metrics, with the additional benefit of often improving end-task performance. Furthermore, prompts that ask the model to decrease grounding (or to ground to other corpora) indeed decrease QUIP-Score, indicating the ability of LLMs to increase or decrease grounded generations on request.

연구 동기 및 목표

  • 대규모 언어 모델(LMM)의 사전 훈련 데이터 기반 사실 기반 성능에도 불구하고 지속적인 환각 문제를 해결하기 위해.
  • 자연어 프롬프팅이 LLM이 기억한 사전 훈련 코퍼스에서 더 많은 인용을 하도록 이끌 수 있는지 조사하기 위해.
  • 모델 출력이 사전 훈련 데이터에 얼마나 기반을 두었는지 측정하기 위한 빠르고 효율적이며 프라이버시를 보존하는 방법을 개발하기 위해.
  • 지시어에 따라 프롬프팅이 기반성 향상 또는 감소를 유도할 수 있는지 평가하기 위해.
  • 모델 크기와 데이터셋에 따라 기반성 향상의 확장성 평가하기 위해.

제안 방법

  • LLM이 '위키백과에 따르면'과 같은 표현을 사용하도록 유도하여 사전 훈련 데이터에서 인용하도록 하는 'According-to 프롬프팅'을 제안한다.
  • 생성된 텍스트가 사전 훈련 코퍼스의 스트링과 정확히 일치하는 비율을 측정하는 n-그램 일치 기반의 새로운 지표인 QUIP-Score를 도입한다.
  • 위키백과와 같은 대규모 코퍼스에서 효율적인 QUIP-Score 계산을 위해 Data Portraits를 활용하여 밀리초 이내의 소속성 테스트를 가능하게 한다.
  • 오픈 도메인 질의 응답(ODQA)에서 LLM이 위키백과 기반성으로 향하도록 유도하거나 방향을 바꾸는 데 사용할 수 있는 인간이 작성한 프롬프트를 수집하고 평가한다.
  • 여러 모델(오픈소스 및 클로즈드소스), 데이터셋, 모델 크기를 대상으로 기반성과 성능 간의 상호 영향을 평가하기 위해 실험을 수행한다.
  • 엔티티 인기도, 공현 빈도, 지시어 튜닝 등과 같은 요소들과 QUIP-Score 간의 상관관계를 분석한다.

실험 결과

연구 질문

  • RQ1LLM에 '위키백과에 따르면'과 같은 표현을 사용하도록 프롬프팅하면, 그 출력이 사전 훈련 데이터에 얼마나 더 기반을 두게지는지가 유의미하게 증가하는가?
  • RQ2프롬프팅을 통한 기반성 향상이 사실 일관성 및 최종 작업 성능 향상에 측정 가능한 영향을 미치는가?
  • RQ3프롬프팅을 통해 특정 코퍼스(예: 위키백과)에서의 기반성을 감소시킬 수 있으며, 이는 성능에 영향을 미치는가?
  • RQ4모델 크기가 According-to 프롬프팅의 기반성 향상 효과에 미치는 영향은 어떠한가?
  • RQ5QUIP-Score는 LLM 생성물의 기반성 측정에 신뢰성 있고 확장 가능한 지표인가?

주요 결과

  • According-to 프롬프팅은 여러 데이터셋과 모델에서 생성물과 위키백과 간의 일치도를 5–105% 향상시켰다.
  • 이 기반성 향상 효과는 GPT-3.5와 GPT-J를 포함한 오픈소스 및 클로즈드소스 모델 모두에서 일관되게 나타났다.
  • 기반성 감소 프롬프팅(위키백과 기반성 방지 또는 다른 자료원으로 유도)은 QUIP-Score를 유의미하게 감소시키며, 위키백과에 의존하는 작업의 성능을 떨어뜨렸다.
  • 모델 크가 증가할수록 QUIP-Score가 증가하여, 더 큰 모델일수록 프롬프팅에 의해 기반성이 더 잘 향상됨을 시사한다.
  • QUIP-Score는 질문 내 엔티티의 인기도와 공현 빈도와 정적 상관관계를 보이며, 일반적으로 언급되는 사실에 대해 더 좋은 복구 성능을 보임을 시사한다.
  • 이 방법은 도메인에 종속되지 않으며, Data Portrait가 구축된 모든 코퍼스에 적용 가능하여, 클로즈드소스 모델의 기반성 평가를 프라이버시를 보존하면서 수행할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.