Skip to main content
QUICK REVIEW

[논문 리뷰] Prompting GPT-3 To Be Reliable

Chenglei Si, Zhe Gan|arXiv (Cornell University)|2022. 10. 17.
Topic Modeling인용 수 68
한 줄 요약

본 논문은 네 가지 측면—일반화, 사회적 편향, 보정, 사실성에 걸친 GPT-3의 신뢰성을 분석하고 각 측면을 개선하기 위한 프롬프팅 전략을 개발하여 더 작은 감독 모델들을 능가합니다. 또한 데이터셋, 스크립트, 예측 값을 공개합니다.

ABSTRACT

Large language models (LLMs) show impressive abilities via few-shot prompting. Commercialized APIs such as OpenAI GPT-3 further increase their use in real-world language applications. However, the crucial problem of how to improve the reliability of GPT-3 is still under-explored. While reliability is a broad and vaguely defined term, we decompose reliability into four main facets that correspond to the existing framework of ML safety and are well-recognized to be important: generalizability, social biases, calibration, and factuality. Our core contribution is to establish simple and effective prompts that improve GPT-3's reliability as it: 1) generalizes out-of-distribution, 2) balances demographic distribution and uses natural language instructions to reduce social biases, 3) calibrates output probabilities, and 4) updates the LLM's factual knowledge and reasoning chains. With appropriate prompts, GPT-3 is more reliable than smaller-scale supervised models on all these facets. We release all processed datasets, evaluation scripts, and model predictions. Our systematic empirical study not only sheds new insights on the reliability of prompting LLMs, but more importantly, our prompting strategies can help practitioners more reliably use LLMs like GPT-3.

연구 동기 및 목표

  • ML 안전 개념(일반화, 편향, 보정, 사실성)에 부합하는 다측면 신뢰성 프레임워크를 GPT-3에 정의한다.
  • out-of-distribution 일반화, 사회적 공정성, 확률 보정, 지식 업데이트에 걸쳐 GPT-3의 신뢰성을 향상시키는 간단한 프롬프팅 전략을 개발한다.
  • 신뢰성 측면에서 GPT-3 프롬프팅과 더 작은 감독 모델을 경험적으로 비교한다.
  • 실제 작업에 GPT-3를 배치하는 연구자들을 위한 실용적 가이드와 데이터셋, 스크립트, 예측 결과와 같은 자원을 제공한다.

제안 방법

  • 네 가지 신뢰성 측면에 대한 GPT-3 프롬프팅의 체계적 경험적 평가.
  • 프롬프트 설계에는 일반화를 테스트하기 위한 출처 도메인 시연의 무작위 샘플링이 포함된다.
  • 사회적 편향 분석은 WinoBias와 BBQ 데이터셋을 균형 잡힌 프롬프트와 자연어 개입으로 편향을 줄이는 방법으로 사용된다.
  • 보정 평가에서는 ECE와 Brier 점수 및 선택적 예측을 사용하여 LM 확률 및 자기 일관성을 DPR-BERT 기준과 비교한다.
  • 지식 업데이트 실험은 반사실적 프롬프트가 닫힌 문제 해결(closed-book QA) 및 검색 보강 프롬프팅에서 저장된 지식을 얼마나 업데이트하는지 테스트한다.
  • 다중단계 QA 실험은 인간이 분해한 하위 질문을 활용하여 Chain-of-Thought 및 분해 전략을 통한 추론을 향상시킨다.

실험 결과

연구 질문

  • RQ1GPT-3 프롬프팅이 감독 모델에 비해 out-of-distribution 및 도전적인 테스트 세트에 일반화를 어떻게 영향하는가?
  • RQ2프롬프트 설계가 여러 인구통계학적 차원에서 사회적 편향을 완화하고 공정성을 개선할 수 있는가?
  • RQ3GPT-3의 보정이 실제 정확성을 어느 정도 반영하는가, 그리고 프롬프트 수가 보정에 어떤 영향을 미치는가?
  • RQ4프롬프트에 제공된 새로운 정보(검색 보강 및 분해 접근 포함)에 비추어 GPT-3가 지식을 업데이트하고 추론 체인을 개선할 수 있는가?
  • RQ5프롬프팅 전략이 다중단계 추론 및 사실성 향상에 어떤 효과를 주는가?

주요 결과

  • 출처 도메인에서 무작위로 샘플링된 데모를 사용하는 Few-shot 프롬프팅은 강건한 out-of-distribution 일반화를 제공하며 종종 감독 baselines를 능가한다.
  • 인구통계학적 그룹 간 균형 잡힌 프롬프트와 자연어 개입은 WinoBias와 BBQ에서 편향을 크게 줄이면서도 도메인 내 정확도를 희생하지 않는다.
  • GPT-3은 LM 확률 또는 자기 일관성을 사용할 때 감독 DPR-BERT보다 보정이 더 잘 나타나며, 선택적 예측은 가장 확신 있는 예측에서 높은 정확도를 보인다.
  • 반사실적 프롬프트로 GPT-3가 기억된 지식을 약 85%의 시간에 업데이트할 수 있게 하며, 지식 업데이트에서 미세 조정된 T5 기준선보다 우수하다.
  • 검색 보강 프롬프트(+Contriever 구절)는 NQ, TriviaQA, SQuAD 데이터셋에서 개방 도메인 QA 정확도를 지속적으로 향상시킨다.
  • 사람이 작성한 분해된 하위 질문을 프롬프트에 포함시키면 표준 프롬프팅 및 Chain-of-Thought 기반의 기준선보다 다중단계 QA 성능이 크게 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.