Skip to main content
QUICK REVIEW

[논문 리뷰] GrIPS: Gradient-free, Edit-based Instruction Search for Prompting Large Language Models

Archiki Prasad, Peter Hase|arXiv (Cornell University)|2022. 03. 14.
Topic Modeling인용 수 5
한 줄 요약

GrIPS는 모델 기울기를 필요로 하지 않는 기울기 자유형, 편집 기반 검색 방법으로, 대규모 언어 모델의 지시 프롬프트를 자동으로 향상시키는 데 사용된다. 이 방법은 인간이 읽을 수 있는 편집을 반복적으로 적용하여 프롬프트를 수정하며, 분류 작업에서 최대 9.36%의 정확도 향상을 달성한다. 이는 수동 재작성 및 예시 기반 프롬프트보다도 뛰어나며, 데이터가 적거나 API로 접근 가능한 모델에서도 성능을 발휘한다.

ABSTRACT

Providing natural language instructions in prompts is a useful new paradigm for improving task performance of large language models in a zero-shot setting. Recent work has aimed to improve such prompts via manual rewriting or gradient-based tuning. However, manual rewriting is time-consuming and requires subjective interpretation, while gradient-based tuning can be extremely computationally demanding for large models and may not be feasible for API-based models. In this work, we introduce Gradient-free Instructional Prompt Search (GrIPS), a gradient-free, edit-based search approach for improving task instructions for large language models. GrIPS takes in instructions designed for humans and automatically returns an improved, edited prompt, while allowing for API-based tuning. With InstructGPT models, GrIPS improves the average task performance by up to 4.30 percentage points on eight classification tasks from the Natural Instructions dataset (with similar improvements for OPT, BLOOM, and FLAN-T5). We see improvements for both instruction-only prompts and instruction + k-shot examples prompts. Notably, GrIPS outperforms manual rewriting and purely example-based prompts while controlling for the available compute and data budget. Further, performance of GrIPS is comparable to select gradient-based tuning approaches. Qualitatively, we show our edits can simplify instructions and at times make them incoherent but nonetheless improve accuracy. Our code is available at: https://github.com/archiki/GrIPS

연구 동기 및 목표

  • 기울기 기반 프롬프트 튜닝의 한계를 해결하기 위해, 계산 비용이 높고 API 기반 모델에선 적용이 불가능한 문제를 해결한다.
  • 제로샷 프롬프팅을 위한 수동 지시어 재작성의 높은 비용과 주관성을 해결한다.
  • 모델 기울기나 가중치에 접근할 필요 없이, 자동화된 인간이 읽을 수 있는 편집을 통해 지시 품질을 향상시키는 방법을 개발한다.
  • GPT-3, OPT, BLOOM, FLAN-T5를 포함한 다양한 LLM에서 지시어 전용 및 지시어+예시 프롬프트 모두에 대해 효과적인 프롬프트 최적화를 가능하게 한다.
  • 의미적으로 타당하지 않거나 단순화된 지시어가 여전히 모델 성능을 향상시킬 수 있는지 평가하여, 효과적인 프롬프팅을 위해 일관성이 필수적이라는 가정에 도전한다.

제안 방법

  • GrIPS는 문법적 어구 수준의 수정을 탐색하는 검색 알고리즘을 사용해 자연어 지시어를 반복적으로 국소적으로 편집한다.
  • 모델 출력 기반의 점수 함수를 활용해 후보 지시어를 평가하며, 피드백으로 오직 모델의 예측 정확도만을 사용한다.
  • 기울기를 전혀 사용하지 않으며, 오직 모델 출력을 통해 검색을 이끌어내어 API 기반 모델과도 호환된다.
  • 편집은 어구 수준의 조작(예: 어구 재정렬, 교체, 제거)에 국한되어 인간의 이해 가능성과 언어적 일관성을 유지한다.
  • 검색 과정은 비트 서치 또는 유사 전략을 사용해 유망한 편집을 탐색하며, 더 이상 향상되지 않거나 내성적 기다림 시간이 끝날 때까지 진행된다.
  • 지시어 전용 및 지시어+K-샷 예시 프롬프트를 모두 지원하여 영리한 프롬프트 엔지니어링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1기울기가 필요 없는 편집 기반 검색 방법이 모델 기울기 접근 없이도 대규모 언어 모델의 지시 품질을 향상시킬 수 있는가?
  • RQ2기울기 기반이 아닌 인간이 읽을 수 있는 편집을 통한 자동 프롬프트 개선이 수동 지시어 재작성 및 예시 기반 프롬프트 튜닝을 능가하는가?
  • RQ3의미적으로 타당하지 않거나 단순화된 지시어조차도 인간에게 혼란스럽더라도 여전히 모델 성능을 향상시킬 수 있는가?
  • RQ4작업에 종속적이지 않은 지시어 대비 작업에 종속적인 지시어로 초기화했을 때 GrIPS의 성능은 어떠한가?
  • RQ5최소한의 데이터(예: 20개 예시)와 제한된 계산 예산으로 GrIPS가 경쟁 가능한 성능을 달성할 수 있는가?

주요 결과

  • InstructGPT를 사용할 때, Natural-Instructions 데이터셋의 8개 분류 작업에서 GrIPS가 평균적으로 최대 9.36%포인트의 정확도 향상을 달성한다.
  • InstructGPT curie 모델에서 GrIPS는 동일한 계산 및 데이터 예산 하에 평균적으로 수동 재작성보다 1.5%포인트 높은 성능을 보인다.
  • 동일한 데이터와 계산 자원을 사용할 때, GrIPS는 인라인 예시 탐색보다 약 1.6포인트 높은 성능을 기록한다.
  • 검색된 지시어의 68.5%는 원본보다 짧으며, 87.5%는 작업 관련 레이블 정보를 포함하고 있어 효율적인 압축과 집중을 보여준다.
  • 기울기가 제공되는 경우, GrIPS는 선택된 기울기 기반 튜닝 방법과 유사한 성능을 달성하여 강건성과 효율성을 입증한다.
  • 68.5%의 작업에서 GrIPS는 원본보다 짧은 지시어를 반환하여 성능 손실 없이 효과적인 단순화를 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.