Skip to main content
QUICK REVIEW

[논문 리뷰] PREFER: Prompt Ensemble Learning via Feedback-Reflect-Refine

Chenrui Zhang, Lin Liu|arXiv (Cornell University)|2023. 08. 23.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 피드백-반영-개선 루프를 통해 자동으로 LLM 프롬프팅을 자동화하고 향상시키는 새로운 프롬프트 앙상블 방법인 Prefer를 제안한다. 이는 양방향 백킹을 통해 자율적인 프롬프트 개선과 안정적인 성능을 가능하게 한다. 최소한의 수동 작업으로 다수의 작업에서 최신 기술 수준의 성능을 달성하며, 기존 방법보다 효율성이 향상된다.

ABSTRACT

As an effective tool for eliciting the power of Large Language Models (LLMs), prompting has recently demonstrated unprecedented abilities across a variety of complex tasks. To further improve the performance, prompt ensemble has attracted substantial interest for tackling the hallucination and instability of LLMs. However, existing methods usually adopt a two-stage paradigm, which requires a pre-prepared set of prompts with substantial manual effort, and is unable to perform directed optimization for different weak learners. In this paper, we propose a simple, universal, and automatic method named PREFER (Pompt Ensemble learning via Feedback-Reflect-Refine) to address the stated limitations. Specifically, given the fact that weak learners are supposed to focus on hard examples during boosting, PREFER builds a feedback mechanism for reflecting on the inadequacies of existing weak learners. Based on this, the LLM is required to automatically synthesize new prompts for iterative refinement. Moreover, to enhance stability of the prompt effect evaluation, we propose a novel prompt bagging method involving forward and backward thinking, which is superior to majority voting and is beneficial for both feedback and weight calculation in boosting. Extensive experiments demonstrate that our PREFER achieves state-of-the-art performance in multiple types of tasks by a significant margin. We have made our code publicly available.

연구 동기 및 목표

  • 기존의 두 단계 프롬프트 앙상블 방법의 한계를 해결하기 위해 사전 정의된 프롬프트에 의존하고 공동 최적화가 부족한 점을 해결한다.
  • LLM의 반영을 통해 자동으로 스스로 적응하는 프롬프트 생성을 가능하게 하여 수동 작업과 도메인 전문 지식을 줄인다.
  • 피드백 기반의 통합 프레임워크에서 부스팅과 백킹을 통합함으로써 안정성과 성능을 향상시킨다.
  • 전진 및 후진 사고를 활용한 이중 백킹 전략을 통해 프롬프트 품질과 내구성을 향상시킨다.
  • 피드백 기반의 반영을 통해 어려운 예제에 집중함으로써 프롬프트의 지향적 최적화를 가능하게 한다.

제안 방법

  • 어려운 예제에서 오류 피드백을 받는 LLM이 반영하여 개선된 프롬프트를 생성하는 피드백-반영-개선 루프를 제안한다.
  • 이전 프롬프트의 단점에 대한 반사적 분석을 기반으로 LLM이 새로운 프롬프트를 자동으로 합성한다.
  • 전진 및 후진 사고를 결합하여 신뢰도 점수를 계산하고 안정성을 향상시키는 이중 백킹 방법을 도입한다.
  • 성능에 따라 프롬프트의 가중치를 동적으로 재조정하는 부스팅 메커니즘을 활용하여 어려운 예제에 집중한다.
  • LLM의 생성 및 반사 능력을 활용하여 프롬프트 품질과 최종 작업 성능을 함께 최적화한다.
  • 다양한 시각에서 추론 경로를 검증함으로써 환영을 방지하는 자기 일관성 있는 피드백 메커니즘을 설계한다.

실험 결과

연구 질문

  • RQ1자동화되고 스스로 반영하는 프롬프트 프레임워크가 LLM 작업에서 수동 또는 사전 정의된 프롬프트 앙상블보다 우월한가?
  • RQ2피드백-반영-개선을 이중 백킹과 통합함으로써 프롬프트 앙상블 학습의 안정성과 성능이 어떻게 향상되는가?
  • RQ3피드백 기반의 프롬프트 개선이 환영을 줄이고 어려운 예제에서의 일반화 능력을 얼마나 향상시키는가?
  • RQ4통합된 부스팅과 백킹 프레임워크가 별도 또는 단일 단계의 앙상블 방법보다 뛰어나게 성능을 냈는가?
  • RQ5기존의 자동화된 프롬프팅 접근 방식과 비교했을 때, 제안된 방법은 효율성과 수렴 속도에서 어떻게 다른가?

주요 결과

  • Prefer는 다양한 NLP 작업에서 최신 기술 수준의 성능을 달성하며, 기존의 프롬프트 앙상블 기준선을 크게 능가한다.
  • 피드백-반영-개선 메커니즘을 제거할 경우 백킹을 제거한 경우보다 성능 저하가 더 크며, 이는 이 메커니즘이 지향적 최적화에서 핵심적인 역할을 한다는 것을 시사한다.
  • 전진 및 후진 사고를 활용한 이중 백킹 방법은 다수결 투표보다 우수하며, 안정성과 신뢰도 추정을 향상시킨다.
  • APO와 비교해 Prefer는 더 빠른 수렴 속도를 보이며, 더 적은 API 호출로 안정적인 성능을 유지함으로써 훈련 효율성이 뛰어나다.
  • 사례 연구를 통해 수동 프롬프트 엔지니어링 의존도를 줄이고 내구성을 향상시켰으며, 더 정보량이 많고 논리적으로 일관된 프롬프트 개선이 이루어짐을 확인했다.
  • 훈련 효율성 벤치마크에서, 특히 비드 서치 및 밴딧 선택 단계에서 APO보다 훨씬 적은 API 호출과 더 짧은 최적화 단계당 시간이 소요되어 효율성이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.