Skip to main content
QUICK REVIEW

[논문 리뷰] Query-Dependent Prompt Evaluation and Optimization with Offline Inverse RL

Hao Sun, Hüyük, Alihan|arXiv (Cornell University)|2023. 09. 13.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 온라인 LLM 추론 없이 LLM의 산술 추론을 위한 최적의 프롬프트를 평가하고 선택하기 위해 오프라인 역강화학습을 사용하는 쿼리에 의존하는 프롬프트 최적화 프레임워크인 Prompt-OIRL을 제안한다. 기준 프롬프트에서 수집된 오프라인 시연 데이터를 활용하여, 쿼리-프롬프트 쌍의 점수를 평가하는 보상 모델을 훈련함으로써, 다양한 LLM과 데이터셋을 대상으로 비용 효율적이고 고정도의 프롬프트 선택 전략(최고의 N개 선택 전략)을 실현한다.

ABSTRACT

In this study, we aim to enhance the arithmetic reasoning ability of Large Language Models (LLMs) through zero-shot prompt optimization. We identify a previously overlooked objective of query dependency in such optimization and elucidate two ensuing challenges that impede the successful and economical design of prompt optimization techniques. One primary issue is the absence of an effective method to evaluate prompts during inference when the golden answer is unavailable. Concurrently, learning via interactions with the LLMs to navigate the expansive natural language prompting space proves to be resource-intensive. To address this, we introduce Prompt-OIRL, which harnesses offline inverse reinforcement learning to draw insights from offline prompting demonstration data. Such data exists as by-products when diverse prompts are benchmarked on open-accessible datasets. With Prompt-OIRL, the query-dependent prompt optimization objective is achieved by first learning an offline reward model. This model can evaluate any query-prompt pairs without accessing LLMs. Subsequently, a best-of-N strategy is deployed to recommend the optimal prompt. Our experimental evaluations across various LLM scales and arithmetic reasoning datasets underscore both the efficacy and economic viability of the proposed approach.

연구 동기 및 목표

  • 정답이 제공되지 않은 상황에서 추론 시점의 프롬프트 효과성 평가 문제를 해결하기 위해.
  • 시험-오류 탐색 과정에서 광범위한 LLM 추론 호출로 인해 발생하는 높은 비용으로 인해 온라인 프롬프트 최적화가 비현실적이 되는 문제를 해결하기 위해.
  • 최적의 프롬프트가 입력 쿼리에 따라 달라지므로, 쿼리에 의존하는 프롬프트 최적화 목표를 도입하기 위해.
  • 기존 오프라인 프롬프팅 데이터셋(벤치마킹 과정에서 부산물로 생성됨)을 체계적으로 활용하여 프롬프트 최적화의 학습 데이터로 활용하기 위해.
  • 다양한 LLM에 걸쳐 산술 추론 작업을 위한 고성능 프롬프트를 식별하는 비용 효율적이고 확장 가능한 방법을 개발하기 위해.

제안 방법

  • 오픈 액세스 산술 추론 데이터셋에서 다양한 프롬프트를 사전 벤치마킹한 결과에서 유래한 오프라인 시연 데이터를 활용하여 전문가 경로를 정의한다.
  • 추론 시 LLM에 접근하지 않고도 쿼리-프롬프트 쌍의 품질을 추정하기 위해 역강화학습을 통해 오프라인 보상 모델을 훈련시킨다.
  • 각 행동이 자연어 프롬프트인 순차적 의사결정 문제로 프롬프트 최적화 문제를 공식화한다.
  • 추론 시점에 최고의 N개 선택 전략을 적용하여 학습된 보상 모델 기반으로 가장 높은 점수를 받는 프롬프트를 선택한다.
  • 산술 추론 작업의 구조를 활용하여 쿼리 컨텍스트와 프롬프트 특징을 포함하는 상태 표현을 정의한다.
  • 동일한 데이터셋에서 다양한 프롬프트 변형을 기반으로 학습하여 보상 모델이 다양한 쿼리에 대해 일반화되도록 하며, 쿼리별 성능 패턴을 포착한다.

실험 결과

연구 질문

  • RQ1온라인 LLM 상호작용 없이 오프라인 역강화학습이 쿼리에 의존하는 프롬프트 평가를 위한 보상 모델을 효과적으로 학습할 수 있는가?
  • RQ2다양한 LLM에서 Prompt-OIRL의 정확도 및 비용 효율성 측면에서 표준 프롬프트 선택 방법과 비교해 성능이 어떻게 되는가?
  • RQ3쿼리에 의존하는 프롬프트 최적화가 쿼리에 독립적인 접근 방식에 비해 산술 추론 정확도를 얼마나 향상시키는가?
  • RQ4기존 오프라인 프롬프팅 데이터셋을 추가 애너테이션 또는 LLM 호출 없이 효과적으로 재사용할 수 있는가?
  • RQ5제안된 방법은 다양한 LLM 크기와 산술 추론 벤치마크에서 얼마나 견고한가?

주요 결과

  • Prompt-OIRL는 최적화 과정에서 추가적인 LLM 추론이 전혀 필요 없이 여러 LLM(GPT-3.5-turbo, Llama-2 등)에서 산술 추론 정확도를 크게 향상시켰다.
  • 이 방법은 온라인 시험-오류 접근 방식에 비해 프롬프트 최적화 비용을 90% 이상 절감하였으며, 이는 사전 수집된 오프라인 데이터에만 의존하기 때문이다.
  • 쿼리에 의존하는 최적화 목표는 분포 수준 최적화보다 더 뛰어난 성능을 내었으며, SVAMP 및 MAWPS 벤치마크에서 최대 12%의 정확도 향상을 기록했다.
  • 학습된 보상 모델은 다양한 LLM과 산술 추론 작업 간에 잘 일반화되어 있어, 프롬프트 품질 신호의 이식성(transferability)을 입증했다.
  • 보상 모델을 활용한 최고의 N개 추론 전략은 추가 비용을 최소화하면서도 거의 최적의 성능을 달성하여 선택 전략의 효과성을 검증했다.
  • 이 방법은 기존 오프라인 데이터셋을 전문가 시연의 원천으로 효과적으로 활용하여, 새로운 데이터 수집 없이도 체계적인 프롬프트 최적화를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.