[논문 리뷰] PRompt Optimization in Multi-Step Tasks (PROMST): Integrating Human Feedback and Heuristic-based Sampling
PROMST는 다단계 LLM 기반 작업에서 자동 프롬프트 최적화를 위한 새로운 프레임워크로, 인간이 설계한 피드백 규칙과 학습된 점수 예측 모델을 결합하여 효율적인 후보 생성을 이끌어냅니다. 다양한 LLM을 사용하여 11개의 다단계 작업에서 기준 모델 대비 10.6%~29.3%의 상대적 성능 향상을 달성합니다.
Prompt optimization aims to find the best prompt to a large language model (LLM) for a given task. LLMs have been successfully used to help find and improve prompt candidates for single-step tasks. However, realistic tasks for agents are multi-step and introduce new challenges: (1) Prompt content is likely to be more extensive and complex, making it more difficult for LLMs to analyze errors, (2) the impact of an individual step is difficult to evaluate, and (3) different people may have varied preferences about task execution. While humans struggle to optimize prompts, they are good at providing feedback about LLM outputs; we therefore introduce a new LLM-driven discrete prompt optimization framework PRompt Optimization in Multi-Step Tasks (PROMST) that incorporates human-designed feedback rules to automatically offer direct suggestions for improvement. We also use an extra learned heuristic model that predicts prompt performance to efficiently sample from prompt candidates. This approach significantly outperforms both human-engineered prompts and several other prompt optimization methods across 11 representative multi-step tasks (an average 10.6\%-29.3\% improvement to current best methods on five LLMs respectively). We believe our work can serve as a benchmark for automatic prompt optimization for LLM-driven multi-step tasks. Datasets and Codes are available at https://github.com/yongchao98/PROMST. Project Page is available at https://yongchao98.github.io/MIT-REALM-PROMST.
연구 동기 및 목표
- 표준 방법이 길이와 오류 복잡도로 인해 실패하는 복잡한 다단계 에이전트 작업에서 자동 프롬프트 최적화의 과제를 해결하기 위해.
- 사전 정의된 피드백 규칙을 통해 인간의 전문 지식을 프롬프트 최적화에 통합하여 LLM이 개선된 프롬프트를 생성하도록 이끌기 위해.
- 높은 잠재력을 지닌 프롬프트 후보를 히우리스틱적으로 선별하기 위해 점수 예측 모델을 훈련시어 평가 비용을 줄이기 위해.
- 규칙 기반 평가 기준을 통해 최적화된 프롬프트를 인간의 선호도와 일치시키기 위해.
- 모든 다단계 환경에서 자동 프롬프트 최적화를 위한 벤치마크를 마련하기 위해 오픈소스 데이터셋과 코드를 제공하기 위해.
제안 방법
- 프레임워크는 다단계 환경에서 동작을 수행하는 TaskLLM을 사용하며, 사전 조건이 위반될 경우 실패합니다.
- 인간이 설계한 피드백 규칙이 각 실패 사례에 대해 자동으로 수정 피드백을 생성하고, 이를 PromptLLM이 새로운 프롬프트 후보를 생성하는 데 사용되는 맥락으로 활용합니다.
- 점수 함수가 환경에서 각 프롬프트의 성능을 평가하여 훈련을 위한 레이블이 부여된 프롬프트-점수 쌍을 생성합니다.
- 이러한 쌍을 사용하여 온라인으로 미세조정된 학습된 점수 예측 모델이 프롬프트 품질을 예측하고 후보 샘플링을 이끌어냅니다.
- 점수 모델을 활용해 높은 잠재력을 지닌 후보를 우선 평가함으로써, 프롬프트가 세대에 걸쳐 반복적으로 진화합니다.
- 피드백 규칙은 정확성 강화, 루프 방지, 목표 일치 보장, 액션 형식 일관성 유지 등을 위해 설계됩니다.
실험 결과
연구 질문
- RQ1인간이 설계한 피드백 규칙이 다단계 작업에서 LLM이 개선된 프롬프트를 생성하도록 효과적으로 이끌 수 있는가?
- RQ2학습된 점수 예측 모델을 통합할 경우 프롬프트 최적화의 효율성과 효과성이 어떻게 향상되는가?
- RQ3PROMST가 다단계 환경에서 인간이 수작업으로 설계한 프롬프트 및 기존 자동 최적화 기법보다 어느 정도 뛰어나게 성능을 발휘하는가?
- RQ4규칙 기반 평가 기준이 최적화된 프롬프트를 인간의 선호도와 일치시키는 데 도움이 되는가?
- RQ5PROMST는 동적 프롬프팅 전략과 통합되었을 때도 호환성과 효과성을 유지하는가?
주요 결과
- PROMST는 11개의 다단계 작업에서 5개의 다양한 LLM을 사용하여 기준 모델 대비 10.6%~29.3%의 상대적 성능 향상을 달성합니다.
- 인간이 설계한 피드백 규칙과 학습된 점수 모델의 통합은 인간 수작업 프롬프트와 기존 자동 최적화 기법을 모두 뛰어넘는 성능을 발휘합니다.
- PROMST는 다중 시도 설정에서 뛰어난 성능을 보이며, 특히 동적 프롬프팅 접근 방식과 조합했을 때 두각을 나타냅니다.
- 인간이 설계한 평가 규칙은 최적화된 프롬프트가 인간의 선호도와 효과적으로 일치하도록 도와주며, 작업 성공률와 일관성을 향상시킵니다.
- 이 프레임워크는 기존의 동적 프롬프팅 전략과 수직적(orthogonal)으로 결합 가능하며, 그 효과를 더욱 높입니다.
- 저자들은 11개의 다단계 환경에 대한 모든 데이터셋과 코드를 공개하여 향후 자동 프롬프트 최적화 분야의 연구를 위한 벤치마크를 구축했습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.