[论文解读] Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
本文提出黑箱提示优化(BPO),一种无需微调或训练模型即可对齐大型语言模型(LLMs)与人类偏好的方法。通过使用反馈数据和序列到序列模型自动重写用户提示,BPO 提升了响应质量和对齐效果,在 GPT-3.5-turbo 上实现最高 22% 的胜率提升,在 GPT-4 上实现 10% 的提升,优于 PPO 和 DPO,同时保持模型无关性和可解释性。
Large language models (LLMs) have shown impressive success in various applications. However, these models are often not well aligned with human intents, which calls for additional treatments on them; that is, the alignment problem. To make LLMs better follow user instructions, existing alignment methods primarily focus on further training them. However, the extra training of LLMs is usually expensive in terms of GPU computing; even worse, some LLMs are not accessible for user-demanded training, such as GPTs. In this work, we take a different perspective -- Black-Box Prompt Optimization (BPO) -- to perform alignments. The idea is to optimize user prompts to suit LLMs' input understanding, so as to best realize users' intents without updating LLMs' parameters. BPO leverages human preferences to optimize prompts, thus making it superior to LLM (e.g., ChatGPT) as a prompt engineer. Moreover, BPO is model-agnostic, and the empirical results demonstrate that the BPO-aligned ChatGPT yields a 22% increase in the win rate against its original version and 10% for GPT-4. Notably, the BPO-aligned LLMs can outperform the same models aligned by PPO and DPO, and it also brings additional performance gains when combining BPO with PPO or DPO. Code and datasets are released at https://github.com/thu-coai/BPO.
研究动机与目标
- 解决在不进行微调或无法访问模型权重的情况下,将 LLM 与人类意图对齐的挑战。
- 开发一种模型无关、高效且可解释的方法,通过提示优化提升 LLM 对齐效果。
- 通过提示重写实现对闭源 LLM(如 GPT-4 和 Claude-2)的对齐,克服基于训练方法的局限性。
- 证明提示优化可优于或补充基于强化学习的对齐技术(如 PPO 和 DPO)。
- 提供一种可扩展、可解释的替代参数微调的方法,适用于包括 API 接口模型和开源模型在内的多种 LLM。
提出的方法
- BPO 使用从公开偏好数据集中提取的 14,000 个指令-优化配对构建提示优化模型。
- 利用 LLM 分析响应对(偏好 vs. 不偏好),识别关键差异,并生成融合改进特征的优化提示。
- 该方法将 LLM 视为黑箱,仅专注于优化输入提示,而不修改模型参数。
- 训练一个序列到序列模型,将原始用户提示映射为能更好激发人类偏好的优化版本。
- 优化策略包括生成解释、扩展提示、提供提示线索以及增强安全性,均源自对反馈数据的分析。
- 通过 Vicuna Eval、Self-Instruct Eval 和 Dolly Eval 等成对人类偏好基准进行评估。

实验结果
研究问题
- RQ1仅通过提示优化是否能显著提升 LLM 对齐效果,而无需任何模型微调或参数更新?
- RQ2在闭源模型(如 GPT-4 和 Claude-2)上,BPO 与 PPO 和 DPO 等成熟对齐方法相比性能如何?
- RQ3BPO 在包括开源和 API 接口模型在内的多种 LLM 架构上具有多大程度的泛化能力?
- RQ4哪些提示优化策略能持续提升响应质量和人类偏好?
- RQ5BPO 是否可与现有对齐技术结合,进一步提升模型对齐性能?
主要发现
- 在成对偏好评估中,BPO 在 gpt-3.5-turbo 上实现 22% 的胜率提升,在 gpt-4 上实现 10% 的胜率提升,优于 PPO 和 DPO。
- 即使在 PPO 和 DPO 对应模型已微调的前提下,BPO 对齐的模型仍表现更优。
- 当与 PPO 或 DPO 结合时,BPO 展现出正交性改进,进一步提升对齐性能。
- 该方法成功提升了开源模型(如 Vicuna、Llama-2)和闭源模型(如 GPT-4、Claude-2)的对齐效果,且无需模型访问或训练。
- 识别出的提示优化策略——解释生成、提示扩展、提示线索提供和安全性增强——显著提升了响应质量和可控性。
- 错误分析显示,由于训练数据中长上下文和数学相关提示的样本不平衡,模型在处理此类提示时存在局限,表明通过更丰富的数据集可进一步改进。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。