[论文解读] Hard Prompts Made Easy: Gradient-Based Discrete Optimization for Prompt Tuning and Discovery
本文提出 PEZ,一种基于梯度的方法,通过持续更新软提示并投影到最近的词汇嵌入来优化离散硬提示,实现对图像生成和语言分类的有效硬提示,并具备跨模型的可迁移性。
The strength of modern generative models lies in their ability to be controlled through text-based prompts. Typical "hard" prompts are made from interpretable words and tokens, and must be hand-crafted by humans. There are also "soft" prompts, which consist of continuous feature vectors. These can be discovered using powerful optimization methods, but they cannot be easily interpreted, re-used across models, or plugged into a text-based interface. We describe an approach to robustly optimize hard text prompts through efficient gradient-based optimization. Our approach automatically generates hard text-based prompts for both text-to-image and text-to-text applications. In the text-to-image setting, the method creates hard prompts for diffusion models, allowing API users to easily generate, discover, and mix and match image concepts without prior knowledge on how to prompt the model. In the text-to-text setting, we show that hard prompts can be automatically discovered that are effective in tuning LMs for classification.
研究动机与目标
- 在无需手工设计的情况下实现硬提示的自动学习,使其可读性更高。
- 将软提示优化与离散硬提示相结合,提升可移植性与可解释性。
- 在扩散模型的图像生成和语言分类任务中证明其有效性。
- 展示所学提示在跨模型中的迁移性以及流畅性约束对可解释性的好处。
提出的方法
- 维持连续提示嵌入,将每个嵌入投影到最近的令牌嵌入以强制离散性。
- 通过在任务特定损失上计算梯度并对提示进行广播批次来更新连续提示。
- 使用受离散优化和量化网络文献启发的基于梯度的方案来优化硬提示。
- 应用基于 CLIP 的损失用于图像到文本对齐,以发现引导扩散模型的标题/描述。
- 通过将任务损失与流畅性惩罚结合,扩展该方法到语言模型以实现可解释的提示。
实验结果
研究问题
- RQ1基于梯度的优化能否可靠地学习可解释且在跨模型间可迁移的离散硬提示?
- RQ2与基线相比,学得的硬提示在文本到图像生成和文本到文本分类中的表现如何?
- RQ3提示长度和流畅性约束对性能与迁移性的影响是什么?
- RQ4是否可以直接将通过 CLIP 指导从图像中发现的提示用于有效引导扩散模型?
- RQ5将硬提示连接、蒸馏成更短的提示或用于风格转换时,是否仍然有效?
主要发现
- 学到的硬提示(PEZ)在跨多个数据集的图像生成中实现了有竞争力的基于 CLIP 的相似度分数,所需令牌数量远少于某些基线。
- PEZ 与关键词库或 CLIP 基于引导的方式可以在使用更少令牌且不依赖重型辅助模型的情况下达到或接近 CLIP Interrogator 的性能。
- 在语言任务中,PEZ 有无流畅性约束都在 GPT-2 家族及更大的语言模型上实现了有竞争力或更优的准确性迁移,在 AGNEWS 上超越了若干基线。
- 较长的提示可能过拟合,迁移性不如较短的蒸馏提示,在图像生成任务中经验最优长度约为 16 个令牌。
- 在强制流畅性时,通过 PEZ 学到的提示在跨模型的迁移性更好,且连接或蒸馏可以拼接或压缩提示而不显著损失语义。
- 讨论了安全性问题,包括提示绕过内容过滤器并在某些 API 中再现受禁内容的潜在风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。