[论文解读] OverPrompt: Enhancing ChatGPT through Efficient In-Context Learning
OverPrompt 提出了一种成本高效的零样本提示策略,通过将多个输入批量处理为单次大语言模型(LLM)推理调用,降低了令牌和时间成本,同时通过上下文学习提升了性能。通过重用任务描述并利用 LLM 在分组输入上泛化的能力,OverPrompt 在文本分类任务中实现了更低的推理成本和更高的准确性,尤其在情感分析和事实核查任务中表现突出。
The remarkable performance of pre-trained large language models has revolutionised various natural language processing applications. Due to huge parametersizes and extensive running costs, companies or organisations tend to transfer the models to the target task by zero-shot prompting techniques. However, the prohibitive costs of tokens and time have hindered their adoption in applications. We propose OverPrompt, leveraging the in-context learning capability of LLMs to handle multiple task inputs, thereby reducing token and time costs. This approach could potentially improve task performance during API queries due to better conditional distribution mapping. Evaluated across diverse classification datasets, our experiments show that OverPrompt can achieve cost-efficient zero-shot classification without causing significant detriment to task performance, and in some cases, even improving it. An ablation study conducted on various LLMs, along with an investigation into the robustness of our prompting strategy to different input ordering, offers valuable insights into the broader applicability of our method across diverse tasks. These findings also suggest a more seamless integration of our method with LLMs through an API.
研究动机与目标
- 降低通过 API 部署大语言模型(LLMs)进行零样本分类时产生的高令牌和时间成本。
- 探索在单个提示中批量处理多个未标注输入是否能通过上下文学习提升任务性能。
- 设计一种提示策略,以最小化重复的任务描述,同时保持或提升预测准确性。
- 评估该方法在不同大语言模型和输入排序配置下的鲁棒性。
- 通过成本高效的提示策略,实现大语言模型在生产环境中的更高效、可扩展部署。
提出的方法
- OverPrompt 将多个未标注的输入实例分组到单个提示中,仅重复使用一次任务描述,以减少令牌消耗。
- 该方法利用大语言模型的上下文学习(ICL)能力,通过提供多个输入之间的上下文信息,改善条件分布映射。
- 采用贝叶斯推理框架从理论上证明,整合多个输入可改善分布近似并减少格式错误。
- 提示模板设计旨在最小化冗余,仅陈述一次任务描述,并以一致格式组织多个输入,以增强模型泛化能力。
- 输出格式经过调整,以降低错误率并提高一致性,尤其在类别边界清晰的任务中表现更优。
- 该方法在十个不同的文本分类数据集上使用 GPT-3.5-turbo 和 GPT-4 进行评估,并对输入排序和模型变体进行了消融研究。

实验结果
研究问题
- RQ1将多个未标注输入批量处理为单个提示,是否能降低零样本 LLM 推理中的令牌和时间成本?
- RQ2通过提供多个输入的上下文信息,是否能提升模型在零样本分类任务中的预测准确性?
- RQ3OverPrompt 的性能对输入排序变化和不同大语言模型架构的敏感性如何?
- RQ4OverPrompt 在哪些类型的分类任务中能带来性能提升,原因是什么?
- RQ5OverPrompt 是否能有效集成到基于 API 的大语言模型工作流中,且不损害模型可靠性?
主要发现
- OverPrompt 通过在单次 API 调用中重用多个输入的任务描述,显著降低了令牌和时间成本。
- 该方法在多个数据集上提升了分类性能,尤其在情感分析和事实核查任务中,上下文对比增强了决策能力。
- 性能增益在 gpt-3.5-turbo 和 gpt-4 模型上最为显著,表明其与这些模型的上下文学习机制高度契合。
- 该方法对输入排序具有鲁棒性,在不同输入序列下性能下降极小,表明其在实际部署中具有稳定性。
- 消融研究证实,即使在输入长度较长时,该策略依然有效,尽管在极端长输入下性能可能因上下文长度限制而下降。
- 该方法通过减少冗余的 API 调用和令牌使用,降低了大语言模型推理的碳足迹。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。