[论文解读] What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt Engineering
本文提出了两种新颖的度量指标——敏感性(sensitivity)与一致性(consistency),用于评估大型语言模型(LLMs)在文本分类任务中面对提示(prompt)变化时的性能可靠性。敏感性衡量在语义等价的提示重述之间预测结果的变化程度,且无需真实标签(ground truth);一致性则评估同一类别内预测结果的稳定性。核心贡献在于提出了一套诊断框架,可识别LLM的失效模式,并指导提示工程以提升鲁棒性,尤其适用于存在多个LLM阶段的生产系统。
Large Language Models (LLMs) changed the way we design and interact with software systems. Their ability to process and extract information from text has drastically improved productivity in a number of routine tasks. Developers that want to include these models in their software stack, however, face a dreadful challenge: debugging LLMs' inconsistent behavior across minor variations of the prompt. We therefore introduce two metrics for classification tasks, namely sensitivity and consistency, which are complementary to task performance. First, sensitivity measures changes of predictions across rephrasings of the prompt, and does not require access to ground truth labels. Instead, consistency measures how predictions vary across rephrasings for elements of the same class. We perform an empirical comparison of these metrics on text classification tasks, using them as guideline for understanding failure modes of the LLM. Our hope is that sensitivity and consistency will be helpful to guide prompt engineering and obtain LLMs that balance robustness with performance.
研究动机与目标
- 为解决因提示微小变化导致LLM行为不一致的问题,该问题阻碍了其在生产环境中的部署。
- 开发互补于准确率的诊断度量指标,且评估LLM鲁棒性时无需依赖真实标签。
- 通过识别如过度敏感或各类别间一致性低下等失效模式,指导提示工程。
- 提供一种框架,用于评估在提示变化频繁的多阶段软件系统中LLM的可靠性。
提出的方法
- 提出敏感性作为度量指标,用于衡量同一提示的Q种重述版本之间的预测方差,且无需真实标签即可计算。
- 定义一致性为同一类别下示例间预测结果的平均相似度,使用预测分布之间的余弦相似度进行计算。
- 采用多样化的提示策略(如少样本、零样本、详细描述等)在多个文本分类数据集(TREC、DBPedia、WoS、CB)上评估LLM。
- 将这些度量应用于Llama3和GPT-3.5,分析聚合结果与类别级别的行为,以检测失效模式。
- 使用直方图和小提琴图可视化结果,比较不同提示策略与数据集下的一致性分布。
- 通过定性分析追踪误分类现象,识别具体提示设计因素(如标签描述的措辞或顺序)的影响。
实验结果
研究问题
- RQ1LLM的预测在语义等价的提示重述之间如何变化?这种变化能否在无真实标签的情况下进行量化?
- RQ2不同提示策略在多大程度上影响LLM对同一类别内预测结果的一致性?
- RQ3敏感性与一致性度量能否识别出仅靠准确率无法捕捉的失效模式?
- RQ4标签描述的措辞与顺序在多大程度上影响LLM的鲁棒性?这些影响能否被系统性地诊断?
主要发现
- 敏感性有效识别出那些显著改变LLM预测结果的提示变化,即使准确率保持高位,也能揭示模型行为中隐藏的脆弱性。
- 各类别中的一致性值通常低于0.75,表明LLM经常对相似样本做出不同分类,尤其在‘Description’与‘Entity’等易混淆类别中更为明显。
- 1-shot提示策略降低了中等水平的一致性,并增加了零一致性对的数量,与‘少样本可提升稳定性’的预期相悖。
- 标签描述的措辞(如添加冠词‘an Entity’)可显著改变预测结果,表明模型对提示的微小变化具有高度敏感性。
- 定性分析显示,‘Description’与‘Entity’类别之间常发生混淆,通过调整这些类别的提示描述可提升一致性。
- 这些度量揭示了非直观的行为,例如使用详细类别描述反而增加敏感性,凸显了在平均性能之外进行系统性提示诊断的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。