Skip to main content
QUICK REVIEW

[论文解读] ALLURE: Auditing and Improving LLM-based Evaluation of Text using Iterative In-Context-Learning

Hosein Hasanbeig, Hiteshi Sharma|arXiv (Cornell University)|Sep 24, 2023
Topic ModelingComputer Science被引用 3
一句话总结

ALLURE 是一个闭环框架,通过迭代式上下文学习(ICL)对基于大语言模型(LLM)的文本评估进行审计与改进,利用针对特定故障模式的示例来优化 GPT-4 的评估准确性。结果表明,与特定错误类型对齐的靶向 ICL 示例能显著提升性能,在减少对人工标注依赖的同时,增强在文本摘要和强化学习规划任务中的鲁棒性。

ABSTRACT

From grading papers to summarizing medical documents, large language models (LLMs) are evermore used for evaluation of text generated by humans and AI alike. However, despite their extensive utility, LLMs exhibit distinct failure modes, necessitating a thorough audit and improvement of their text evaluation capabilities. Here we introduce ALLURE, a systematic approach to Auditing Large Language Models Understanding and Reasoning Errors. ALLURE involves comparing LLM-generated evaluations with annotated data, and iteratively incorporating instances of significant deviation into the evaluator, which leverages in-context learning (ICL) to enhance and improve robust evaluation of text by LLMs. Through this iterative process, we refine the performance of the evaluator LLM, ultimately reducing reliance on human annotators in the evaluation process. We anticipate ALLURE to serve diverse applications of LLMs in various domains related to evaluation of textual data, such as medical summarization, education, and and productivity.

研究动机与目标

  • 解决在实际应用中因可识别的故障模式而对基于大语言模型的文本评估进行审计与改进的迫切需求。
  • 通过系统性地利用自动生成的、针对故障模式的示例来优化大语言模型评估器,减少对人工标注者的依赖。
  • 提升 GPT-4 作为评估器在多种领域(包括强化学习规划和新闻摘要)中的鲁棒性与准确性。
  • 探究 ICL 提示设计(特别是示例类型、数量和聚类方式)对评估器性能的影响。
  • 开发一种可扩展的闭环协议,用于持续审计与改进基于大语言模型的评估系统。

提出的方法

  • 通过将 GPT-4 的评估输出与人工标注的黄金标准进行对比,审计其在两个领域(强化学习规划与新闻摘要)中的评估表现,识别故障模式。
  • 将显著评估偏差的实例存储在记忆中,作为按错误类型(如事实不一致、冗余、无关性)分类的故障模式聚类。
  • 通过从特定故障模式聚类中选取示例来构建上下文学习(ICL)提示,以引导 GPT-4 的评估行为。
  • 通过多轮迭代持续优化 ICL 提示集,基于性能反馈与信号检测理论分析更新示例。
  • 通过消融研究评估提示设计的影响,包括示例数量、示例类型和指导结构。
  • 采用信号检测理论方法量化并分析迭代过程中评估准确性的提升。

实验结果

研究问题

  • RQ1大语言模型文本评估中的不同故障模式如何影响 GPT-4 的性能?是否可系统性地分类?
  • RQ2当使用针对故障模式的示例进行微调时,迭代式上下文学习(ICL)在多大程度上能提升 GPT-4 的评估准确性?
  • RQ3ICL 示例的数量是否对评估性能产生线性或非线性影响?其性能提升的最优阈值是什么?
  • RQ4不同类型的故障模式示例聚类如何影响 GPT-4 在多样化文本生成任务中评估的鲁棒性与泛化能力?
  • RQ5是否可设计 ICL 提示以实现基于示例选择的非对称性能提升?示例与错误类型的匹配度在其中扮演何种角色?

主要发现

  • 当 ICL 提示使用针对故障模式的示例构建时,GPT-4 的评估性能显著提升,性能增益超过随机或非靶向示例的选择。
  • 增加 ICL 示例数量并未带来线性提升;相反,性能在达到一定示例数量阈值前先下降,之后才开始改善。
  • ICL 示例的类型——特别是其与特定故障模式的匹配度——对性能的影响强于示例的绝对数量。
  • 不同“相似”的 ICL 示例集合带来了非对称的性能提升,表明基于故障模式聚类的综合示例选择至关重要。
  • 消融研究证实,指令质量和提示引导结构均显著影响评估准确性,结构更优的提示带来更一致的性能提升。
  • 迭代式 ICL 协议通过故障模式反馈循环实现了评估器的自我优化,显著降低了对人工标注者的依赖,展示了在评估工作流中的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。