Skip to main content
QUICK REVIEW

[论文解读] Can we trust the evaluation on ChatGPT?

Rachith Aiyappa, Jisun An|arXiv (Cornell University)|Mar 22, 2023
Topic Modeling参考文献 23被引用 6
一句话总结

本文研究了在类似 ChatGPT 的封闭式、持续更新的大语言模型评估中,数据污染的风险,以立场检测为案例研究。研究证明,由于模型的封闭性以及通过用户输入进行强化学习人类反馈(RLHF)训练,评估结果可能被人为夸大,严重质疑了此类模型性能基准的可靠性与公平性。

ABSTRACT

ChatGPT, the first large language model (LLM) with mass adoption, has demonstrated remarkable performance in numerous natural language tasks. Despite its evident usefulness, evaluating ChatGPT's performance in diverse problem domains remains challenging due to the closed nature of the model and its continuous updates via Reinforcement Learning from Human Feedback (RLHF). We highlight the issue of data contamination in ChatGPT evaluations, with a case study of the task of stance detection. We discuss the challenge of preventing data contamination and ensuring fair model evaluation in the age of closed and continuously trained models.

研究动机与目标

  • 调查 ChatGPT 在自然语言处理评估中表现优异是否可能源于用户提供的测试输入导致的数据污染。
  • 强调在封闭式、持续更新的大语言模型中,验证训练集与测试集数据泄露缺失的根本性挑战。
  • 通过立场检测的案例研究,证明模型性能可能因在 RLHF 阶段接触到评估数据而被人为夸大。
  • 呼吁改进透明度,并建立机制以检测和防止未来大语言模型评估中的数据污染。

提出的方法

  • 手动从 January 30 版本的 ChatGPT 响应中提取 SemEval 2016 Task 6 数据集的立场标签。
  • 使用微观和宏观 F1 分数重新评估性能,将 F1-m 视为微观平均,F1-avg 视为宏观平均,以反映最坏情况假设。
  • 与先前研究(Zhang et al., 2021)进行比较,以评估一致性,并识别评分定义和报告数值中的差异。
  • 通过分析多个会话和时间间隔内的响应模式,考虑会话级上下文累积和速率限制的影响。
  • 使用 February 13 日 ChatGPT Plus 版本的开源 API,以确保会话隔离并减少上下文残留影响。
  • 识别出先前基准研究中的潜在问题,包括模型评分的错误标注以及 F1 定义的不一致使用。

实验结果

研究问题

  • RQ1ChatGPT 在自然语言处理基准测试中的表现在多大程度上可归因于用户提供的测试输入导致的数据污染?
  • RQ2ChatGPT 的封闭式、持续更新的特性如何损害标准评估协议的有效性?
  • RQ3即使没有直接暴露于标签,仅通过暴露于同一领域内的输入文本,是否仍可能发生数据泄露?
  • RQ4发表的基准结果中评分定义不一致或模糊,对模型评估有何影响?
  • RQ5研究人员如何才能确保对封闭源代码、经 RLHF 微调的大语言模型进行公平且可靠的评估?

主要发现

  • 研究发现,ChatGPT 在 SemEval 2016 立场检测任务上的表现显著高于基线模型,但这可能源于在 RLHF 阶段用户输入导致的数据污染。
  • 在 January 30 日至 February 13 日版本之间,性能出现下降,表明可能存在灾难性遗忘或因持续再训练导致的模型行为变化。
  • 先前基准研究中发现存在差异,包括 F1 评分错误标注以及 F1-m 和 F1-avg 定义不一致,损害了可比性。
  • 从 ChatGPT 响应中手动提取标签的过程揭示,响应的冗长度和会话上下文存在显著差异,尤其是在接近速率限制时,影响了结果的一致性。
  • 本研究得出结论:无法完全排除在封闭模型(如 ChatGPT)中存在数据污染,因此标准评估结果可能不可靠。
  • 作者认为,模型开发者必须实施更优的机制以检测和防止数据泄露,尤其是来自 RLHF 流程中用户反馈的数据泄露。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。