[论文解读] ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
本文介绍了 ChatLog,这是一个持续更新的数据集,记录了在 21 项基准测试中,ChatGPT 随时间推移的响应。该研究进行了全面的评估与特征分析,揭示了模型行为的时间演化,并识别出在新版本 ChatGPT 中提升检测鲁棒性的稳定语言与知识特征。
ChatGPT has achieved great success and can be considered to have acquired an infrastructural status. There are abundant works for evaluating ChatGPT on benchmarks. However, existing benchmarks encounter two challenges: (1) Disregard for periodical evaluation and (2) Lack of fine-grained features. In this paper, we construct ChatLog, an ever-updating dataset with large-scale records of diverse long-form ChatGPT responses for 21 NLP benchmarks from March, 2023 to now. We conduct a comprehensive performance evaluation to find that most capabilities of ChatGPT improve over time except for some abilities, and there exists a step-wise evolving pattern of ChatGPT. We further analyze the inherent characteristics of ChatGPT by extracting the knowledge and linguistic features. We find some stable features that stay unchanged and apply them on the detection of ChatGPT-generated texts to improve the robustness of cross-version detection. We will continuously maintain our project at \url{https://github.com/THU-KEG/ChatLog/}.
研究动机与目标
- 系统研究 ChatGPT 行为随时间的演变,特别是针对持续训练和对齐更新的响应。
- 弥补现有评估中仅关注单一时点或有限版本对比的不足。
- 构建一个纵向数据集,捕捉模型输出在粗粒度(每月)和细粒度(每日)上的变化。
- 提取并分析内在特征——包括语言与知识特征——这些特征在时间上保持稳定或发生改变。
- 通过利用在时间演化中识别出的稳定特征,提升 ChatGPT 检测模型的鲁棒性。
提出的方法
- 构建双数据集设置:ChatLog-Monthly(每月 38,730 对问答对)和 ChatLog-Daily(每日 1,000 个相同的 ELI5 问题),以捕捉时间变化。
- 在 21 项基准测试中进行自动与人工评估,涵盖生成与分类任务,以追踪性能演变。
- 使用 NLP 工具(如信息抽取与语言分析)从模型输出中提取 10 项知识特征和 255 项语言特征。
- 开展三项分析:特征得分随时间的趋势分析、使用皮尔逊相关系数的性能相关性分析,以及变异分析以识别稳定特征。
- 在 HC3 数据上训练基于 RoBERTa 的检测器,并通过 LightGBM 融合 RoBERTa 概率与稳定特征,以提升泛化能力。
- 持续在 GitHub 上监控与更新数据集,以确保长期的时间覆盖范围与可复现性。

实验结果
研究问题
- RQ1ChatGPT 在多样化 NLP 任务中的表现如何随时间演变?
- RQ2ChatGPT 输出的内在特征中,哪些在模型更新后保持稳定或发生显著变化?
- RQ3语言与基于知识的特征在多大程度上与基准性能随时间相关?
- RQ4从历史输出中提取的稳定特征是否能提升新版本 ChatGPT 检测模型的鲁棒性?
- RQ5基于预训练模型的检测器(如 RoBERTa)与基于规则的分类器(如 GLTR、困惑度)在演化中的模型输出上表现如何?
主要发现
- 2023 年 3 月至 4 月间,ChatGPT 的响应发生了显著演变,后续版本在 '向 5 岁儿童解释' 任务中提供了更具自然性与隐喻性的解释。
- 当在 2023 年 4 月的数据上测试时,基于 RoBERTa 的检测器性能相比 2023 年 1 月的数据下降了最高达 10%,表明模型更新导致了分布偏移。
- RoBERTa-qa 模型通过利用问题上下文实现了高准确率,但当仅使用答案时性能下降至 90%,凸显其对问题信息的依赖。
- GLTR 与基于困惑度的分类器性能下降幅度大于微调后的 RoBERTa 模型,表明预训练模型在时间偏移下泛化能力更强。
- 通过变异系数较低识别出的稳定特征与基准性能强相关,并在与 RoBERTa 融合后显著提升了检测鲁棒性。
- 使用 RoBERTa 概率与 10 个稳定特征的集成检测器,在新版本 ChatGPT 上的泛化能力优于独立模型。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。