[论文解读] All That's 'Human' Is Not Gold: Evaluating Human Evaluation of Generated Text
本研究评估了非专家人类评估者在故事、新闻文章和食谱等不同文本类型中区分GPT3生成文本与人工撰写文本的能力。尽管接受了详细说明、标注示例或成对比较的培训,评估者最高仅达到55%的准确率,与随机猜测水平无显著差异,凸显了未经训练的人类评估在评估现代自然语言生成(NLG)模型方面的局限性。
Human evaluations are typically considered the gold standard in natural language generation, but as models' fluency improves, how well can evaluators detect and judge machine-generated text? We run a study assessing non-experts' ability to distinguish between human- and machine-authored text (GPT2 and GPT3) in three domains (stories, news articles, and recipes). We find that, without training, evaluators distinguished between GPT3- and human-authored text at random chance level. We explore three approaches for quickly training evaluators to better identify GPT3-authored text (detailed instructions, annotated examples, and paired examples) and find that while evaluators' accuracy improved up to 55%, it did not significantly improve across the three domains. Given the inconsistent results across text domains and the often contradictory reasons evaluators gave for their judgments, we examine the role untrained human evaluations play in NLG evaluation and provide recommendations to NLG researchers for improving human evaluations of text generated from state-of-the-art models.
研究动机与目标
- 评估未经训练的非专家评估者是否能在多种领域中可靠区分人工撰写与GPT3生成的文本。
- 探究通过详细说明、标注示例或成对比较对评估者进行培训,是否能显著提升其检测机器生成文本的能力。
- 分析评估者在判断生成文本“类人”程度时所关注的文本特征。
- 评估人类评估作为现代自然语言生成模型金标准的可靠性。
- 为NLG研究中的人类评估实践提供可操作的改进建议。
提出的方法
- 针对三个领域(故事、新闻文章和食谱)的500个文本样本,开展了一项由非专家参与者参与的人工评估研究。
- 要求参与者使用四分类量表判断每篇文本是“明确为人工撰写”、“可能为人工撰写”、“可能为机器生成”或“明确为机器生成”。
- 提供三种不同的培训条件:详细说明、标注示例和成对的人工-机器样本对比。
- 收集评估者的定性解释,以分析其推理过程和关注重点。
- 分析评估者判断与文本实际来源之间的相关性,衡量在各领域中的准确率与一致性。
- 采用统计分析方法,评估不同培训方法是否显著提升了检测表现。
实验结果
研究问题
- RQ1未经训练的非专家评估者能否在多个领域中可靠区分GPT3生成与人工撰写的文本?
- RQ2提供培训(包括详细说明、标注示例或成对比较)是否能显著提升评估者检测机器生成文本的能力?
- RQ3评估者在判断生成文本“类人”程度时,主要依赖哪些文本特征?
- RQ4评估者的判断在不同文本领域中是否具有一致性?其不一致性由何原因造成?
- RQ5评估者在多大程度上低估了先进语言模型输出的质量?
主要发现
- 未经训练的评估者在所有三个领域中均无法以优于随机猜测的准确率区分GPT3生成与人工撰写的文本。
- 即使经过详细说明、标注示例或成对比较的培训,评估者的准确率仅得到微弱提升,最高仅为55%。
- 评估者主要关注表面特征,如语法、拼写和写作风格,而非内容质量或事实一致性。
- 判断常常自相矛盾:同一文本特征被用来同时支持“人工”和“机器”作者身份,表明评估存在高度不一致性。
- 评估者系统性地低估了GPT3生成文本的质量,许多高质量的模型输出被评定为“明确为人工撰写”。
- 本研究揭示,当前的人类评估实践不足以有效评估现代NLG模型,尤其是在错误源于内容而非流畅性的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。