[论文解读] Missing Information, Unresponsive Authors, Experimental Flaws: The Impossibility of Assessing the Reproducibility of Previous Human Evaluations in NLP
本文研究了自然语言处理(NLP)中人类评估的可复现性,发现仅有13%的研究提供了足够的信息和较低的复现门槛。由于普遍存在数据缺失、作者不回应以及实验设计缺陷,作者放弃了直接复现,转而提出一种‘标准化后复现两次’的方法,以提高未来人类评估研究的可靠性和一致性。
We report our efforts in identifying a set of previous human evaluations in NLP that would be suitable for a coordinated study examining what makes human evaluations in NLP more/less reproducible. We present our results and findings, which include that just 13\% of papers had (i) sufficiently low barriers to reproduction, and (ii) enough obtainable information, to be considered for reproduction, and that all but one of the experiments we selected for reproduction was discovered to have flaws that made the meaningfulness of conducting a reproduction questionable. As a result, we had to change our coordinated study design from a reproduce approach to a standardise-then-reproduce-twice approach. Our overall (negative) finding that the great majority of human evaluations in NLP is not repeatable and/or not reproducible and/or too flawed to justify reproduction, paints a dire picture, but presents an opportunity for a rethink about how to design and report human evaluations in NLP.
研究动机与目标
- 通过识别适合协调复现的研究,评估先前NLP人类评估的可复现性。
- 调查信息缺失、作者不回应以及实验缺陷在多大程度上阻碍了NLP人类评估的可复现性。
- 评估现有NLP人类评估研究在原始条件下是否能够被有意义地复现。
- 在发现大多数先前评估因根本性缺陷和报告不完整而不可复现后,重新设计研究方法。
- 倡导改进人类评估设计的文档标准和标准化,以实现未来可复现性研究的可靠性。
提出的方法
- 采用多实验室、多测试(MLMT)研究设计,系统评估影响NLP人类评估可复现性的因素。
- 通过关键词搜索并筛选包含‘人类评估’和‘参与者’的研究,选取177篇具有人类评估的NLP论文。
- 对论文层面和实验层面进行详细标注,提取参与者类型、人数、指导说明、评估量表和输出集等信息。
- 通过多轮沟通与作者联系,获取缺失或不明确的细节,特别是关于实验设置和训练流程的信息。
- 识别并记录实验缺陷,如不一致的评分量表、不清晰的指导说明以及项目呈现中缺少随机化。
- 由于无法实现直接复现,放弃原始研究的直接复现设计,转而采用‘标准化后复现两次’的方法,以确保方法论的一致性。
实验结果
研究问题
- RQ1在先前的NLP人类评估中,有多大比例的研究具备足够的信息和较低的复现门槛,以支持复现?
- RQ2信息缺失、作者不回应以及实验缺陷在多大程度上阻碍了NLP人类评估的可复现性?
- RQ3实验缺陷在多大程度上影响了复现人类评估研究的有意义性?
- RQ4当无法直接复现人类评估时,可以采用哪些替代的方法论途径?
- RQ5为提高未来NLP人类评估的可复现性,报告标准和实验设计需要做出哪些改变?
主要发现
- 在评估的177篇NLP论文中,仅有13%的研究同时具备足够低的复现门槛和可获取的充分信息,可被视为可复现研究。
- 在选定的复现实验中,除一项外,其余所有实验均存在缺陷,这些缺陷使复现其研究的意义受到质疑。
- 在37篇、59篇和15篇论文中,关键细节如参与者人数、参与者类型、训练指导说明和评估集本身缺失或不明确。
- 尽管与作者进行了广泛沟通,但在多个案例中仍无法获取关键实验细节,包括是否要求母语者参与以及输出如何随机化。
- 由于不可复现和存在缺陷的评估普遍存在,研究被迫放弃原始的直接复现设计。
- 作者得出结论:当前NLP中人类评估报告的状态不足以支持可靠的可复现性,必须转向标准化、预处理的评估设计,以在复现前建立基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。