[论文解读] Inconsistency in Conference Peer Review: Revisiting the 2014 NeurIPS Experiment
本文重新审视了2014年NeurIPS同行评审实验,发现50%的评审分数差异源于主观判断,而非客观质量。对于被接受的论文,质量评分与引用影响之间无相关性,但对被拒绝的论文则存在显著相关性,表明评审者更能识别出薄弱的论文,而非优秀的论文。作者主张采用更清晰的评分标准,并警告不应消除主观性,同时呼吁减少在评估研究人员时对‘顶级会议’地位的依赖。
In this paper we revisit the 2014 NeurIPS experiment that examined inconsistency in conference peer review. We determine that 50\% of the variation in reviewer quality scores was subjective in origin. Further, with seven years passing since the experiment we find that for \emph{accepted} papers, there is no correlation between quality scores and impact of the paper as measured as a function of citation count. We trace the fate of rejected papers, recovering where these papers were eventually published. For these papers we find a correlation between quality scores and impact. We conclude that the reviewing process for the 2014 conference was good for identifying poor papers, but poor for identifying good papers. We give some suggestions for improving the reviewing process but also warn against removing the subjective element. Finally, we suggest that the real conclusion of the experiment is that the community should place less onus on the notion of `top-tier conference publications' when assessing the quality of individual researchers. For NeurIPS 2021, the PCs are repeating the experiment, as well as conducting new ones.
研究动机与目标
- 重新分析2014年NeurIPS同行评审实验,以评估主观性在评审分数中的作用。
- 评估评审质量评分是否与长期论文影响力(以引用次数衡量)相关。
- 追踪被拒绝论文的发表命运,并评估其评分是否能预测未来影响力。
- 评估同行评审在识别高影响力研究方面的可靠性,并提出改进建议。
- 挑战学界对顶级会议发表作为研究人员质量代理指标的过度依赖。
提出的方法
- 作者使用2014年NeurIPS实验中的校准评审分数,通过模拟研究量化主观性。
- 他们从Semantic Scholar收集了400篇已发表论文和680篇被拒绝论文的引用次数,以衡量长期影响力。
- 他们分别对被接受和被拒绝的论文,分析校准质量评分与引用次数之间的相关性。
- 他们使用差分隐私技术模糊可视化中的个体评分,以防止重新识别。
- 他们分析了原始NeurIPS 2013框架中的置信度评分和影响力评分,以比较其预测能力。
- 他们通过标题和作者匹配,在Semantic Scholar上追踪被拒绝论文,以确定最终发表的期刊。
实验结果
研究问题
- RQ1评审质量评分的差异在多大程度上源于主观解读,而非客观论文质量?
- RQ2对于被接受至NeurIPS 2014的论文,评审质量评分与长期引用影响力之间是否存在统计显著相关性?
- RQ3被拒绝论文中,评分较高的论文是否获得了更高的引用次数?如果是,这是否表明评审者更能识别出薄弱论文而非优秀论文?
- RQ4评审者的置信度评分与未来引用影响力之间的相关性如何?这对我们理解引用成功驱动因素有何启示?
- RQ5同行评审过程在多大程度上能可靠地识别出高影响力研究?有哪些改进措施可增强其预测能力?
主要发现
- 50%的评审质量评分差异可归因于主观解读,而非客观论文质量。
- 对于被接受至NeurIPS 2014的论文,评审质量评分与引用影响力之间无统计显著相关性。
- 对于被拒绝的论文,更高的评审质量评分与更高的引用次数显著相关,表明评审者能有效识别出薄弱论文。
- 置信度评分与引用次数之间的相关性中等但统计显著(r = 0.25),表明置信度可能反映了论文表达的清晰度或优雅程度。
- 被接受的论文平均引用次数高于被拒绝的论文,但其初始质量评分无法预测这一结果。
- 本研究结论认为,同行评审过程在过滤低质量工作方面有效,但无法可靠识别出高影响力研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。