[论文解读] An Open Review of OpenReview: A Critical Analysis of the Machine Learning Conference Review Process
本研究利用公开数据,对 ICLR 2017–2020 年的评审流程进行了批判性分析,发现即使在控制了论文质量与主题后,仍存在显著的机构偏见和性别差距,评分与录用率方面均存在明显不公。尽管可重复性中等(2020 年为 66%),但评审分数与引用影响力的相关性较低,且录用率随时间推移而下降,表明同行评审存在系统性不公。
Mainstream machine learning conferences have seen a dramatic increase in the number of participants, along with a growing range of perspectives, in recent years. Members of the machine learning community are likely to overhear allegations ranging from randomness of acceptance decisions to institutional bias. In this work, we critically analyze the review process through a comprehensive study of papers submitted to ICLR between 2017 and 2020. We quantify reproducibility/randomness in review scores and acceptance decisions, and examine whether scores correlate with paper impact. Our findings suggest strong institutional bias in accept/reject decisions, even after controlling for paper quality. Furthermore, we find evidence for a gender gap, with female authors receiving lower scores, lower acceptance rates, and fewer citations per paper than their male counterparts. We conclude our work with recommendations for future conference organizers.
研究动机与目标
- 调查 2017–2020 年 ICLR 同行评审流程的可重复性与随机性。
- 评估评审分数是否与实际论文影响力(以引用次数衡量)相关。
- 检验评审流程在共识性、可重复性及与影响力相关性方面是否随时间推移而恶化。
- 识别领域主席决策中的机构偏见,特别是对知名机构的偏好。
- 调查性别差异是否存在于评审分数、录用率及引用影响力中,即使在控制了主题与质量后依然存在。
提出的方法
- 从 OpenReview、arXiv、SemanticScholar 和机构排名(CS Rankings)收集并整理了 ICLR 2017–2020 年论文的数据。
- 使用蒙特卡洛模拟量化在不同评审人数与配置下结果的可重复性。
- 应用统计模型,包括回归分析与非参数检验(如 Mann-Whitney U 检验),以评估性别与机构偏见。
- 通过人工校准的关键词将论文划分为 12 个主题,以在分析中控制主题分布。
- 使用基于姓名与网络的启发式方法为第一作者与最后作者分配性别标签,同时承认其局限性。
- 使用 SemanticScholar 数据测量引用影响力,通过编辑距离与人工校对解决重复问题。
实验结果
研究问题
- RQ1ICLR 评审流程在不同评审人员组合下具有多大程度的可重复性?
- RQ2评审分数在多大程度上能预测被录用论文的实际引用影响力?
- RQ3评审流程的一致性与公平性是否随时间推移而下降(2017–2020 年)?
- RQ4是否存在机构偏见的证据,即来自知名机构的论文即使评审分数较低也更可能被录用?
- RQ5在控制主题与质量后,是否存在性别差异,体现在评审分数、录用率与引用影响力上?
主要发现
- ICLR 的评审流程在 2020 年表现出 66% 的可重复性,表明中等程度的一致性,但与作者感知到的高随机性不一致。
- 评审分数与实际引用影响力之间的相关性极弱,表明分数无法有效预测论文的长期影响力。
- 在控制评审分数后,来自知名机构的论文录用率仍显著更高,表明存在强烈的机构偏见。
- 女性第一作者的平均得分比男性第一作者低 0.16 分(p = 0.085),且录用率较低(22.1%),而男性第一作者的录用率为 27.6%。
- 即使在控制主题分布后,女性的实际录用率(22.1%)仍低于若其在各主题中与男性具有相同录用率时的预期值(27.8%),表明存在系统性差距。
- 女性在 ICLR 中代表性不足:2020 年第一作者中仅 10.6% 为女性,最后作者中仅 9.7% 为女性,而美国 CS 博士生中女性占比为 23.2%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。