[论文解读] A Large Scale Randomized Controlled Trial on Herding in Peer-Review Discussions
这项大规模随机对照试验通过在ICML 2020中随机分配审稿人发起讨论并测量其对最终决定的影响,研究了同行评审讨论中的从众行为。出乎意料的是,该研究未发现显著的从众效应——审稿人的最终决定并未明显受讨论发起者意见的影响,表明在专家同行评审环境中对社会影响具有较强抵抗力。
Peer review is the backbone of academia and humans constitute a cornerstone of this process, being responsible for reviewing papers and making the final acceptance/rejection decisions. Given that human decision making is known to be susceptible to various cognitive biases, it is important to understand which (if any) biases are present in the peer-review process and design the pipeline such that the impact of these biases is minimized. In this work, we focus on the dynamics of between-reviewers discussions and investigate the presence of herding behaviour therein. In that, we aim to understand whether reviewers and more senior decision makers get disproportionately influenced by the first argument presented in the discussion when (in case of reviewers) they form an independent opinion about the paper before discussing it with others. Specifically, in conjunction with the review process of ICML 2020 -- a large, top tier machine learning conference -- we design and execute a randomized controlled trial with the goal of testing for the conditional causal effect of the discussion initiator's opinion on the outcome of a paper.
研究动机与目标
- 调查从众行为(即审稿人过度与讨论中首个表达的意见保持一致)是否会影响学术会议中的同行评审结果。
- 评估讨论发起者的身份(随机分配)是否对审稿人最终决定产生因果影响,特别是在高风险的机器学习会议中。
- 评估同行评审讨论中的社会影响是否损害决策的准确性或公平性,尤其是在领域主席选择讨论发起者的情况下。
- 通过在真实同行评审流程中采用受控实验设计,比较随机分配与自选讨论发起者对群体共识的影响。
- 记录更广泛的讨论动态,包括打分趋同与一致性提升,以将研究发现置于现有同行评审质量与可靠性文献的语境中。
提出的方法
- 在ICML 2020评审过程中开展随机对照试验(RCT),随机分配审稿人对部分论文发起讨论线程。
- 使用微软会议管理工具(CMT)实施随机化,并确保非发起审稿人不知情,以保持自然的讨论动态。
- 通过比较不同发起者所对应论文的结果,控制讨论前的评审打分与审稿人专业水平,测量讨论发起者意见对最终决定的因果影响。
- 应用统计分析检验发起者意见是否比独立讨论前评审的平均分更能预测最终群体决定。
- 收集并分析讨论记录、审稿人打分与最终接受/拒绝决定,以评估趋同性、一致性与影响力模式。
- 开展预先注册的研究设计并获得IRB批准,以确保在真实学术环境中具备方法严谨性与伦理合规性。
实验结果
研究问题
- RQ1在同行评审讨论中,首个表达的意见是否显著影响审稿人的最终决定,从而表明存在从众行为?
- RQ2讨论发起者意见对最终决定的因果影响是否强于讨论前平均评审打分的影响?
- RQ3与自选相比,随机分配讨论发起者在影响群体共识方面有何差异?
- RQ4同行评审讨论在多大程度上提高了审稿人之间的一致性?这种一致性提升是否反映了决策准确性的提高?
- RQ5讨论发起者身份(如资历、观点极端性)是否影响最终决定?如果是,这种影响是源于从众行为还是其他因素?
主要发现
- 未检测到显著的从众效应:讨论发起者的意见并未比讨论前独立评审的平均分更能预测最终群体决定。
- 讨论后,审稿人打分向群体共识趋同,与以往关于同行评审中社会影响的研究结果一致。
- 讨论提高了审稿人之间的一致性,但这种一致性提升并未对应决策准确性的提高,与先前相关研究的发现一致。
- 缺乏从众效应表明,机器学习会议中的专家审稿人可能更多依赖理性讨论,而非基于启发式规则的社会影响。
- 研究未发现随机分配讨论发起者导致结果偏倚的证据,表明领域主席选择发起者对最终决定影响有限。
- 研究结果挑战了专家同行评审中存在强烈社会影响的假设,表明理性讨论可能有助于缓解群体决策中的常见认知偏见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。