[論文レビュー] A Large Scale Randomized Controlled Trial on Herding in Peer-Review Discussions
本研究は、ICML 2020における査読討論における群衆行動(herding)を大規模な無作為化比較試験(RCT)で検証した。レビュー担当者を無作為に討論の開始者に割り当て、その影響を最終意思決定に与えるかを測定した。予想に反して、本研究では顕著な群衆行動効果は検出されなかった。すなわち、レビュー担当者の最終的意思決定は、討論の開始者の意見に著しく影響を受けることはなかった。これは、専門家による査読プロセスにおいて、社会的影響に対して高い耐性を示していることを示唆している。
Peer review is the backbone of academia and humans constitute a cornerstone of this process, being responsible for reviewing papers and making the final acceptance/rejection decisions. Given that human decision making is known to be susceptible to various cognitive biases, it is important to understand which (if any) biases are present in the peer-review process and design the pipeline such that the impact of these biases is minimized. In this work, we focus on the dynamics of between-reviewers discussions and investigate the presence of herding behaviour therein. In that, we aim to understand whether reviewers and more senior decision makers get disproportionately influenced by the first argument presented in the discussion when (in case of reviewers) they form an independent opinion about the paper before discussing it with others. Specifically, in conjunction with the review process of ICML 2020 -- a large, top tier machine learning conference -- we design and execute a randomized controlled trial with the goal of testing for the conditional causal effect of the discussion initiator's opinion on the outcome of a paper.
研究の動機と目的
- 査読討論において、最初に述べられた意見に著しく従う群衆行動(herding)が、学術会議における査読結果に影響を及ぼすかどうかを調査すること。
- 討論の開始者の身元(無作為に割り当てられた)が、特にハイリスクな機械学習会議において、レビュー担当者の最終的意思決定に因果的影響を及ぼすかどうかを評価すること。
- 査読討論における社会的影響が、特に領域責任者が討論の開始者を選んでいる場合に、意思決定の正確性や公平性を損なうかどうかを評価すること。
- 無作為割り当てと自己選択の両方の討論開始者を比較し、制御された実験的デザインを用いて、グループの合意形成に与える影響を評価すること。
- 既存の査読品質と信頼性に関する文献と照らして、結果を文脈づけるために、スコアの収束や合意の増加を含む、より広範な討論のダイナミクスを文書化すること。
提案手法
- ICML 2020の査読プロセス中に、一部の論文についてレビュー担当者を無作為に討論スレッドの開始者に割り当てる無作為化比較試験(RCT)を実施した。
- Microsoft Conference Management Toolkit(CMT)を用いて無作為化を実装し、非開始者レビュー担当者が干渉を認識しないようにすることで、自然な討論のダイナミクスを維持した。
- 最終意思決定に対する討論開始者の意見の因果的影響を、異なる開始者を持つ論文間で比較し、討論前のレビュー得点とレビュアーの専門性を制御することで測定した。
- 統計的分析を用いて、開始者の意見が独立した討論前のレビューの平均よりも、最終的なグループ意思決定をより強く予測するかを検証した。
- 討論のトランスクリプト、レビュアーの得点、最終的な受容/却認決定を収集・分析し、収束、合意、影響のパターンを評価した。
- 実世界の学術環境における方法論的厳密性と倫理的適合性を確保するため、事前登録された研究設計とIRB承認を取得した。
実験結果
リサーチクエスチョン
- RQ1査読討論において最初に述べられた意見が、レビュー担当者の最終的意思決定に顕著に影響を与えるか。これは、群衆行動を示唆する。
- RQ2討論開始者の意見が最終的意思決定に与える因果的影響が、討論前のレビュー得点の平均値よりも強いのか。
- RQ3無作為割り当ての討論開始者と自己選択の開始者とを比較した場合、グループの合意形成に与える影響はどのように異なるか。
- RQ4査読討論はレビュー担当者の間で合意をどの程度高めるか。また、その合意の向上は意思決定の正確性の向上を反映しているのか。
- RQ5討論開始者の身元(例:経験年数、意見の極端さ)が最終的意思決定に影響を与えるのか。もし影響を与えるならば、それは群衆行動によるものか、他の要因によるものか。
主な発見
- 顕著な群衆行動効果は検出されなかった。討論の開始者の意見は、討論前の独立したレビューの平均よりも、最終的なグループ意思決定を強く予測しなかった。
- 討論後、レビュアーの得点はグループの合意に収束した。これは、査読における社会的影響に関する先行研究と整合的である。
- 討論はレビュアー間の合意を高めたが、その合意の向上は、関連研究で以前に観察されたように、意思決定の正確性の向上を示さなかった。
- 群衆行動が認められなかったことから、機械学習会議における専門家レビュアーは、ヒューリスティックに基づく社会的影響よりも、合理的な議論に依存している可能性がある。
- 無作為に討論開始者を割り当てたことによる偏りの証拠は得られなかった。これは、領域責任者が開始者を選んでも、最終的意思決定に大きな影響を与えないことを示唆している。
- 本研究の結果は、専門的査読において強い社会的影響が働くという仮定に疑問を呈し、合理的な議論が一般的な認知バイアスを緩和する可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。