[論文レビュー] An Open Review of OpenReview: A Critical Analysis of the Machine Learning Conference Review Process
本研究は、2017–2020年のICLR査読プロセスを公開データを用いて批判的に分析し、論文の質やトピックを制御しても、強い機関バイアスと顕著な性別格差(スコアと受入率の面で)が存在することを明らかにした。2020年の再現性は中程度(66%)であったが、査読スコアと引用インパクトの相関は低く、受入率は時間経過とともに低下しており、査読における構造的不平等が示唆される。
Mainstream machine learning conferences have seen a dramatic increase in the number of participants, along with a growing range of perspectives, in recent years. Members of the machine learning community are likely to overhear allegations ranging from randomness of acceptance decisions to institutional bias. In this work, we critically analyze the review process through a comprehensive study of papers submitted to ICLR between 2017 and 2020. We quantify reproducibility/randomness in review scores and acceptance decisions, and examine whether scores correlate with paper impact. Our findings suggest strong institutional bias in accept/reject decisions, even after controlling for paper quality. Furthermore, we find evidence for a gender gap, with female authors receiving lower scores, lower acceptance rates, and fewer citations per paper than their male counterparts. We conclude our work with recommendations for future conference organizers.
研究の動機と目的
- 2017–2020年のICLR査読プロセスにおける再現性とランダムネスを調査すること。
- 査読スコアが、引用数で測定した実際の論文インパクトとどの程度相関するかを評価すること。
- 査読プロセスの整合性、再現性、インパクトとの相関性が時間経過とともに低下しているかどうかを検証すること。
- 特に著名な機関に有利な傾向がある、分野責任者による意思決定における機関バイアスを特定すること。
- トピックや質を制御しても、性別格差が査読スコア、受入率、引用インパクトの面で存在するかどうかを調査すること。
提案手法
- ICLR 2017–2020の論文について、OpenReview、arXiv、SemanticScholar、およびCS Rankingsによる機関ランクを含むデータを収集・整備した。
- 異なる査読者数や構成における結果の再現性を定量化するためにモンテカルロシミュレーションを用いた。
- 重回帰分析やノンパラメトリック検定(例:マン・ホイットニーU検定)を用いて、性別および機関バイアスを評価した。
- 分析におけるトピック分布の制御のため、手動でキーワードをカスタマイズして12のトピックに分類した。
- 名前ベースおよびウェブベースのヒューリスティクスを用いて、最初の著者および最後の著者の性別ラベルを割り当てたが、制限を認識した。
- 引用インパクトはSemanticScholarデータを用いて測定し、重複の解消には編集距離と手動でのキュレーションを適用した。
実験結果
リサーチクエスチョン
- RQ1異なる査読者セットにおいて、ICLR査読プロセスはどの程度再現可能か?
- RQ2査読スコアは、受入論文の実際の引用インパクトをどの程度うまく予測できるか?
- RQ32017–2020年の期間を通じて、査読プロセスの整合性と公平性は低下しているか?
- RQ4著名な機関の論文が査読スコアにかかわらず受入されやすいという機関バイアスの証拠はあるか?
- RQ5トピックや質を制御しても、性別格差が査読スコア、受入率、引用インパクトの面に存在するか?
主な発見
- 2020年のICLR査読プロセスでは66%の再現性を示し、中程度の整合性を示したが、著者らが強く感じているランダムネスとは一致しない。
- 査読スコアと実際の引用インパクトの相関は弱く、スコアが長期的論文インパクトの予測因子として劣っていることを示唆している。
- 著名な機関の論文は、査読スコアを制御しても顕著に高い受入率を示しており、強い機関バイアスが存在することが明らかになった。
- 女性の最初の著者は、男性の最初の著者に比べて平均0.16ポイント低いスコアを獲得した(p = 0.085)、かつ受入率も低かった(22.1% vs. 27.6%)。
- トピック分布を制御しても、女性の実際の受入率(22.1%)は、男性と同様のトピックごとの受入率を想定した場合の期待値(27.8%)を下回っており、構造的格差が存在することが示された。
- 女性はICLRにおいて過小代表化されていた:2020年時点で最初の著者に占める女性の割合は10.6%、最後の著者に占める女性の割合は9.7%であったが、米国のCS博士課程学生のうち23.2%が女性であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。