[論文レビュー] Inconsistency in Conference Peer Review: Revisiting the 2014 NeurIPS Experiment
この論文は2014年のNeurIPS査読実験を再検討し、査読者スコアの変動の50%が客観的質ではなく主観的判断に起因することを明らかにした。受理論文に関しては、質スコアと引用数の間に相関は認められなかったが、却下論文に関しては有意な相関が認められ、査読者が優れた論文を識別するより弱い論文を識別する能力に優れていることを示唆している。著者らは、明確なスコア基準の導入を提言するとともに、主観性を完全に排除すべきではないと警告し、研究者の質を評価する際の『トップクラスの国際会議』の地位への過度な依存を減らすよう促している。
In this paper we revisit the 2014 NeurIPS experiment that examined inconsistency in conference peer review. We determine that 50\% of the variation in reviewer quality scores was subjective in origin. Further, with seven years passing since the experiment we find that for \emph{accepted} papers, there is no correlation between quality scores and impact of the paper as measured as a function of citation count. We trace the fate of rejected papers, recovering where these papers were eventually published. For these papers we find a correlation between quality scores and impact. We conclude that the reviewing process for the 2014 conference was good for identifying poor papers, but poor for identifying good papers. We give some suggestions for improving the reviewing process but also warn against removing the subjective element. Finally, we suggest that the real conclusion of the experiment is that the community should place less onus on the notion of `top-tier conference publications' when assessing the quality of individual researchers. For NeurIPS 2021, the PCs are repeating the experiment, as well as conducting new ones.
研究の動機と目的
- 2014年のNeurIPS査読実験を再分析し、査読者スコアにおける主観性の役割を評価すること。
- 査読者による質スコアが、引用回数で測定される長期的論文インパactsと相関するかどうかを評価すること。
- 却下論文の出版運命を追跡し、そのスコアが今後のインパクトを予測できるかどうかを評価すること。
- 査読プロセスが高インパクト研究をどれだけ信頼性を持って特定できるかを評価し、改善策を提案すること。
- 研究者の質を評価する際のコミュニティのトップクラス国際会議論文への過度な依存を疑問視すること。
提案手法
- 著者らは、2014年のNeurIPS実験における補正済み査読者スコアを用い、シミュレーションスタディを通じて主観性を定量化した。
- 400件の受理論文および680件の却下論文の引用数をSemantic Scholarから収集し、長期的インパクトを測定した。
- 受理論文および却下論文のそれぞれについて、補正済み質スコアと引用数の相関を分析した。
- 個人のスコアを特定できないように可視化において微分散プライバシーを適用した。
- 元のNeurIPS 2013フレームワークからの信頼性スコアとインパクトスコアを分析し、予測力の差を比較した。
- タイトルと著者名の照合を用いて、Semantic Scholar上で却下論文の最終掲載会議を特定した。
実験結果
リサーチクエスチョン
- RQ1査読者質スコアの変動のうち、客観的論文質ではなく主観的解釈に起因する割合はどの程度か?
- RQ2NeurIPS 2014に受理された論文に関して、査読者質スコアと長期的引用インパクトの間に統計的に有意な相関があるか?
- RQ3より高い査読者スコアを獲得した却下論文は、より高い引用数を達成するのか? もしそうなら、これは査読者が弱い論文を優れた論文よりもよく識別できることを示唆するか?
- RQ4査読者の信頼性スコアと引用数の相関はどの程度か? これは引用成功の背後にある要因を示唆するか?
- RQ5査読プロセスは高インパクト研究をどれだけ信頼性を持って特定できるのか? また、その予測力はどのように向上できるか?
主な発見
- 査読者質スコアの変動の50%が、客観的論文質ではなく主観的解釈に起因していた。
- NeurIPS 2014に受理された論文に関しては、査読者質スコアと引用インパクトの間に統計的に有意な相関は認められなかった。
- 却下論文に関しては、査読者質スコアが高くなるほど引用数も有意に高くなる傾向があり、査読者が弱い論文を識別する能力に優れていることが示された。
- 信頼性スコアと引用数の間には中程度の有意相関(r = 0.25)が認められ、信頼性スコアが提示の明快さや洗練さを反映している可能性がある。
- 受理論文の平均引用数は却下論文よりも高かったが、これは当初の質スコアでは予測できなかった。
- 本研究の結論として、査読プロセスは低品質な研究を効果的にふnowするが、高インパクト研究を信頼性を持って特定するには失敗している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。