Skip to main content
QUICK REVIEW

[論文レビュー] NIPS - Not Even Wrong? A Systematic Review of Empirically Complete Demonstrations of Algorithmic Effectiveness in the Machine Learning and Artificial Intelligence Literature

Franz J. Király, Bilal A. Mateen|arXiv (Cornell University)|Dec 18, 2018
Explainable Artificial Intelligence (XAI)参考文献 76被引用数 5
ひとこと要約

このシステマティックレビューは、2017年NeurIPS会議の教師あり学習論文121篇におけるアルゴリズム効果性に関する主張の実証的厳密性を評価している。その結果、最先端のベースラインに対する優位性を主張する完全な論理的展開を提示した論文はわずか2篇(1.6%)にとどまり、トップクラスの機械学習/AI研究における報告基準と実証的検証の不足が広範に見られることが明らかになった。

ABSTRACT

Objective: To determine the completeness of argumentative steps necessary to conclude effectiveness of an algorithm in a sample of current ML/AI supervised learning literature. Data Sources: Papers published in the Neural Information Processing Systems (NeurIPS, née NIPS) journal where the official record showed a 2017 year of publication. Eligibility Criteria: Studies reporting a (semi-)supervised model, or pre-processing fused with (semi-)supervised models for tabular data. Study Appraisal: Three reviewers applied the assessment criteria to determine argumentative completeness. The criteria were split into three groups, including: experiments (e.g real and/or synthetic data), baselines (e.g uninformed and/or state-of-art) and quantitative comparison (e.g. performance quantifiers with confidence intervals and formal comparison of the algorithm against baselines). Results: Of the 121 eligible manuscripts (from the sample of 679 abstracts), 99\% used real-world data and 29\% used synthetic data. 91\% of manuscripts did not report an uninformed baseline and 55\% reported a state-of-art baseline. 32\% reported confidence intervals for performance but none provided references or exposition for how these were calculated. 3\% reported formal comparisons. Limitations: The use of one journal as the primary information source may not be representative of all ML/AI literature. However, the NeurIPS conference is recognised to be amongst the top tier concerning ML/AI studies, so it is reasonable to consider its corpus to be representative of high-quality research. Conclusion: Using the 2017 sample of the NeurIPS supervised learning corpus as an indicator for the quality and trustworthiness of current ML/AI research, it appears that complete argumentative chains in demonstrations of algorithmic effectiveness are rare.

研究の動機と目的

  • 新しい機械学習/AIアルゴリズムが有効であると結論づけるために必要な論理的展開の完全性を評価すること。
  • トップクラスの機械学習会議における教師あり学習論文が、アルゴリズムの優位性を主張するにあたって十分な実証的証拠を提供しているかどうかを評価すること。
  • 機械学習/AI研究におけるベースラインの報告、性能指標、統計的比較の欠落要因を同定すること。
  • 現在の出版慣行が、不完全または誤解を招く効果性に関する主張を助長しているかどうかを検討すること。
  • 機械学習/AI研究の信頼性と再現可能性を高めるために、報告基準の改善を提言すること。

提案手法

  • NeurIPS 2017の679件の要旨を系統的にスクリーニングし、対象となる教師あり学習研究を同定した。
  • 表形式データ向けの(準)教師ありモデル、またはそれらと統合された前処理手法を報告した121件の論文を選定した。
  • 三段階の評価フレームワークを適用した:実験(実データ/合成データ)、ベースライン(無知ベースライン/最先端ベースライン)、定量的比較(信頼区間を伴う性能指標および形式的検定)。
  • 3名の独立したレビュアーが、事前に定義された基準に従って各論文の論理的完全性を評価した。
  • スクリーニングおよび本文評価の段階で生じた意見の相違は、コンセンサス形成と第三者の仲裁を用いて解決した。
  • レビューレビュー後、論文群全体にわたる報告の欠落を定量化する統計的分析を実施した。

実験結果

リサーチクエスチョン

  • RQ1NeurIPS 2017における教師あり学習論文は、アルゴリズム効果性に関する完全な実証的根拠をどの程度提示しているか?
  • RQ2トップクラスの機械学習論文において、無知ベースライン、最先端ベースライン、信頼区間、形式的統計的比較はどの程度の頻度で報告されているか?
  • RQ3NeurIPS 2017論文群のうち、完全に検証可能で科学的に妥当なアルゴリズム優位性の根拠を提示している論文の割合はどの程度か?
  • RQ4既に確立された評価基準が利用可能であるにもかかわらず、なぜ大多数の機械学習/AI論文が完全な論理的展開を提示できないのか?
  • RQ5機械学習/AI研究において、「まったく正しくない」主張が広範に見られる背景にある、出版およびレビュー慣行上のシステム的問題は何か?

主な発見

  • 121件の対象論文のうち、わずか2件(1.6%)が、新しいアルゴリズムが有効であるという主張を裏付ける完全な論理的展開を提示した。
  • 99%の論文が実世界データを用いていたが、合成データを用いたのはたった29%にとどまり、系統的なアブレーションが行われていないことがうかがえる。
  • 91%の論文が無知ベースラインを報告しておらず、55%が最先端ベースラインを報告しており、比較的厳密性に欠けていることが示された。
  • 性能指標の信頼区間を報告したのはたった32%にとどまり、その計算に関する正当性や参考文献の提示は一切なかった。
  • 正式な統計的比較を実施したのはわずか3%の論文にとどまり、性能差の有意性を検証していなかった。
  • 本研究の結論として、高影響力の機械学習/AI研究において、アルゴリズム効果性に関する完全な実証的根拠は稀であり、多くの主張は基礎的証拠の欠如により「まったく正しくない」ものであると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。