[論文レビュー] Expanding search in the space of empirical ML
この論文は、機械学習学会の文化を拡大し、アルゴリズムの新規性を超えて、データ、目的変数、実験的統合作業の価値を重視することを主張している。系統的なデータ、目的変数、実験的統合作業の認識を促進するため、新規性の再定義、合成およびオープンワールド実験のための専用トラックの創設、産学連携の促進を提言し、機械学習研究の再現性と現実世界への適用可能性を高めることを目的としている。
As researchers and practitioners of applied machine learning, we are given a set of requirements on the problem to be solved, the plausibly obtainable data, and the computational resources available. We aim to find (within those bounds) reliably useful combinations of problem, data, and algorithm. An emphasis on algorithmic or technical novelty in ML conference publications leads to exploration of one dimension of this space. Data collection and ML deployment at scale in industry settings offers an environment for exploring the others. Our conferences and reviewing criteria can better support empirical ML by soliciting and incentivizing experimentation and synthesis independent of algorithmic innovation.
研究の動機と目的
- アルゴリズムの新規性を重視するがゆえに、データおよび目的変数次元の実験的探求が軽視されるML学会のインcentiveの不均衡を是正すること。
- ベンチマーク中心のアルゴリズム比較を超えて、実世界のMLパフォーマンスに影響を与えるデータおよび目的変数の多様性が果たす、軽視されがちな役割を浮き彫りにすること。
- 合成、観察、オープンワールド実験といった非アルゴリズム的実験的貢献を支援・インcentivizeするため、学会文化および査読基準の構造的変更を提言すること。
- 産業界の実務者から得られる大規模かつ現実世界のデータおよびシステムパフォーマンス分析の価値を認識することで、再現性および実用的関連性を高めること。
- 産学連携の道筋をつくり、アルゴリズムの新規性を要件としない実務的知見を学術的議論に統合すること。
提案手法
- 研究分野全体を、目的変数、データ、アルゴリズムという3次元の探索空間として再定式化し、すべての次元が同等の方法論的注意を要することを主張する。
- 学会提出物における「新規性」の定義を再考し、多様なデータおよび目的変数において既存のアルゴリズムを比較した実験的研究からの知見を含めることを提言する。
- IEEE S&P SoKトラックおよびDistillの出版モデルを模倣した、系統的な統合、分類、根拠に基づく仮説の再検討に特化した専用トラックの設置を提唱する。
- 現実世界のデータおよび多様な条件下でのシステムパフォーマンスにアクセスできる産業界研究者から、オープンワールド実験結果の募集を促進する。
- 再現可能な実験的作業の障壁を低減するため、共有で代表的なデータセットおよび改善されたツールの整備を支援するが、こうしたツールが系統的な実験の必要性を代替するものではないことを強調する。
- アルゴリズム研究者とオープンワールド実験者との連携を促進し、既存モデルにおける実務的ギャップを特定・是正すること。
実験結果
リサーチクエスチョン
- RQ1ML学会は、アルゴリズム的革新を含まない実験的研究を、どのようによりよく認識・インcentivizeできるか?
- RQ2データおよび目的変数の次元は、MLシステムのパフォーマンスおよび一般化能にどのように影響を与えるのか。なぜこれらの次元は現在の研究文化において未だにあまり探求されていないのか?
- RQ3既存の学会フォーマットおよび査読基準は、どのように変更され、多様なデータセットおよび現実世界の環境において既知のアルゴリズムの合成および観察的研究を支援できるか?
- RQ4産業界の実務者からの知見を学術的議論に統合するためには、どのような構造的変更が必要か。特に、アルゴリズムの新規性を欠く研究においては?
- RQ5オープンワールド実験および共有データセットは、ML研究の再現性および実用的関連性をどのように向上させ得るか?
主な発見
- 現在の学会文化において、実験的ML研究は系統的に軽視されており、アルゴリズムの新規性を重視するあまり、データ、目的変数、システムレベルの実験的知見の価値が軽視されている。
- ベンチマークデータセットはしばしば固定的かつ代表的であると見なされるが、それらにはサンプリングばらつきやバイアスが含まれており、パフォーマンス測定および一般化能に顕著な影響を与える。
- ハイパーパramータチューニング、ランダムシード、コードベースの差異といった実験的ばらつきが系統的に報告または制御されない場合、再現性が損なわれる。
- 既存の研究では、十分なチューニングが施された古いモデルが新しいモデルを上回ることも示されており、報告された性能向上がアルゴリズム的進歩ではなく、実験的ノイズに起因する可能性があることを示している。
- IEEE S&P SoKトラックやDistillにおけるような合成および観察的研究は、非アルゴリズム的貢献がシステム動作、パフォーマンスパターン、長年の仮説に対する高影響力の知見をもたらしうることを示している。
- 産業界の研究者は現実世界の導入経験から貴重な実験的知識を有しているが、インセンティブと出版規範の不一致のため、しばしば学術的議論から除外されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。