Skip to main content
QUICK REVIEW

[論文レビュー] We need to talk about random seeds

Steven Bethard|arXiv (Cornell University)|Oct 24, 2022
Machine Learning and Data Classification被引用数 5
ひとこと要約

この見解論文は、自然言語処理(NLP)研究におけるランダムシードの使用がしばしば誤用されていると主張している。特に、再現性のための固定シードの使用や、パフォーマンス分布を生成するためにシードのみを用いることが問題視されている。著者らは85篇のACL Anthology論文を分析し、その半数以上がリスクを伴う方法でシードを使用していることを発見。シードを最適化すべきハイパーパrameterと見なすようコミュニティに提言している。

ABSTRACT

Modern neural network libraries all take as a hyperparameter a random seed, typically used to determine the initial state of the model parameters. This opinion piece argues that there are some safe uses for random seeds: as part of the hyperparameter search to select a good model, creating an ensemble of several models, or measuring the sensitivity of the training algorithm to the random seed hyperparameter. It argues that some uses for random seeds are risky: using a fixed random seed for "replicability" and varying only the random seed to create score distributions for performance comparison. An analysis of 85 recent publications from the ACL Anthology finds that more than 50% contain risky uses of random seeds.

研究の動機と目的

  • NLPニューラルネットワーク研究におけるランダムシードの一般的な使用法を特定・分類すること。
  • モデル学習および評価の文脈において、ランダムシードの使用が安全かリスクを伴うかを区別すること。
  • 特に固定シードの使用や、シードのみによるパフォーマンス比較といった、広範にわたるランダムシードの誤用を強調すること。
  • NLPにおける再現性とモデル評価の向上を目指し、より良いトレーニング、レビュー、著者行動の実践を提唱すること。
  • 特にランダムシードを含むハイパーパrameterの取り扱いについて、より広いコミュニティの議論を開始すること。

提案手法

  • NLPにおけるランダムシードの5つの一般的な用途(モデル選択、アンサンブル作成、感度分析、固定シード使用、シード変動によるパフォーマンス比較)を体系化した分類法を開発した。
  • ACL Anthologyに掲載された最近のNLP論文85篇を手動でレビューし、分類法の各カテゴリに分類した。
  • 保守的な検索戦略を採用し、関連論文を特定するためにテキストに「ニューラルネットワーク」と「ランダムシード」の両方が明示的に記載されていることを条件とした。
  • テキスト的証拠に基づき、各論文を主カテゴリに割り当てた。根拠のスプレッドシートは公開済みである。
  • 2015年から2021年までの期間における傾向を分析し、リスクを伴うシード使用が減少しているか、それとも継続しているかを評価した。
  • 定性的分析と引用文献のレビューを用いて、研究実践の改善を支援するための提言を文脈的に裏付けた。

実験結果

リサーチクエスチョン

  • RQ1現代のNLP研究におけるランダムシードの一般的な使用法は何か?
  • RQ2モデル開発および評価の文脈において、ランダムシードの使用が安全かリスクを伴うかはどのように区別できるか?
  • RQ3リスクを伴うランダムシードの使用は、最近のNLP文献においてどれほど広がっているか?
  • RQ4ACL Anthologyにおいて、リスクを伴うランダムシード使用の頻度は時間経過とともに減少しているか?
  • RQ5NLP研究におけるランダムシードの誤用を減らすために、制度的および個人の責任は何か?

主な発見

  • 調査された85篇のNLP論文の50%以上(48/85)が、リスクを伴う方法でランダムシードを使用しており、そのうち24篇が単一の固定シードを使用、残り24篇がシードの変動のみを用いてパフォーマンスを比較していた。
  • 2015年から2021年までの間、リスクを伴うシード使用の割合は安定しており、誤用の減少は見られなかった。
  • 固定シードの使用はしばしば「再現性」を確保するためのものと正当化されているが、これは誤解を招く。なぜなら、同じシードであっても、ハードウェアやソフトウェアの差異により再現性が崩れることがあるからである。
  • 単一の固定シードを使用すると、モデルの真の能力が過小評価される。なぜなら、最適な初期化が得られるとは限らず、特定のランダムシードでは最適な性能が達成されない可能性があるからである。
  • 学習率やドロップアウト率と同様に、ランダムシードを最適化すべきハイパーパrameterと見なすことで、より良いモデル性能が得られることを、著者らが引用する先行研究が示している。
  • 本分析は保守的であり、『ランダムシード』が明示的に記載されている論文のみを対象としているため、全体の文献におけるリスクを伴うシード使用の真の頻度は、さらに高い可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。