[论文解读] We need to talk about random seeds
本文观点论文指出,神经网络中的随机种子在自然语言处理(NLP)研究中常被误用,尤其是在固定种子用于‘可复现性’以及仅通过随机种子生成性能分布方面。作者分析了85篇ACL文集论文,发现超过50%的论文以高风险方式使用随机种子,呼吁学术界将随机种子视为需优化的超参数,而非随意固定的参数。
Modern neural network libraries all take as a hyperparameter a random seed, typically used to determine the initial state of the model parameters. This opinion piece argues that there are some safe uses for random seeds: as part of the hyperparameter search to select a good model, creating an ensemble of several models, or measuring the sensitivity of the training algorithm to the random seed hyperparameter. It argues that some uses for random seeds are risky: using a fixed random seed for "replicability" and varying only the random seed to create score distributions for performance comparison. An analysis of 85 recent publications from the ACL Anthology finds that more than 50% contain risky uses of random seeds.
研究动机与目标
- 识别并分类NLP神经网络研究中随机种子的常见用法。
- 区分随机种子在模型训练与评估中安全与高风险应用之间的差异。
- 突出NLP论文中随机种子的广泛误用,特别是固定种子使用和仅通过种子变化进行性能比较。
- 倡导改进训练、评审与作者实践,以提升NLP中的可复现性与模型评估质量。
- 推动学术界就超参数处理展开更广泛的讨论,尤其针对随机种子。
提出的方法
- 开发了NLP中随机种子五种常见用法的分类体系:模型选择、集成模型构建、敏感性分析、固定种子使用,以及通过种子变化进行性能比较。
- 对ACL文集中85篇近期NLP论文进行了人工审查,将其随机种子使用方式归类至上述分类体系。
- 采用保守的搜索策略,要求论文文本中同时明确提及‘neural network’和‘random seed’以识别相关论文。
- 基于文本证据,为每篇论文分配一个主要类别,相关理由的详细表格已公开。
- 分析2015至2021年间的趋势,评估高风险种子使用是否有所减少或持续存在。
- 结合定性分析与引用文献回顾,为研究发现提供背景支持,并提出改进研究实践的建议。
实验结果
研究问题
- RQ1现代NLP研究中,随机种子的常见使用方式有哪些?
- RQ2在模型开发与评估背景下,哪些随机种子使用方式被视为安全,哪些被视为高风险?
- RQ3近期NLP文献中,高风险随机种子使用行为的普遍程度如何?
- RQ4在ACL文集中,高风险随机种子使用频率是否随时间推移而减少?
- RQ5在机构与个人层面上,存在哪些责任以减少NLP研究中随机种子的误用?
主要发现
- 在所审查的85篇NLP论文中,超过50%(48篇)以高风险方式使用随机种子,其中24篇使用单一固定种子,24篇仅通过种子变化进行性能比较。
- 从2015年到2021年,高风险种子使用比例保持稳定,表明误用行为在时间上并未显著减少。
- 固定种子使用常被解释为确保‘可复现性’,但这种说法具有误导性,因为即使使用相同种子,硬件与软件差异仍可能导致复现失败。
- 在单一固定种子下,模型性能被低估,因为模型的真实能力取决于最优初始化,而单一随机种子可能无法实现该最优状态。
- 将随机种子视为需优化的超参数(如同学习率或dropout率)可带来更好的模型性能,这一观点在作者引用的前期研究中已有支持。
- 本分析具有保守性,仅包含明确提及‘random seed’的论文,表明在更广泛的文献中,高风险种子使用的实际普遍程度可能更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。