[论文解读] Quantifying Reproducibility in NLP and ML
本文通过采用计量学国际计量词汇手册(VIM)的定义,提出了一套标准化、可量化的框架,用于评估自然语言处理(NLP)和机器学习(ML)中的可复现性。通过应用‘重复性’、‘可复现性’以及‘变异系数’(CV*)等术语,该框架实现了对不同研究中结果一致性的可度量、可比较的评估——例如,wF1得分中3.8%的CV*表明存在中等程度的变异,这挑战了‘通用科学术语不适用于ML/NLP’的假设。
Reproducibility has become an intensely debated topic in NLP and ML over recent years, but no commonly accepted way of assessing reproducibility, let alone quantifying it, has so far emerged. The assumption has been that wider scientific reproducibility terminology and definitions are not applicable to NLP/ML, with the result that many different terms and definitions have been proposed, some diametrically opposed. In this paper, we test this assumption, by taking the standard terminology and definitions from metrology and applying them directly to NLP/ML. We find that we are able to straightforwardly derive a practical framework for assessing reproducibility which has the desirable property of yielding a quantified degree of reproducibility that is comparable across different reproduction studies.
研究动机与目标
- 解决自然语言处理(NLP)和机器学习(ML)领域中可复现性术语和定义缺乏共识的问题。
- 挑战‘通用科学可复现性定义不适用于NLP/ML’的假设。
- 开发一种实用的、可量化的可复现性评估框架,支持跨研究比较。
- 为基于指标和人工评估的结果建立预期变异的基线。
- 通过量化结果的接近程度而非使用二元的‘可复现/不可复现’判断,提升评估实践的可信度。
提出的方法
- 采用国际计量词汇手册(VIM)中关于‘重复性’、‘可复现性’和‘被测量量’的定义,将其映射到NLP/ML语境中。
- 使用变异系数(CV*)作为标准化指标,量化重复测量中的变异程度,其中CV* =(标准差 / 均值)× 100。
- 将该框架应用于物理测量(如扭矩重量)和NLP结果(如加权F1得分)以验证其适用性。
- 定义测量的‘条件’(如数据、代码、硬件、软件),以标准化可复现性评估并支持重复性测试。
- 通过将人工评估者视为具有固有变异性测量系统,将框架扩展至人工评估。
- 证明即使在小样本量(如人工评估中n=2)的情况下,CV*仍能提供可靠且可比较的变异度量。
实验结果
研究问题
- RQ1能否有意义地将计量学中的标准科学术语和定义应用于NLP和ML的可复现性?
- RQ2如何以一种可直接比较的方式量化可复现性,从而实现不同NLP/ML研究之间的对比?
- RQ3在NLP/ML中,基于指标和人工评估的结果,典型的变异程度(以CV*衡量)是多少?
- RQ4数据、代码和团队差异等条件如何影响可复现性评估?
- RQ5基于VIM定义的框架能否提高ML和NLP中可复现性评估的可靠性和一致性?
主要发现
- 在一项可复现性研究中,加权F1得分的变异系数(CV*)为3.8%,表明尽管已完全共享代码和数据,仍存在中等程度的变异。
- 在近期调查中,仅有14%的原始结果与复现结果对完全相同,凸显了持续存在的残余变异。
- CV*指标即使在小样本量(如人工评估中n=2)的情况下,也能提供可靠且可比较的变异度量。
- 在明确定义的条件下进行重复性测试,有助于估计基线变异,这对有意义的可复现性评估至关重要。
- 该框架实现了对不同研究中可复现性的量化、可比较评估,超越了二元的‘可复现/不可复现’判断。
- 本研究证明,来自计量学的通用科学术语适用于NLP和ML,并具有显著益处,从而挑战了长期以来认为需要不同定义的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。