QUICK REVIEW
[论文解读] Our Evaluation Metric Needs an Update to Encourage Generalization
Swaroop Mishra, Anjana Arunkumar|arXiv (Cornell University)|Jul 14, 2020
Adversarial Robustness in Machine Learning参考文献 44被引用 4
一句话总结
本文提出 WOOD Score,一种新颖的评估指标,通过基于测试样本与训练数据的语义文本相似度(STS)对测试样本进行加权,使分布外(OOD)样本获得更高权重。通过促使模型在更难、更具 OOD 特性的样本上取得高分,WOOD 降低了基准准确率,抑制了性能膨胀,从而鼓励模型具备更强的泛化能力,而非依赖虚假模式。
ABSTRACT
Models that surpass human performance on several popular benchmarks display significant degradation in performance on exposure to Out of Distribution (OOD) data. Recent research has shown that models overfit to spurious biases and `hack' datasets, in lieu of learning generalizable features like humans. In order to stop the inflation in model performance -- and thus overestimation in AI systems' capabilities -- we propose a simple and novel evaluation metric, WOOD Score, that encourages generalization during evaluation.
研究动机与目标
- 解决标准基准测试中因性能膨胀而导致的 AI 模型能力被高估的问题。
- 利用与训练数据的语义文本相似度(STS)识别并量化测试样本的分布外(OOD)特征程度。
- 开发一种评估指标,通过更重视更难、更具 OOD 特性的样本,主动促使模型实现泛化。
- 通过将评估重点转向在多样化、语义上不相似的数据上的鲁棒性,减少基准准确率的膨胀。
- 提供一种可扩展、数据驱动的方法,在评估过程中控制 OOD 严重程度,而无需依赖外部 OOD 数据集。
提出的方法
- 使用预训练的句子嵌入计算每个测试样本与所有训练样本之间的成对 STS。
- 根据测试样本与前 b% 最相似的训练样本的平均 STS 对其进行排序,以估计 OOD 严重程度。
- 将样本的 OOD 程度(p)定义为与最相似训练样本的平均 STS 的倒数,使用超参数 a 和 b。
- 提出 WOOD Score 作为加权评估指标:$ W_{opt} = abla_{X_{ ext{Test}}} E_i p_i $,其中 $ p_i $ 随 OOD 严重程度增加而增大。
- 将 WOOD 准确率($ W_{acc} $)定义为加权和:$ A_1 + 2A_2 + 3A_3 $,其中 $ A_1, A_2, A_3 $ 分别为在低、中、高 OOD 程度样本上的准确率。
- 基于 STS 将测试集划分为七个分层区间,以评估模型在不同分布偏移程度下的性能。
实验结果
研究问题
- RQ1语义文本相似度(STS)能否有效区分 NLP 基准测试中的分布内(IID)与分布外(OOD)样本?
- RQ2随着基于 STS 的 OOD 严重程度增加,模型性能下降的程度如何?是否可量化?
- RQ3一种通过提高 OOD 样本权重来增强其重要性的加权评估指标,能否减少基准准确率的膨胀并促进泛化?
- RQ4在不同 OOD 严重程度水平下,WOOD Score 在多种模型(如 BERT、RoBERTa、CNN、LSTM)和数据集(如 SST-2、IMDb)上的表现如何?
- RQ5所提出的指标能否指导数据增强和对比集构建,以提升模型鲁棒性?
主要发现
- 测试样本与训练数据之间的 STS 能有效区分 OOD 与 IID 样本,较低的 STS 对应更高的 OOD 严重程度。
- WOOD Score 在 SST-2(IID)和 IMDb(OOD)上的十个模型中均显著降低了基准准确率,表明由于更重视困难样本,性能出现下降。
- 当测试样本与训练数据的 STS 较低时,模型在错误预测上的 softmax 概率更高,表明 OOD 样本更可能被误分类。
- 随着 STS 降低,错误分类的数量增加,证实较低相似度与更高预测难度相关。
- 该指标在 b(考虑的前多少训练样本)取值变化时表现稳健,消融研究中观察到一致的性能趋势。
- WOOD Score 使得同一数据集可同时用作 IID 和 OOD 评估集,通过基于 STS 的分层划分实现,无需依赖外部 OOD 数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。