[论文解读] Can You Rely on Your Model Evaluation? Improving Model Evaluation with Synthetic Test Data
本文提出3S-Testing,一种深度生成建模框架,通过生成合成测试数据来提升机器学习模型在低频子群和分布偏移情况下的评估效果。通过利用条件生成模型和基于深度生成集成的不确定性量化,3S-Testing在低样本场景下相比仅使用真实测试数据,能提供更准确的性能估计并实现更好的真实性能覆盖范围。
Evaluating the performance of machine learning models on diverse and underrepresented subgroups is essential for ensuring fairness and reliability in real-world applications. However, accurately assessing model performance becomes challenging due to two main issues: (1) a scarcity of test data, especially for small subgroups, and (2) possible distributional shifts in the model's deployment setting, which may not align with the available test data. In this work, we introduce 3S Testing, a deep generative modeling framework to facilitate model evaluation by generating synthetic test sets for small subgroups and simulating distributional shifts. Our experiments demonstrate that 3S Testing outperforms traditional baselines -- including real test data alone -- in estimating model performance on minority subgroups and under plausible distributional shifts. In addition, 3S offers intervals around its performance estimates, exhibiting superior coverage of the ground truth compared to existing approaches. Overall, these results raise the question of whether we need a paradigm shift away from limited real test data towards synthetic test data.
研究动机与目标
- 为解决因真实测试数据有限而导致的少数子群模型评估不可靠的问题。
- 实现对可能未被现有真实测试数据捕获的合理分布偏移下模型性能的稳健评估。
- 开发一个为高风险表格型机器学习应用提供细粒度、可靠且具备不确定性量化的性能估计框架。
- 减少对平均性能指标的过度依赖,这些指标会掩盖不同子群之间的性能差异。
- 证明合成测试数据在估计罕见或发生分布偏移的子群真实模型性能方面可优于真实测试数据。
提出的方法
- 3S-Testing采用条件深度生成模型,为由敏感特征或操作特征定义的特定子群(如种族、年龄、职业类型)生成合成测试数据。
- 该框架使用深度生成集成(DGE)对生成过程中的不确定性进行建模,生成性能估计的预测区间。
- 条件生成由用户指定的子群条件或分布偏移目标(如平均年龄增加或非美国居民比例提高)引导。
- 该方法支持最小输入(如子群定义)和先验知识(如目标偏移分布)两种配置,实现灵活部署。
- 性能通过平均绝对误差(MAE)和预测区间内真实性能的覆盖比例等指标进行评估。
- 该方法在Adult等表格型数据集上进行了验证,与真实测试数据及基线方法(如自助采样和逻辑回归)进行了对比。

实验结果
研究问题
- RQ1在真实测试样本有限的少数子群上,合成测试数据能否提升模型性能估计的准确性?
- RQ2合成数据在原始测试集中未包含的分布偏移下,能否有效捕捉模型性能?
- RQ33S-Testing生成的预测区间是否能在低数据场景下可靠覆盖真实性能?
- RQ4在估计子群性能和偏移敏感性方面,3S-Testing与真实测试数据及基线方法相比表现如何?
- RQ5合成数据在多大程度上可降低在安全关键应用中高估模型可靠性的风险?
主要发现
- 在小样本子群上,3S-Testing显著优于仅使用真实测试数据的性能估计,平均绝对误差更低(例如,在Adult数据集中1%子群上,3S的MAE为1.11 ± 0.71,而真实数据为8.61)。
- 3S-Testing生成的预测区间在各子群中实现了更优的真实性能覆盖,95%的覆盖率,优于常出现覆盖不足或过度覆盖的基线方法。
- 对于如平均年龄增加或非美国居民比例提高等分布偏移,3S-Testing生成的性能估计优于真实数据或基线方法。
- 该框架成功识别出特定交叉子群的性能不足(如每周工作超80小时的自雇人士),而真实数据因样本稀疏而无法识别。
- 通过3S-Testing生成的模型敏感性曲线揭示了性能在不同运行范围内的趋势,例如随着受教育年限增加或非裔美国人比例上升,性能下降。
- 3S-Testing在多种场景下表现出鲁棒性,包括仅输入子群定义的最小配置和具备先验知识的目标偏移分布配置,展现出广泛适用性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。