[论文解读] Calibrated ensembles can mitigate accuracy tradeoffs under distribution shift
本文提出ID校准集成方法——在集成前对标准模型和鲁棒模型在分布内(ID)数据上进行校准,从而在11个自然分布偏移数据集上实现了ID和分布外(OOD)准确率的最先进性能。该方法实现了双重优势:ID准确率达到90.3%,OOD准确率达到74.5%,优于单个模型和先前的自训练方法,且无需使用OOD数据。
We often see undesirable tradeoffs in robust machine learning where out-of-distribution (OOD) accuracy is at odds with in-distribution (ID) accuracy: a robust classifier obtained via specialized techniques such as removing spurious features often has better OOD but worse ID accuracy compared to a standard classifier trained via ERM. In this paper, we find that ID-calibrated ensembles -- where we simply ensemble the standard and robust models after calibrating on only ID data -- outperforms prior state-of-the-art (based on self-training) on both ID and OOD accuracy. On eleven natural distribution shift datasets, ID-calibrated ensembles obtain the best of both worlds: strong ID accuracy and OOD accuracy. We analyze this method in stylized settings, and identify two important conditions for ensembles to perform well both ID and OOD: (1) we need to calibrate the standard and robust models (on ID data, because OOD data is unavailable), (2) OOD has no anticorrelated spurious features.
研究动机与目标
- 解决鲁棒机器学习中常见的准确率权衡问题,即鲁棒模型为提升分布外(OOD)性能而牺牲了分布内(ID)准确率。
- 开发一种通用且数据高效的策略,无需使用OOD数据即可同时提升ID和OOD准确率。
- 探究集成校准后的标准与鲁棒模型是否能缓解自然分布偏移下的ID-OOD准确率权衡问题。
- 识别ID校准集成在何种条件下成功或失败,特别是分布偏移下虚假特征相关性的影响。
提出的方法
- 使用温度缩放法在分布内(ID)验证数据上分别对标准模型和鲁棒模型进行校准,以提升置信度校准效果。
- 通过简单平均其预测结果来集成已校准的标准与鲁棒模型,该方法在校准后理论上对ID性能最优。
- 仅使用ID数据进行校准,避免对OOD数据的依赖,这在实际中通常不可行。
- 在ID和OOD测试集上评估集成模型,以衡量其在分布偏移下的性能表现。
- 在具有独立信号的简化设定中进行分析,推导出方法成功所需的理论条件。
- 将ID校准集成与替代的集成策略(如在ID数据上微调的加权集成)以及自训练基线方法进行比较。
实验结果
研究问题
- RQ1在不使用OOD数据的前提下,集成校准后的标准与鲁棒模型是否能同时提升分布内和分布外准确率?
- RQ2在何种分布偏移条件下,ID校准集成优于单个模型和先前的最先进方法?
- RQ3为何ID校准集成在自然分布偏移下表现良好,但在具有反相关虚假特征的对抗性合成偏移下失败?
- RQ4在ID数据上的模型校准在实现更高ID和OOD性能方面起到了何种作用?
主要发现
- 在11个自然分布偏移数据集上,ID校准集成实现了90.3%的分布内准确率和74.5%的分布外准确率,优于标准模型(88.7% ID,65.2% OOD)和鲁棒模型(86.8% ID,72.3% OOD)。
- 尽管未使用任何额外的无标签数据,该方法仍优于基于自训练的先前最先进方法。
- 在自然分布偏移下,当虚假特征在OOD中不与ID反相关时,ID校准集成消除了ID-OOD准确率的权衡。
- 当OOD偏移下虚假特征与ID反相关时,集成方法失败,其OOD准确率介于标准模型与鲁棒模型之间,与理论预期一致。
- 在ID数据上的校准显著降低了期望校准误差(ECE),但OOD校准仍然较差,表明仅靠ID校准不足以实现OOD校准。
- 简单集成已校准模型的表现优于经过微调的加权集成,表明最优组合是通过校准而非超参数调优实现的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。