[论文解读] Angular Visual Hardness
本文提出了一种新型样本硬度度量方法——角视觉硬度(Angular Visual Hardness, AVH),通过输入样本的特征嵌入与分类器权重向量之间的归一化夹角距离来衡量卷积神经网络(CNN)中样本的难度。AVH与人类视觉硬度具有强相关性,在自训练和领域泛化任务中优于传统置信度度量方法,展现出更优的校准性能与在困难样本上的表现。
Recent convolutional neural networks (CNNs) have led to impressive performance but often suffer from poor calibration. They tend to be overconfident, with the model confidence not always reflecting the underlying true ambiguity and hardness. In this paper, we propose angular visual hardness (AVH), a score given by the normalized angular distance between the sample feature embedding and the target classifier to measure sample hardness. We validate this score with an in-depth and extensive scientific study, and observe that CNN models with the highest accuracy also have the best AVH scores. This agrees with an earlier finding that state-of-art models improve on the classification of harder examples. We observe that the training dynamics of AVH is vastly different compared to the training loss. Specifically, AVH quickly reaches a plateau for all samples even though the training loss keeps improving. This suggests the need for designing better loss functions that can target harder examples more effectively. We also find that AVH has a statistically significant correlation with human visual hardness. Finally, we demonstrate the benefit of AVH to a variety of applications such as self-training for domain adaptation and domain generalization.
研究动机与目标
- 为解决深度学习中缺乏可靠、语义感知的置信度度量方法,特别是针对决策边界附近的困难样本。
- 开发一种可扩展的、无需显式人工标注的人类视觉硬度代理指标。
- 探究在困难样本上性能提升是否与更好的泛化能力和模型校准相关。
- 评估AVH在自训练框架中用于领域自适应与领域泛化任务的实用性。
- 探索标准交叉熵损失在优化夹角边界与提升困难样本泛化能力方面的局限性。
提出的方法
- AVH通过计算输入样本的深层特征嵌入与真实类别分类器权重向量之间的归一化夹角距离来计算。
- 通过与其他所有类别的夹角距离进行归一化,确保方法的鲁棒性与尺度不变性。
- AVH得分基于特征向量与目标分类器权重之间的余弦相似度,经由与其他所有类别夹角距离的调整得到。
- 在自训练框架中将AVH用作置信度代理,通过优先选择更困难、置信度更低的样本进行伪标签选择。
- 提出一种基于AVH的损失函数,用于领域泛化任务,定义为温度缩放的softmax函数,形式为:$\mathcal{L}_{AVH} = \sum_i \frac{\exp(s(\pi - \mathcal{A}(\mathbf{x}_i, \mathbf{w}_{y_i})))}{\sum_k \exp(s(\pi - \mathcal{A}(\mathbf{x}_i, \mathbf{w}_k)))}$。
- 在ImageNet、PACS及领域自适应基准上,使用标准CNN架构与自训练协议对方法进行评估。
实验结果
研究问题
- RQ1AVH与人类视觉硬度的相关性是否显著高于传统置信度度量方法(如softmax分数或特征范数)?
- RQ2AVH在训练过程中的演化行为如何?是否在训练损失继续下降前就提前达到平台期,表明夹角对齐的早期收敛?
- RQ3在领域自适应的自训练中,AVH能否通过更优地选择伪标签的困难样本,从而提升性能?
- RQ4与标准交叉熵损失相比,基于AVH的损失函数是否能在领域泛化任务中提升模型泛化能力?
- RQ5在困难样本上性能的提升是否与整体模型准确率和校准性存在因果关联?
主要发现
- AVH得分在训练初期即趋于稳定,即使训练损失仍在持续下降,表明夹角对齐的收敛早于特征范数的缩放。
- 准确率处于SOTA水平的模型也展现出最佳的AVH得分,支持了提升困难样本性能可驱动泛化的假设。
- AVH与人类选择频率(Human Selection Frequency, HSF)的相关性显著强于softmax分数或特征范数,验证了其作为人类视觉硬度代理的有效性。
- 在领域自适应的自训练中,基于AVH的样本选择策略能获取更高比例的困难样本(平均置信度:0.961 vs. 0.976),同时保持相近的真正例率(0.844 vs. 0.848),表明其具有更优的校准性。
- 在PACS数据集上,使用AVH损失训练的10层简单CNN模型达到72.46%的平均准确率,优于更复杂的基线模型,并与SOTA方法相当或更优。
- 基于AVH的损失在困难样本上表现更优,尤其在草图域(61.26%准确率),表明其对领域分布偏移具有更强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。