[论文解读] Alignment with human representations supports robust few-shot learning
本文提出,与人类认知结构对齐的表征可提升视觉模型在少样本学习中的表现及鲁棒性。基于信息论框架并结合对491个模型的实证分析,研究发现对齐程度与性能之间存在U型关系——即高对齐与低对齐均优于中等对齐,表明人类对齐的模型具有更强的泛化能力,并能更好地抵御对抗样本与分布外数据分布的偏移。
Should we care whether AI systems have representations of the world that are similar to those of humans? We provide an information-theoretic analysis that suggests that there should be a U-shaped relationship between the degree of representational alignment with humans and performance on few-shot learning tasks. We confirm this prediction empirically, finding such a relationship in an analysis of the performance of 491 computer vision models. We also show that highly-aligned models are more robust to both natural adversarial attacks and domain shifts. Our results suggest that human-alignment is often a sufficient, but not necessary, condition for models to make effective use of limited data, be robust, and generalize well.
研究动机与目标
- 探究与人类认知结构对齐的表征是否可提升模型在少样本学习任务中的表现。
- 确定人类对齐的表征是否可作为数据稀缺条件下泛化能力的有效归纳偏置。
- 评估人类对齐模型在自然对抗样本与分布偏移下的鲁棒性。
- 通过识别对齐与性能之间非单调关系,解决先前关于表征对齐优势的矛盾研究发现。
- 探究表征对齐是否为视觉任务中理想模型行为的充分但非必要条件。
提出的方法
- 开发了一套基于信息论的框架,用于基于与人类表征对齐程度预测模型的涌现行为。
- 通过1200名参与者对42.5万个刺激对的人类相似性判断,测量表征对齐程度。
- 在下游少样本学习、对抗鲁棒性与分布偏移任务上,训练并评估了491个大规模计算机视觉模型。
- 采用基于三元组的监督学习方法,模拟模型比较中的人类推理方式。
- 应用表征相似性分析(RSA)量化模型与人类潜在表征之间的对齐程度。
- 通过消融研究校正预训练性能,以隔离对齐的独立影响。
实验结果
研究问题
- RQ1与人类的表征对齐是否能带来更好的少样本学习性能?
- RQ2对齐程度与模型性能之间是否存在非单调关系,如信息论框架所预测?
- RQ3人类对齐的模型是否对自然对抗样本与分布偏移表现出更强的鲁棒性?
- RQ4表征对齐是否为鲁棒泛化的必要条件,还是非对齐模型也能表现相当?
- RQ5个体人类表征与群体聚合表征在塑造模型对齐与性能方面有何差异?
主要发现
- 表征对齐与少样本学习性能之间存在U型关系:无论高对齐还是低对齐的模型,其性能均优于中等对齐模型,即使在校正预训练准确率后依然成立。
- 人类对齐的模型在自然对抗样本下表现出显著更强的鲁棒性,且其表现独立于主数据集上的预训练准确率。
- 人类对齐的模型对分布偏移更具韧性,在分布变化下保持性能的能力优于中等对齐模型。
- 高度对齐的模型在所有三项评估任务——少样本学习、对抗鲁棒性与分布偏移——中均取得最佳表现,证实对齐是实现这些优势的充分但非必要条件。
- U型模式解释了文献中先前存在的矛盾现象:尽管对齐分数较高,中等对齐模型有时仍表现欠佳。
- 使用人类对齐表征训练的模型展现出更优的泛化能力,表明此类对齐为小样本学习提供了强有力的归纳偏置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。