[论文解读] A Century of Portraits: A Visual Historical Record of American High School Yearbooks
本文引入了一个包含168,055幅美国高中毕业纪念册肖像(1900–2000年)的大规模数据集,并应用弱监督深度学习方法,发现时尚、发型与社会规范方面的历史视觉趋势。通过微调卷积神经网络(CNN),其对女性的中位年代预测误差为4年,对男性的中位误差为6年,同时利用一种新颖的显著性可视化方法,揭示了发型和眼镜等特定时代特征的判别性视觉线索。
Imagery offers a rich description of our world and communicates a volume and type of information that cannot be captured by text alone. Since the invention of the camera, an ever-increasing number of photographs document our "visual culture" complementing historical texts. But currently, this treasure trove of knowledge can only be analyzed manually by historians, and only at small scale. In this paper we perform automated analysis on a large-scale historical image dataset. Our main contributions are: 1) A publicly-available dataset of 168,055 (37,921 frontal-facing) American high school yearbook portraits. 2) Weakly-supervised data-driven techniques to discover historical visual trends in fashion and identify date-specific visual patterns. 3) A classifier to predict when a portrait was taken, with median error of 4 years for women and 6 for men. 4) A new method for discovering and displaying the visual elements used by the CNN-based date-prediction model to date portraits, finding that they correspond to the tell-tale fashions of each era. Project page can be found at: http://people.eecs.berkeley.edu/~shiry/projects/yearbooks/yearbooks.html .
研究动机与目标
- 创建一个涵盖20世纪的、公开可获取的大规模历史毕业纪念册肖像数据集,用于视觉历史分析。
- 开发数据驱动的技术,从标准化的肖像图像中自动发现时尚、发型与社会规范方面的视觉趋势。
- 训练一个基于CNN的分类器,即使在未见过的名人肖像上,也能以高精度预测肖像拍摄的年份。
- 通过识别模型用于年代判断的具体视觉元素(例如发型、化妆、眼镜),解释模型的决策过程,确保与历史趋势保持一致。
提出的方法
- 作者收集并整理了来自美国各地高中、涵盖1900至2000年间的168,055幅毕业纪念册肖像,其中包括37,921张正面朝向的图像。
- 应用弱监督学习方法,发现随时间变化的视觉模式,如微笑频率、发长变化及眼镜流行度的变化,并将其与历史事件和技术进步相关联。
- 训练一个卷积神经网络(CNN),仅从单张肖像图像预测其拍摄年份,对女性的中位误差为4年,对男性的中位误差为6年。
- 开发了一种新颖的方法,通过选择性单元激活与空间显著性映射,可视化CNN用于年代判断的判别性图像区域。
- 该方法在保持预测置信度的同时,禁用网络中的特定特征图,从而实现对时间特定视觉线索(如1960年代的齐刘海或1980年代的卷发)的定位。
- 该方法在未见过的名人肖像数据集上进行了验证,证明其在图像质量与人物外观差异较大的领域转移情况下仍具备良好的泛化能力。
实验结果
研究问题
- RQ1能否从一个世纪的标准化高中毕业纪念册肖像中,自动发现时尚、发型与社会规范方面的视觉趋势?
- RQ2仅依靠单张人脸图像的视觉线索,深度学习模型在预测肖像拍摄年份时的准确度如何?
- RQ3模型在进行年代预测时依赖哪些具体视觉元素(如发型、眼镜、化妆),这些元素是否与历史时尚周期一致?
- RQ4尽管存在从高中生到专业女演员与模特的领域差异,该模型能否泛化到未见过的、高对比度的名人肖像图像?
- RQ5在标签弱监督且视觉空间高维的背景下,如何解释深度学习模型在历史图像年代判断任务中的决策过程?
主要发现
- 包含168,055幅毕业纪念册肖像(其中37,921张为正面朝向)的数据集已公开,可作为视觉历史分析的基准资源。
- CNN模型在预测肖像拍摄年份时,对女性的中位误差为4年,对男性的中位误差为6年。
- 该模型在未见过的名人肖像上泛化良好,即使在图像质量与人物类型存在差异的情况下,仍能正确预测其所属年代。
- 显著性可视化方法成功定位了特定时代的视觉特征,如1940年代的深色口红、1960年代的齐刘海和1990年代的发分线,这些特征与已记录的时尚趋势高度吻合。
- 与先前方法相比,该方法在识别判别性图像区域方面表现更优,分类准确率达到0.033,优于Simonyan等人[21]的0.017,且L1误差更低。
- 本研究证实,眼镜流行度的波动与隐形眼镜的引入和普及存在关联,为技术进步与视觉文化之间的数据驱动联系提供了实证支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。