Skip to main content
QUICK REVIEW

[论文解读] Historical and Modern Features for Buddha Statue Classification

Benjamin Renoust, Matheus Oliveira Franca|arXiv (Cornell University)|Sep 17, 2019
Aesthetic Perception and Analysis参考文献 35被引用 5
一句话总结

本文提出一种自动从佛像面部恢复图像度量准则(历史建构规则)的方法,并将其与现代深度学习特征在分类任务中进行比较。基于包含7,000张图像的中等规模数据集,研究发现尽管现代特征如ResNet50在准确率上优于图像度量法,但后者在可解释性方面表现更优,并在嵌入空间中揭示了有意义的风格聚类。

ABSTRACT

While Buddhism has spread along the Silk Roads, many pieces of art have been displaced. Only a few experts may identify these works, subjectively to their experience. The construction of Buddha statues was taught through the definition of canon rules, but the applications of those rules greatly varies across time and space. Automatic art analysis aims at supporting these challenges. We propose to automatically recover the proportions induced by the construction guidelines, in order to use them and compare between different deep learning features for several classification tasks, in a medium size but rich dataset of Buddha statues, collected with experts of Buddhism art history.

研究动机与目标

  • 开发一种基于规范建构规则的自动化方法,从佛像面部提取图像度量准则。
  • 比较历史图像度量特征与现代深度学习嵌入在佛像分类任务中的性能表现。
  • 评估不同深度学习架构(如ResNet50、VGGFace2)和嵌入类型(基于图像、基于知识图谱)在多个分类任务中的有效性。
  • 探究仅使用面部区域是否可作为材料、风格和制作方法分类的强判别器。
  • 评估数据采集方法(扫描书籍 vs. 3D捕捉)对分类性能的影响。

提出的方法

  • 使用基于规则的方法,依据历史规范准则,从3D佛像的2D照片中自动检测面部关键点。
  • 从检测到的关键点中提取图像度量测量值(如比例、比率),以生成一组历史特征。
  • 在裁剪的面部图像和完整图像输入上,训练并评估多种深度学习模型(ResNet50、VGGFace2、node2vec)的分类性能。
  • 构建一个知识图谱(KG),整合艺术风格、时代和世纪信息,以生成语义嵌入。
  • 比较不同嵌入类型(图像度量法、基于图像的特征(ResNet50、VGGFace2)、基于知识图谱的嵌入)在分类性能上的差异。
  • 使用t-SNE可视化分析嵌入空间的结构与可分性,特别比较图像度量法与深度学习特征。

实验结果

研究问题

  • RQ1能否通过自动化关键点检测,从佛像2D图像中可靠地恢复历史图像度量准则?
  • RQ2在多个任务中,图像度量特征的分类准确率与现代深度学习嵌入相比如何?
  • RQ3面部区域嵌入在分类风格、材料和制作方法方面,相对于完整图像嵌入的性能优势有多大?
  • RQ4将时间信息(世纪)整合到知识图谱中,如何影响嵌入空间中文艺风格的可分性?
  • RQ5数据采集方法(扫描书籍 vs. 3D捕捉)是否显著影响分类性能?

主要发现

  • ResNet50在整体分类性能上表现最佳,尤其是在对脸部区域进行微调后,优于VGGFace2和图像度量特征。
  • ResNet50生成的面部特异性嵌入在木材类型和制作方法分类中表现更优,表明面部是材料与工艺水平的强判别特征。
  • 尽管准确率较低,图像度量特征在t-SNE可视化中仍形成清晰且有意义的聚类,表明其捕捉到了内在的风格模式。
  • 基于知识图谱的嵌入在风格分类(T1)中表现与最佳基于图像的嵌入相当,尤其在包含时间信息时表现更优。
  • VGGFace2与ImageNet预训练模型之间的性能差距表明,从人脸识别迁移学习在刚性、风格化的佛像面部上效果较差。
  • 在知识图谱中加入世纪信息后,艺术风格的可分性得到提升,证实时间上下文在语义建模中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。