Skip to main content
QUICK REVIEW

[论文解读] Integrating Contextual Knowledge to Visual Features for Fine Art Classification

Giovanna Castellano, Giovanni Sansaro|arXiv (Cornell University)|May 31, 2021
Aesthetic Perception and Analysis参考文献 12被引用 10
一句话总结

本文提出 ArtGraph,一个基于 Neo4j 的知识图谱,整合 WikiArt 与 DBpedia,以建模艺术实体及其关系。通过将 ResNet50 的视觉特征与知识图谱的 node2vec 嵌入向量融合,该方法在细粒度艺术分类任务中实现 62.50% 的艺术家预测准确率,优于仅使用视觉特征的基线模型以及 ContextNet 模型。

ABSTRACT

Automatic art analysis has seen an ever-increasing interest from the pattern recognition and computer vision community. However, most of the current work is mainly based solely on digitized artwork images, sometimes supplemented with some metadata and textual comments. A knowledge graph that integrates a rich body of information about artworks, artists, painting schools, etc., in a unified structured framework can provide a valuable resource for more powerful information retrieval and knowledge discovery tools in the artistic domain. To this end, this paper presents ArtGraph: an artistic knowledge graph based on WikiArt and DBpedia. The graph, implemented in Neo4j, already provides knowledge discovery capabilities without having to train a learning system. In addition, the embeddings extracted from the graph are used to inject "contextual" knowledge into a deep learning model to improve the accuracy of artwork attribute prediction tasks.

研究动机与目标

  • 构建一个全面的艺术知识图谱,以捕捉艺术品、艺术家、风格与艺术流派之间的丰富上下文关系。
  • 利用 Neo4j 的查询能力,在无需模型训练的前提下实现艺术领域的知识发现。
  • 通过将结构化上下文知识整合进深度学习模型,提升细粒度艺术属性预测(艺术家、风格、流派)的准确性。
  • 通过利用 Wikipedia 和 DBpedia 等外部知识源,克服以往知识图谱缺乏艺术家关系与外部知识来源的局限性。
  • 为数字人文与计算机视觉领域的研究人员提供一个公开可用、可扩展的资源。

提出的方法

  • 通过使用 Neo4j 将 WikiArt(艺术品及其元数据)与 DBpedia(艺术家传记与关系)的结构化数据整合至单一图数据库中,构建 ArtGraph。
  • 对 ArtGraph 应用 node2vec 算法,为每个节点生成 128 维嵌入向量,将上下文知识编码为向量形式。
  • 采用多任务、多模态深度学习模型,通过拼接方式融合视觉特征(ResNet50 提取的 2048D)与图嵌入(128D),实现对艺术家、风格与流派的联合预测。
  • 模型通过加权组合交叉熵损失(用于分类)与均方误差(MSE)损失进行训练,以对齐视觉特征空间与上下文特征空间。
  • 使用 10% 的验证集进行超参数调优;图嵌入仅在训练图上学习,以防止数据泄露。
  • 训练集占数据总量的 80%,验证集与测试集各占 10%,确保模型对未见艺术品具备良好的泛化能力。

实验结果

研究问题

  • RQ1整合 DBpedia 与 WikiArt 等外部源的知识图谱,是否能够超越仅依赖视觉特征的细粒度艺术分类准确率?
  • RQ2将结构化艺术知识图谱中学习得到的图嵌入整合进深度学习模型,是否能提升多标签艺术属性预测的性能?
  • RQ3通过建模艺术家之间关系(如影响关系、流派归属)的图方法,是否能实现优于仅依赖元数据的模型的泛化能力?
  • RQ4通过 node2vec 嵌入注入上下文知识的方法,与仅将嵌入用作正则化手段的方法相比,其性能提升程度如何?
  • RQ5知识图谱是否不仅能作为训练信号,还能作为独立工具用于艺术史领域的知识发现?

主要发现

  • 所提模型在艺术家分类任务中达到 62.50% 的准确率,优于微调后的 ResNet50 基线模型(61.13%)与 ContextNet 模型(62.20%)。
  • 在风格预测任务中,模型准确率达到 65.93%,优于基线模型(62.65%)与 ContextNet 模型(62.24%)。
  • 在流派分类任务中,模型准确率达到 66.52%,超过基线模型(65.32%)与 ContextNet 模型(65.93%)。
  • 图嵌入的引入显著提升了所有三项任务的性能,证明了上下文知识在艺术分析深度学习中的价值。
  • 消融实验表明,采用包含 MSE 对齐视觉与上下文特征空间的多任务损失函数,可提升模型泛化能力与鲁棒性。
  • 知识图谱支持独立的知识发现,例如识别艺术家之间的相互影响与艺术流派趋势,而无需依赖模型训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。