Skip to main content
QUICK REVIEW

[论文解读] MosAIc: Finding Artistic Connections across Culture with Conditional Image Retrieval

Mark Hamilton, Stephanie Fu|arXiv (Cornell University)|Jul 14, 2020
Generative Adversarial Networks and Image Synthesis参考文献 83被引用 4
一句话总结

MosAIc 提出条件图像检索(CIR),一种结合视觉相似性搜索与用户定义条件(例如文化、媒介)的方法,用于跨文化与时间周期发现语义和视觉上相关的艺术品。该方法使用剪枝后的随机投影树高效检索受条件过滤的近邻,实现非参数化风格迁移,并揭示生成对抗网络(GAN)在数据分布建模中的‘盲区’。

ABSTRACT

We introduce MosAIc, an interactive web app that allows users to find pairs of semantically related artworks that span different cultures, media, and millennia. To create this application, we introduce Conditional Image Retrieval (CIR) which combines visual similarity search with user supplied filters or "conditions". This technique allows one to find pairs of similar images that span distinct subsets of the image corpus. We provide a generic way to adapt existing image retrieval data-structures to this new domain and provide theoretical bounds on our approach's efficiency. To quantify the performance of CIR systems, we introduce new datasets for evaluating CIR methods and show that CIR performs non-parametric style transfer. Finally, we demonstrate that our CIR data-structures can identify "blind spots" in Generative Adversarial Networks (GAN) where they fail to properly model the true data distribution.

研究动机与目标

  • 实现跨不同文化、媒介和时间周期的语义与视觉相关艺术品的交互式发现。
  • 解决高效限制图像检索至特定子集(例如按文化或媒介)的挑战,而无需为每个条件重建索引结构。
  • 开发一种通用方法,将现有 KNN 数据结构适配为支持使用任意逻辑谓词的条件查询。
  • 在新数据集上评估 CIR 性能,并证明其在识别 GAN 中分布失败方面的作用。
  • 创建一个交互式网络应用(MosAIc),可视化全球艺术收藏之间的艺术关联。

提出的方法

  • 提出条件图像检索(CIR),其中检索受用户指定条件(如文化或媒介)的约束。
  • 通过使用倒排索引,剪枝不属目标条件子集的树节点,将基于树的 KNN 结构(如随机投影树)进行适应。
  • 证明在条件查询下,随机投影树中可被剪枝的节点数量的理论下界。
  • 使用预训练模型(如 ResNet50、MobileNetV2)的深度特征作为嵌入,通过余弦距离计算图像相似性。
  • 使用倒排索引将条件(如“18世纪中国”)映射到相关图像索引,实现在检索过程中快速过滤。
  • 将所得的条件 K-最近邻(CKNN)结构应用于分析特征空间中邻居分布,以检测 GAN 中的‘盲点’。

实验结果

研究问题

  • RQ1条件图像检索能否揭示文化与时间上相距遥远的艺术品之间的有意义关联?
  • RQ2如何高效地将现有 KNN 数据结构适配为支持条件查询,而无需为每个条件重新构建?
  • RQ3CIR 在多大程度上可通过从目标条件子集中检索内容相似图像来实现非参数化风格迁移?
  • RQ4CKNN 结构能否揭示 GAN 生成数据中的分布差异,例如模型无法生成真实样本的‘盲点’?
  • RQ5与基于查询后过滤或暴力搜索的基线方法相比,所提出的 CIR 方法在效率和准确性方面表现如何?

主要发现

  • CIR 能够成功从文化与时间跨度极大的艺术品中检索到语义和视觉上相似的作品,例如公元前 1980 年的埃及船模型与 18 世纪的中国筏画。
  • 剪枝后的随机投影树方法在速度上显著优于查询后过滤与暴力搜索基线,且在 100 万张图像数据集上,条件索引的空间效率达到 6.4 MB。
  • CIR 通过从目标条件子集检索内容相似图像,实现非参数化风格迁移,展示了无需模型微调的迁移能力。
  • CKNN 数据结构有效识别出在 CelebA HQ 上训练的 ProGAN 中的‘盲点’,揭示了模型在生成带沿帽人脸时失败的区域。
  • 该方法在条件检索速度与可扩展性方面优于基线策略,尤其在条件特定或目标子集较小时表现更优。
  • 为 CIR 评估新引入的数据集——FEI 人脸数据库与两个大规模艺术收藏,为条件检索性能提供了稳健的基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。