Skip to main content
QUICK REVIEW

[论文解读] Is Medieval Distant Viewing Possible? : Extending and Enriching Annotation of Legacy Image Collections using Visual Analytics

Christofer Meinecke, Estelle Guéville|arXiv (Cornell University)|Aug 20, 2022
Image Retrieval and Classification Techniques被引用 4
一句话总结

本文提出了一种视觉分析框架,使中世纪学者能够统一、丰富并分层组织来自两个传统中世纪手稿收藏(Mandragore 和 Initiale)的碎片化注释。通过整合词嵌入、图像嵌入、共现分析和交互式可视化,该系统支持协作式、半监督的标注,并创建了一个高质量、领域特定的标签层级结构,适用于文化遗产应用中的监督机器学习。

ABSTRACT

Distant viewing approaches have typically used image datasets close to the contemporary image data used to train machine learning models. To work with images from other historical periods requires expert annotated data, and the quality of labels is crucial for the quality of results. Especially when working with cultural heritage collections that contain myriad uncertainties, annotating data, or re-annotating, legacy data is an arduous task. In this paper, we describe working with two pre-annotated sets of medieval manuscript images that exhibit conflicting and overlapping metadata. Since a manual reconciliation of the two legacy ontologies would be very expensive, we aim (1) to create a more uniform set of descriptive labels to serve as a "bridge" in the combined dataset, and (2) to establish a high quality hierarchical classification that can be used as a valuable input for subsequent supervised machine learning. To achieve these goals, we developed visualization and interaction mechanisms, enabling medievalists to combine, regularize and extend the vocabulary used to describe these, and other cognate, image datasets. The visual interfaces provide experts an overview of relationships in the data going beyond the sum total of the metadata. Word and image embeddings as well as co-occurrences of labels across the datasets, enable batch re-annotation of images, recommendation of label candidates and support composing a hierarchical classification of labels.

研究动机与目标

  • 解决传统文化遗产图像收藏中元数据不一致、不完整和冲突的问题,特别是在中世纪手稿数据库中。
  • 克服现有图像分类层级(如 ImageNet)的局限性,这些层级对具有领域特定语义的宗教和历史图像不适用。
  • 使领域专家(中世纪学者)能够协作构建一个统一、高质量且语义明确的中世纪插图标签层级结构。
  • 通过在视觉分析界面中结合机器学习推荐与专家反馈,支持大规模图像集合的可扩展且交互式的标注。
  • 通过对齐不同机构之间分歧的词汇表和元数据模式,促进跨收藏的可发现性和互操作性。

提出的方法

  • 开发了一种视觉分析系统,整合词嵌入(例如来自自然语言处理模型的嵌入)以在不同收藏之间建议并对齐语义标签候选。
  • 利用图像嵌入(例如来自卷积神经网络的嵌入)在标注过程中实现基于视觉相似性的推荐。
  • 结合标签在图像间的共现分析,以建议语义相关的注释并支持层级组织。
  • 实施了半监督学习循环,其中用户反馈动态更新可视化表示(例如 UMAP 投影)和标签嵌入。
  • 提供了标签层级、嵌入空间和标注置信度的交互式可视化,以支持专家决策。
  • 通过基于嵌入和共现模式推导出的共享标签建议,支持对多幅图像进行批量标注。

实验结果

研究问题

  • RQ1如何将来自多个中世纪手稿数据库的碎片化且不一致的注释统一为一个连贯的共享词汇?
  • RQ2视觉分析与基于嵌入的推荐在多大程度上能提升文化遗产收藏中专家标注的效率与一致性?
  • RQ3是否能够通过领域专家与机器学习工具的协作,构建一个既反映学术惯例又体现视觉语义的分层标签结构?
  • RQ4视觉分析如何支持检测和解决传统元数据中的标注冲突与语义漂移问题?
  • RQ5用户与嵌入空间之间的交互式反馈循环在优化标签层级和提升下游机器学习性能方面发挥何种作用?

主要发现

  • 该视觉分析系统成功使中世纪学者统一并规范化了 Mandragore 和 Initiale 中的冲突元数据,显著减少了词汇和语义上的不一致。
  • 基于词嵌入和图像嵌入的交互式推荐显著减少了大规模图像集手动标注所需的时间和认知负荷。
  • 标签共现分析揭示了有意义的语义关系,为构建连贯、领域特定的分层分类体系提供了依据。
  • 用户反馈动态更新了嵌入空间的可视化表示,使专家能够迭代探索和优化标签关系。
  • 该系统展现出强大的可扩展性和泛化潜力,为将标签层级扩展至其他中世纪艺术类型和收藏奠定了基础。
  • 该框架支持协作标注与冲突解决,通过视觉提示表示标注者之间的分歧以及集体知识的构建。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。