[论文解读] KaoKore: A Pre-modern Japanese Art Facial Expression Dataset
本文提出了 KaoKore,一个经过筛选的前现代日本艺术面部表情数据集,从《面部表情图集》中提取,转换为标准化、适合机器学习的格式,具有统一的图像尺寸和结构化标签。该数据集支持图像分类基准测试以及基于笔画的神经绘画技术的创造性生成建模,通过模仿人类绘画过程,相较于标准 GAN,在艺术合理性方面表现更优。
From classifying handwritten digits to generating strings of text, the datasets which have received long-time focus from the machine learning community vary greatly in their subject matter. This has motivated a renewed interest in building datasets which are socially and culturally relevant, so that algorithmic research may have a more direct and immediate impact on society. One such area is in history and the humanities, where better and relevant machine learning models can accelerate research across various fields. To this end, newly released benchmarks and models have been proposed for transcribing historical Japanese cursive writing, yet for the field as a whole using machine learning for historical Japanese artworks still remains largely uncharted. To bridge this gap, in this work we propose a new dataset KaoKore which consists of faces extracted from pre-modern Japanese artwork. We demonstrate its value as both a dataset for image classification as well as a creative and artistic dataset, which we explore using generative models. Dataset available at https://github.com/rois-codh/kaokore
研究动机与目标
- 解决当前机器学习研究中缺乏标准化、可机器读取的前现代日本艺术面部表情数据集的问题。
- 将原始的《面部表情图集》(最初以 JSON-LD 格式存储,图像尺寸不规则、元数据复杂)转化为清晰、规范且可使用的格式,以支持模型的训练与评估。
- 利用同一数据集同时支持判别性任务(如图像分类)与生成性任务(如神经绘画)。
- 通过支持可扩展、互操作且可复现的研究,弥合日本艺术史人文研究与现代机器学习之间的鸿沟。
- 探索具有类人归纳偏置的生成模型(如基于笔画的渲染)如何更有效地捕捉历史日本绘画的艺术风格。
提出的方法
- KaoKore 数据集通过重新处理来自《面部表情图集》的 1,000 多张裁剪后的面部图像构建而成,统一图像分辨率,并将元数据简化为离散且一致的标签。
- 数据集包含多标签注释,涵盖性别(男性/女性)、社会地位(贵族、武士、平民、化身)和艺术风格,支持细粒度的分类任务。
- 提供适用于 PyTorch 和 TensorFlow 的标准化数据加载器,并提供官方的训练/验证/测试划分,确保在不同深度学习框架中的可复现性。
- 论文在 KaoKore 数据集上使用卷积神经网络(CNN)评估了图像分类基线模型,建立了性能基准。
- 在生成建模方面,作者应用了两种神经绘画方法:基于可微笔画的内在风格迁移,以及使用 Bézier 曲线基元通过强化学习进行绘画训练。
- 生成模型输出按顺序的绘画指令(如笔画或区域为基础),以类似人类艺术创作过程的方式重建参考图像。
实验结果
研究问题
- RQ1来自前现代日本艺术的标准化、高质量面部表情数据集是否能提升艺术史研究中图像分类模型的性能与可复现性?
- RQ2基于笔画的神经绘画模型在生成类似艺术家风格的面部图像方面,相较于标准 GAN 表现如何?
- RQ3具有类人归纳偏置的生成模型(如按顺序应用笔画)在多大程度上能生成视觉连贯且风格合理的 KaoKore 面部图像重建?
- RQ4KaoKore 数据集能否作为文化遗产应用中判别性分类与创造性生成建模的双重用途资源?
- RQ5不同的生成机制(如基于笔画 vs. 基于区域)如何影响生成绘画序列的艺术风格与可解释性?
主要发现
- KaoKore 数据集实现了标准化、可用的格式,具有统一的图像尺寸和简化的结构化标签,可无缝集成至 PyTorch 与 TensorFlow 深度学习框架中。
- 在 KaoKore 上的图像分类基线模型达到高准确率,证明了该数据集在艺术史分析判别任务中的实用性。
- 基于 GAN 的模型生成了看似合理的面部图像,但存在不符合人类艺术创作过程的不自然错误,凸显其归纳偏置的局限性。
- 内在风格迁移模型成功将人脸分解为按顺序排列、类人笔画的序列,且无需预先提供草图数据,表明其对艺术基本单元的有效学习。
- 学习绘画模型生成了抽象的、基于区域的绘画序列,强调结构构图,类似于抽象艺术,同时在艺术风格分解方面具有可解释性。
- 两种生成模型呈现出截然不同的艺术风格——基于笔画的模型强调线条表现,而基于区域的模型强调形体与构图,展示了多样化创意探索的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。