[論文レビュー] KaoKore: A Pre-modern Japanese Art Facial Expression Dataset
本稿では、前近代日本の美術品の顔の表情を収集した、KaoKoreと呼ばれる標準化されたデータセットを紹介する。このデータセットは、顔の表情コレクションを、一貫した画像サイズと構造化されたラベルを持つ機械学習に適した形式に加工したものである。このデータセットは、画像分類のベンチマークと、ストロークベースのニューラルペインティング技術を用いた創造的生成モデリングの両方を可能にし、人間の描画プロセスを模倣することで、従来のGANよりも芸術的に整合性のとれた結果を示している。
From classifying handwritten digits to generating strings of text, the datasets which have received long-time focus from the machine learning community vary greatly in their subject matter. This has motivated a renewed interest in building datasets which are socially and culturally relevant, so that algorithmic research may have a more direct and immediate impact on society. One such area is in history and the humanities, where better and relevant machine learning models can accelerate research across various fields. To this end, newly released benchmarks and models have been proposed for transcribing historical Japanese cursive writing, yet for the field as a whole using machine learning for historical Japanese artworks still remains largely uncharted. To bridge this gap, in this work we propose a new dataset KaoKore which consists of faces extracted from pre-modern Japanese artwork. We demonstrate its value as both a dataset for image classification as well as a creative and artistic dataset, which we explore using generative models. Dataset available at https://github.com/rois-codh/kaokore
研究の動機と目的
- 機械学習研究において、前近代日本の美術品の顔の表情について、標準化され、機械で読み取り可能なデータセットが不足している問題に対処すること。
- 元々JSON-LD形式で、画像サイズが不規則でメタデータが複雑な「顔の表情コレクション」を、洗練され、一貫性があり、モデルの学習と評価に利用可能な形式に変換すること。
- 同じデータセットを用いて、識別的タスク(例:画像分類)と生成的タスク(例:ニューラルペインティング)の両方を支援すること。
- 日本美術史における人文学的研究と現代の機械学習の間のギャップを埋め、スケーラブルで相互運用可能で再現可能な研究を可能にすること。
- 人間の描画プロセスに類似したインダクティブバイアス(例:ストロークベースのレンダリング)を持つ生成モデルが、歴史的日本画の芸術的スタイルをよりよく捉える方法を探ること。
提案手法
- KaoKoreデータセットは、顔の表情コレクションから抽出した1,000枚以上のクロップ済み顔画像を再処理し、画像解像度を標準化し、メタデータを明確で一貫性のあるラベルに簡略化することで構築された。
- 性別(男性/女性)、社会的身分(貴族、武将、平民、化身)および芸術的スタイルのマルチラベルアノテーションが含まれており、微細な分類タスクを可能にしている。
- PyTorchおよびTensorFlow用の標準化されたデータローダーが提供されており、公式の訓練/開発/テスト分割が用意されており、さまざまなディープラーニングフレームワーク間での再現性を確保している。
- 本稿では、KaoKoreデータセット上で畳み込みニューラルネットワーク(CNN)を用いた画像分類のベースラインを評価し、パフォーマンスベンチマークを確立している。
- 生成モデリングの分野では、微分可能なストロークを用いたインテンショナルスタイル転送と、ベジエ曲線プリミティブを用いた強化学習によるペイントの学習という2つのニューラルペインティング手法を適用している。
- 生成モデルは、参照画像を人間の芸術的プロセスに類似した方法で再構築するための順次的なペイント指示(例:ストロークまたは領域ベース)を出力する。
実験結果
リサーチクエスチョン
- RQ1前近代日本の美術品から得た標準化され、高品質な顔の表情データセットは、美術史研究における画像分類モデルの性能と再現可能性を向上させることができるか?
- RQ2ストロークベースのニューラルペインティングモデルは、歴史的美術品からの自然な芸術的顔画像を生成する際、標準的なGANと比較してどの程度優れているか?
- RQ3人間の描画プロセスに類似したインダクティブバイアス(例:順次的なストローク適用)を持つ生成モデルは、KaoKore顔の画像を視覚的に整合性があり、スタイル的に妥当な再構築をどの程度達成できるか?
- RQ4KaoKoreデータセットは、文化的遺産分野における識別的分類と創造的生成モデリングの両方の目的で、二重目的のリソースとして機能できるか?
- RQ5異なる生成メカニズム(例:ストロークベース対領域ベース)は、生成されたペイントシーケンスの芸術的スタイルと解釈可能性にどのような影響を与えるか?
主な発見
- KaoKoreデータセットは、一貫した画像サイズと簡素化され構造化されたラベルを持つ標準化された、利用可能な形式を達成しており、PyTorchおよびTensorFlowフレームワーク間でのディープラーニングパイプラインへのスムーズな統合を可能にしている。
- KaoKore上での画像分類ベースラインは高い精度を達成しており、美術史的分析における識別的タスクへのデータセットの有用性を示している。
- GANベースのモデルは自然で整合性のある顔画像を生成するが、人間の芸術的プロセスとは整合しない不自然なエラーを生じており、そのインダクティブバイアスの限界を示している。
- インテンショナルスタイル転送モデルは、事前のスケッチデータがなくても、顔を順次的で人間らしいストロークに分解することができ、芸術的プリミティブの有効な学習を示している。
- ペイントの学習モデルは、抽象的で領域ベースのペイントシーケンスを生成し、構造的コアの強調を図っており、抽象芸術に類似した特徴を持ち、芸術的スタイルの分解における解釈可能性を提供している。
- 2つの生成モデルは、異なる芸術的スタイルを生み出している—ストロークベースのモデルは線の表現を強調し、領域ベースのモデルは形と構成を強調しており、多様な創造的探求の可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。