Skip to main content
QUICK REVIEW

[論文レビュー] An open dataset for the evolution of oracle bone characters: EVOBC

Haisu Guan, Jinpeng Wan|arXiv (Cornell University)|Jan 23, 2024
Image Processing and 3D Reconstruction被引用数 4
ひとこと要約

本稿では、甲骨文字(紀元前15世紀)から隷書(西暦220年)までの6つの歴史的段階にわたる、229,170枚の画像をカバーするオープンで大規模なデータセットEVOBCを紹介する。このデータセットは、文字の進化に関するAI駆動の研究を可能にし、Swin Transformer v2を用いた画像分類で86.66%のトップ1精度を達成するなど、優れた性能を示す。また、分類モデルおよび拡散ベースの画像生成モデルを用いた甲骨文字の解読シミュレーションにおいても効果的なベースライン結果を示している。

ABSTRACT

The earliest extant Chinese characters originate from oracle bone inscriptions, which are closely related to other East Asian languages. These inscriptions hold immense value for anthropology and archaeology. However, deciphering oracle bone script remains a formidable challenge, with only approximately 1,600 of the over 4,500 extant characters elucidated to date. Further scholarly investigation is required to comprehensively understand this ancient writing system. Artificial Intelligence technology is a promising avenue for deciphering oracle bone characters, particularly concerning their evolution. However, one of the challenges is the lack of datasets mapping the evolution of these characters over time. In this study, we systematically collected ancient characters from authoritative texts and websites spanning six historical stages: Oracle Bone Characters - OBC (15th century B.C.), Bronze Inscriptions - BI (13th to 221 B.C.), Seal Script - SS (11th to 8th centuries B.C.), Spring and Autumn period Characters - SAC (770 to 476 B.C.), Warring States period Characters - WSC (475 B.C. to 221 B.C.), and Clerical Script - CS (221 B.C. to 220 A.D.). Subsequently, we constructed an extensive dataset, namely EVolution Oracle Bone Characters (EVOBC), consisting of 229,170 images representing 13,714 distinct character categories. We conducted validation and simulated deciphering on the constructed dataset, and the results demonstrate its high efficacy in aiding the study of oracle bone script. This openly accessible dataset aims to digitalize ancient Chinese scripts across multiple eras, facilitating the decipherment of oracle bone script by examining the evolution of glyph forms.

研究の動機と目的

  • 歴史的時代にわたる甲骨文字(OBC)の進化を研究するための包括的で整理されたデータセットの不足に対処すること。
  • 4,500文字の甲骨文字が現存するにもかかわらず、未解読のままの状態にとどまっているため、未解読の甲骨文字の解読を支援するAI研究を促進すること。
  • 甲骨文字から現代形に至る形態的変容を捉える高品質で多期間にわたるデータセットを構築すること。
  • 深層学習モデルを用いた画像分類および新しい解読シミュレーションタスクを通じて、データセットの実用性を検証すること。
  • すべてのデータ、コード、学習スクリプトを公開することで、再現可能性を確保し、計算史学分野における今後の研究を支援すること。

提案手法

  • 甲骨文字(OBC)、隷書(BI)、小篆(SS)、楷書(SAC)、行書(WSC)、草書(CS)の6つの歴史的時代にわたる、公式な書籍およびオンラインリポジトリから229,170枚の文字画像を体系的に収集した。
  • スキャン済みのテキストおよびデジタルアーカイブから画像抽出、ノイズ除去、アライメント、自動ラベリングを自動化したデータパイプラインを構築した。
  • 13,714の異なる文字カテゴリを含む統一されたデータセットを構築し、時間的経過に伴う進化の軌跡を保持した。
  • 最先端のモデルを用いてデータセットを評価した:画像分類のためのResNet-101およびSwin Transformer v2。
  • 2つのベースラインを用いた「甲骨文字解読シミュレーション」という新しいタスクを提案した:画像分類と条件付き拡散ベースの画像生成。
  • 条件付き拡散モデルを訓練し、OBC入力から進化した文字形を生成した。生成結果を正解ラベルと比較した。

実験結果

リサーチクエスチョン

  • RQ1大規模で多期間にわたる古代中国文字のデータセットは、文字の進化に関するAI研究を効果的に支援できるか?
  • RQ2深層学習モデルは、甲骨文字およびその進化形をどれほど高い精度で分類できるか?
  • RQ3画像生成モデルを用いることで、未解読の甲骨文字の進化形を予測することで、解読のシミュレーションが可能になるか?
  • RQ4EVOBCデータセットは、歴史的書体段階にわたる形態的パターンの発見にどの程度有効か?
  • RQ5このデータセットは、今後のAI支援による古代書体の解読のための信頼できるベンチマークとして機能できるか?

主な発見

  • EVOBCデータセットは、ResNet-101を用いた際のトップ1精度が85.56%、Swin Transformer v2を用いた際のトップ1精度が86.66%に達し、ラベル付けの高品質さとデータセットの信頼性を裏付けた。
  • 甲骨文字解読シミュレーションにおいて、画像分類ベースラインはトップ1精度16.7%、トップ20精度55.8%を達成し、AI支援による解読の可能性を示した。
  • 条件付き拡散モデルは、妥当な進化形の文字を効果的に生成した。定性的な結果から、複数のテストケースで生成結果が正解ラベルとよく一致していることが確認された。
  • データセットには、13,714の異なる文字カテゴリを含む229,170枚の画像が含まれており、うち90,882枚は書籍から、138,288枚はオンラインソースから得られ、広範なカバー範囲と多様性を確保している。
  • データセットは、甲骨文字から現代中国語の文字に至る進化のパターンの研究を可能にし、6つの歴史的段階にわたって明確な形態的軌跡が観察された。
  • すべてのデータ処理スクリプト、学習コード、モデル重みはGitHubに公開されており、完全な再現性とコミュニティによる拡張を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。