[논문 리뷰] An open dataset for the evolution of oracle bone characters: EVOBC
이 논문은 중국 문자의 진화 과정을 다섯 번째 기원전 15세기 오라클 뼈 문자에서 기원후 220년의 서기문까지의 여섯 역사적 단계를 포함하는 개방형 대규모 데이터셋인 EVOBC를 소개한다. 총 229,170장의 이미지로 구성된 이 데이터셋은 문자 진화에 대한 AI 기반 연구를 가능하게 하며, Swin Transformer v2를 사용한 이미지 분류에서 86.66%의 정확도를 기록하고, 오라클 뼈 문자 해독 시뮬레이션 작업에서 분류 및 확산 기반 이미지 생성 모델을 활용한 효과적인 기초 성능을 보여준다.
The earliest extant Chinese characters originate from oracle bone inscriptions, which are closely related to other East Asian languages. These inscriptions hold immense value for anthropology and archaeology. However, deciphering oracle bone script remains a formidable challenge, with only approximately 1,600 of the over 4,500 extant characters elucidated to date. Further scholarly investigation is required to comprehensively understand this ancient writing system. Artificial Intelligence technology is a promising avenue for deciphering oracle bone characters, particularly concerning their evolution. However, one of the challenges is the lack of datasets mapping the evolution of these characters over time. In this study, we systematically collected ancient characters from authoritative texts and websites spanning six historical stages: Oracle Bone Characters - OBC (15th century B.C.), Bronze Inscriptions - BI (13th to 221 B.C.), Seal Script - SS (11th to 8th centuries B.C.), Spring and Autumn period Characters - SAC (770 to 476 B.C.), Warring States period Characters - WSC (475 B.C. to 221 B.C.), and Clerical Script - CS (221 B.C. to 220 A.D.). Subsequently, we constructed an extensive dataset, namely EVolution Oracle Bone Characters (EVOBC), consisting of 229,170 images representing 13,714 distinct character categories. We conducted validation and simulated deciphering on the constructed dataset, and the results demonstrate its high efficacy in aiding the study of oracle bone script. This openly accessible dataset aims to digitalize ancient Chinese scripts across multiple eras, facilitating the decipherment of oracle bone script by examining the evolution of glyph forms.
연구 동기 및 목표
- 역사적 시기 동안 오라클 뼈 문자(OBC)의 진화를 연구하기 위한 종합적이고 체계화된 데이터셋의 부족을 보완하기 위해.
- 4,500개의 존재하는 문자가 있지만 여전히 대부분이 해독되지 않은 오라클 뼈 문자의 해독을 보조하는 AI 기반 연구를 촉진하기 위해.
- 오라클 뼈 문자에서 현대 형태로의 형태적 변화를 잘 반영하는 고품질의 다기능 데이터셋을 구축하기 위해.
- 딥러닝 모델을 활용한 분류 및 새로운 해독 시뮬레이션 작업을 통해 데이터셋의 유용성을 검증하기 위해.
- 모든 데이터, 코드, 학습 스크립트를 공개하여 재현 가능성을 확보하고 향후 계산적 에피그라피 분야의 연구를 지원하기 위해.
제안 방법
- 오라클 뼈 문자(OBC), 부이문(BI), 소서(SS), 상서(SAC), 왕서(WS), 체서(CS) 등 여섯 역사적 시기의 권위 있는 책과 온라인 자료에서 총 229,170장의 문자 이미지를 체계적으로 수집하였다.
- 스캔된 텍스트와 디지털 아카이브에서 이미지 추출, 노이즈 제거, 정렬, 자동 레이블링을 수행하는 자동화된 데이터 처리 파이프라인을 구축하였다.
- 시간에 따른 진화 궤적을 유지하면서도 13,714개의 고유한 문자 카테고리로 통합된 데이터셋을 구성하였다.
- 최신 기술 모델인 ResNet-101과 Swin Transformer v2를 사용하여 이미지 분류 작업에서 데이터셋의 성능을 평가하였다.
- 이미지 분류 및 조건부 확산 기반 이미지 생성 모델을 활용한 새로운 '오라클 뼈 문자 해독 시뮬레이션' 작업을 제안하였다.
- 오라클 뼈 문자 입력에서 진화된 문자 형태를 생성하기 위해 조건부 확산 모델을 학습시켰으며, 결과를 정답 레이블과 비교하였다.
실험 결과
연구 질문
- RQ1대규모 다기능 고대 중국 문자 데이터셋이 문자 진화에 대한 AI 기반 연구를 효과적으로 지원할 수 있는가?
- RQ2딥러닝 모델이 오라클 뼈 문자와 그 진화된 형태를 얼마나 높은 정확도로 분류할 수 있는가?
- RQ3이미지 생성 모델을 활용해 해독되지 않은 오라클 뼈 문자의 진화된 형태를 예측함으로써 해독을 시뮬레이션할 수 있는가?
- RQ4EVOBC 데이터셋은 역사적 서체 단계 간의 형태적 패턴을 발견하는 데 얼마나 효과적인가?
- RQ5이 데이터셋은 향후 고대 문자의 AI 기반 해독을 위한 신뢰할 수 있는 벤치마크로 기능할 수 있는가?
주요 결과
- EVOBC 데이터셋은 ResNet-101을 사용할 경우 검증 세트에서 85.56%의 정확도, Swin Transformer v2를 사용할 경우 86.66%의 정확도를 기록하여 높은 레이블 품질과 데이터셋의 신뢰성을 입증하였다.
- 오라클 뼈 문자 해독 시뮬레이션 작업에서 이미지 분류 기반 모델은 16.7%의 정확도(1위 정확도)와 55.8%의 정확도(20위 이내 정확도)를 기록하여 AI 기반 해독의 가능성과 타당성을 입증하였다.
- 조건부 확산 모델은 타당성 있는 진화된 문자 형태를 성공적으로 생성하였으며, 여러 테스트 케이스에서 정답 레이블과 유사한 결과를 보여 주었다.
- 이 데이터셋은 총 229,170장의 이미지와 13,714개의 고유한 문자 카테고리로 구성되어 있으며, 책에서 확보한 90,882장과 온라인 자료에서 확보한 138,288장으로 이루어져 있어 광범위한 커버리지와 다양성을 확보하였다.
- 이 데이터셋은 오라클 뼈 문자에서 현대 중국어 문자로의 진화 패턴 연구를 지원하며, 여섯 역사적 단계에서 명확한 형태적 진화 궤적을 관찰할 수 있었다.
- 모든 데이터 처리 스크립트, 학습 코드, 모델 가중치는 GitHub에 공개되어 있어 완전한 재현 가능성을 확보하고 커뮤니티의 확장도 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.