Skip to main content
QUICK REVIEW

[논문 리뷰] DeepScribe: Localization and Classification of Elamite Cuneiform Signs Via Deep Learning

Edward Williams, Grace Su|arXiv (Cornell University)|2023. 06. 02.
Image Processing and 3D Reconstruction인용 수 5
한 줄 요약

DeepScribe는 페르세폴리스 방위기록소에서 확보한 대규모 주석 처리된 데이터셋을 활용해 고대 점토판에 있는 엘람어 쿠니포르름 기호의 국소화 및 분류를 위한 딥러닝 파이프라인을 제안한다. 국소화 mAP는 0.78, 상위 5개 분류 정확도는 0.89를 기록하여 기호 탐지 자동화와 쿠니포르름학자들이 사용할 수 있는 발음표기 제안 시스템의 가능성을 입증한다.

ABSTRACT

Twenty-five hundred years ago, the paperwork of the Achaemenid Empire was recorded on clay tablets. In 1933, archaeologists from the University of Chicago's Oriental Institute (OI) found tens of thousands of these tablets and fragments during the excavation of Persepolis. Many of these tablets have been painstakingly photographed and annotated by expert cuneiformists, and now provide a rich dataset consisting of over 5,000 annotated tablet images and 100,000 cuneiform sign bounding boxes. We leverage this dataset to develop DeepScribe, a modular computer vision pipeline capable of localizing cuneiform signs and providing suggestions for the identity of each sign. We investigate the difficulty of learning subtasks relevant to cuneiform tablet transcription on ground-truth data, finding that a RetinaNet object detector can achieve a localization mAP of 0.78 and a ResNet classifier can achieve a top-5 sign classification accuracy of 0.89. The end-to-end pipeline achieves a top-5 classification accuracy of 0.80. As part of the classification module, DeepScribe groups cuneiform signs into morphological clusters. We consider how this automatic clustering approach differs from the organization of standard, printed sign lists and what we may learn from it. These components, trained individually, are sufficient to produce a system that can analyze photos of cuneiform tablets from the Achaemenid period and provide useful transliteration suggestions to researchers. We evaluate the model's end-to-end performance on locating and classifying signs, providing a roadmap to a linguistically-aware transliteration system, then consider the model's potential utility when applied to other periods of cuneiform writing.

연구 동기 및 목표

  • 현재 전문 쿠니포르름학자들이 한 텍스트당 수일이 걸리는 수작업 주석 및 번역 과정에서 발생하는 한계를 해결하기 위해.
  • 수작업을 줄이기 위해 기호 국소화 및 분류를 자동화하는 컴퓨터 비전 파이프라인 개발을 위해.
  • 페르세폴리스 방위기록소에서 확보한 5,000장의 주석 처리된 점토판 이미지와 100,000개의 쿠니포르름 기호 경계 상자로 구성된 대규모 정제된 데이터셋을 활용하기 위해.
  • 객체 탐지 및 기호 분류 모델을 조합하여 연구자들이 기계 기반의 발음표기 제안을 받을 수 있도록 하기 위해.
  • 엘람어 이외의 쿠니포르름 문헌, 예를 들어 우르 3 시대 수미어 문헌 등으로 모델을 전이 적용할 수 있는 잠재력을 탐색하기 위해.

제안 방법

  • 100,000개의 주석 처리된 경계 상자를 기반으로 훈련된 RetinaNet을 사용해 점토판 이미지 내 쿠니포르름 기호의 국소화를 수행한다.
  • 기호 정체성을 예측하기 위해 ResNet 기반 분류기(ResNet18 및 ResNet50)를 사용하며, 주요 평가 지표로 상위 5개 정확도를 사용한다.
  • 모듈러한 파이프라인을 구현: 먼저 기호 위치를 탐지한 후, 훈련된 분류기로 각 탐지된 기호를 분류한다.
  • 형태학적 클러스터링을 적용해 쿠니포르름 기호를 자동으로 군집화하고, 전통적인 인쇄된 기호 목록과 비교한다.
  • 예측된 핫스팟 위치와 상위 1개 기호 레이블을 기반으로 Sequential RANSAC을 사용해 텍스트 줄을 재구성하고 문자 오류율(CER)을 평가한다.
  • 모델을 엔드 투 엔드로 훈련하고 기호 국소화, 분류, 시퀀스 재구성 성능을 평가한다.
Figure 1. PFA Tablet Image with Annotated Hotspots viewed in OCHRE
Figure 1. PFA Tablet Image with Annotated Hotspots viewed in OCHRE

실험 결과

연구 질문

  • RQ1정적 단일 조명 촬영 이미지를 사용할 때, 깊이 있는 신경망 모델이 복잡하고 파편화된 3차원 점토판에서 쿠니포르름 기호를 고정밀도로 국소화할 수 있는가?
  • RQ2비전 전용 접근법이 얼마나 정확한 기호 분류를 달성할 수 있으며, 전체 텍스트 재구성에서 상위 1개 정확도의 한계는 무엇인가?
  • RQ3쿠니포르름 기호의 자동으로 학습된 형태학적 클러스터링 결과는 기존 쿠니포르름 연구에서 사용되는 전통적인 인쇄된 기호 목록과 어떻게 비교되는가?
  • RQ4엘람어 쿠니포르름 기호에 대해 훈련된 탐지기 모델이 우르 3 시대 수미어 점토판과 같은 다른 쿠니포르름 문헌 코퍼스로 전이 적용될 수 있는가?
  • RQ5언어학적 지도 정보가 기호 예측 정확도 향상과 엔드 투 엔드 텍스트 재구성 기능 향상에 어떤 역할을 하는가?

주요 결과

  • RetinaNet 객체 탐지기는 복잡하고 파편화된 점토판 이미지에서 기호 국소화에 대해 평균 정밀도(mAP) 0.78을 달성하여 뛰어난 성능을 보였다.
  • ResNet 분류기는 상위 5개 기호 분류 정확도 0.89를 기록하여 희귀하거나 모호한 기호에 대해서도 고품질의 예측을 가능하게 했다.
  • 엔드 투 엔드 파이프라인은 상위 5개 분류 정확도 0.80을 기록하여 모듈러한 접근 방식이 기호 제안에 효과적임을 입증했다.
  • 재구성된 텍스트 시퀀스의 문자 오류율(CER)은 0.683으로 나타나 현재 파이프라인이 언어학적 보정 없이도 전체 텍스트를 신뢰성 있게 재구성하지 못하고 있음을 시사한다.
  • 상위 1개 분류 정확도는 뿐만 아니라 0.563에 불과하여 기호 예측 오류를 줄이기 위해 언어학적 맥락이 필수적임을 보여준다.
  • 초기 실험 결과에서 탐지기가 우르 3 시대 수미어 점토판의 기호를 국소화하는 데 성공하여, 문체와 스타일의 차이가 있음에도 불구하고 쿠니포르름 시대 간 전이 가능성의 가능성을 시사한다.
Figure 2. Histogram of Sign Frequencies
Figure 2. Histogram of Sign Frequencies

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.