[논문 리뷰] ICDAR 2019 Competition on Image Retrieval for Historical Handwritten Documents
역사 문서의 작가 검색에 대한 대규모 평가로, 20,000장의 이미지가 10,000명의 작가로부터 수집된 원고, 편지, 차터에서 비딥러닝 방법이 경쟁할 수 있음을 보여주고, SIFT+Pathlet이 최고 성능을 달성했다.
This competition investigates the performance of large-scale retrieval of historical document images based on writing style. Based on large image data sets provided by cultural heritage institutions and digital libraries, providing a total of 20 000 document images representing about 10 000 writers, divided in three types: writers of (i) manuscript books, (ii) letters, (iii) charters and legal documents. We focus on the task of automatic image retrieval to simulate common scenarios of humanities research, such as writer retrieval. The most teams submitted traditional methods not using deep learning techniques. The competition results show that a combination of methods is outperforming single methods. Furthermore, letters are much more difficult to retrieve than manuscripts.
연구 동기 및 목표
- 역사 문서에서 작가 검색을 촉진하고 실용적인 검색 벤치마트를 통해 대규모 인문학 연구를 가능하게 한다.
- 만년한 원고, 편지, 차터에 걸친 10,000명의 작가로부터의 20,000장 문서 이미지를 공개 데이터 세트로 제공한다.
- 다양하고 노이즈가 많은 역사 데이터에서 작가 검색을 위한 비딥러닝 및 제한된 ML 접근법의 범위를 평가한다.
제안 방법
- 단일 페이지 작가 7,500명과 다페이지 작가 12,500페이지를 포함한 공개 20,000이미지 테스트 세트를 사용해 작가 검색 작업을 시뮬레이션한다.
- 세 팀의 9개 제출물과 이전 방법의 두 가지 기반 변형을 거리 기반 검색 프레임워크를 사용해 평가한다.
- 이미지를 수동 특징(LBP, SIFT 기반 피셔 벡터, Pathlet)과 간단한 분류기 또는 거리 지표로 표현한다; 전체 딥러닝 모델은 베이스라인 결과를 지배하지 못한다.
- 테두리 잘라내기 및 이미지를 균일한 차원으로 리사이즈하는 전처리를 수행하여 재 사칭 공격과 다운로드 효율 관련 변수를 통제한다.
- 테스트 세트에서 leave-one-image-out 교차 검증으로 평균 정밀도(mAP)와 Top-1 정확도를 계산한다.
실험 결과
연구 질문
- RQ1전통적인(non-deep-learning) 작가 검색 방법이 대규모 역사 데이터에서 어떤 성능을 보이는가?
- RQ2특징 유형(텍스처 기반 LBP, SIFT 기반 피셔 벡터, Pathlet)과 그 조합이 서로 다른 문서 유형에서 작가 검색에 대해 어떤 성능을 내는가?
- RQ3원고와 편지 간의 검색 난이도 차이가 있으며 데이터 세트 하위 집합(MSS, Letters A/B, Charters) 간 차이가 존재하는가?
주요 결과
- SCUT 팀은 전체 테스트 세트에서 SIFT와 Pathlet 특징의 조합으로 가장 높은 mAP(90.6%)를 달성했다.
- 가장 우수한 종합 결과는 SIFT+Pathlet 조합으로 전체 데이터세트에서 mAP 92.5% 및 Top-1 정확도 97.4%를 달성했다.
- Baseline SRS-LBP 변형은 강력한 성능을 보였고(mAP 84.0–86.8%), 때로는 더 복잡한 방법과 대등했다.
- 전통적 방법들(예: Hinge, Co-Hinge, oBIFs)은 경쟁력 있는 mAP 점수(약 75–85%)를 달성해 비신경망 접근 방식도 여전히 효과적임을 시사한다.
- 편지는 원고에 비해 검색이 훨씬 더 어려우며, Letters A 하위집합에서 특히 낮은 성능(mAP 약 45–47%)을 보였다.
- 전반적으로 이 대회에서 신경망 기반 검색 방법이 지배적이지 않았으며, 프리프로세싱에서 CNN 기반의 이진화가 한 제출에서 사용되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.