[논문 리뷰] ICFHR 2020 Competition on Image Retrieval for Historical Handwritten Fragments
이 논문은 역사적 수기 조각의 이미지 검색을 위한 ICFHR 2020 경연 대회를 제시하며, 20,000건의 문서에서 9,800명의 글쓰는 이들로부터 120,000건이 넘는 조각으로 이루어진 대규모 데이터셋을 소개한다. 이 경연은 딥러닝 및 자기지도 학습 모델을 활용한 글쓰는 이 및 페이지 조각 검색 방법을 평가하며, 우승한 참가자가 자기지도 학습 기반 기술 특징 학습을 사용하여 mAP가 40% 미만을 기록함으로써, 역사적 문헌 분석에서 작은, 비정형 조각이 가지는 과제를 부각시킨다.
This competition succeeds upon a line of competitions for writer and style analysis of historical document images. In particular, we investigate the performance of large-scale retrieval of historical document fragments in terms of style and writer identification. The analysis of historic fragments is a difficult challenge commonly solved by trained humanists. In comparison to previous competitions, we make the results more meaningful by addressing the issue of sample granularity and moving from writer to page fragment retrieval. The two approaches, style and author identification, provide information on what kind of information each method makes better use of and indirectly contribute to the interpretability of the participating method. Therefore, we created a large dataset consisting of more than 120 000 fragments. Although the most teams submitted methods based on convolutional neural networks, the winning entry achieves an mAP below 40%.
연구 동기 및 목표
- 문화유산 응용 분야에서 역사적 수기 조각을 검색하는 데 도전하는 데 목적이 있으며, 특히 고전적 문헌의 테두리 주석 및 이중행 주석을 대상으로 한다.
- 데이터셋 규모를 증대하고 이전 경연에서의 글쓰는 이 식별 중심에서 조각 수준의 검색으로 초점을 이동시킴으로써 이전 경연을 넘어서 정확도를 향상시키는 데 목적이 있다.
- 글쓰는 이 기반 및 페이지 기반 검색 작업 간의 성능 및 해석 가능성의 차이를 평가하는 데 목적이 있다.
- 반복 가능한 분할 기술을 활용한 반자동 분할 기반으로, 역사적 문서 이미지 검색을 위한 공개 가능한 대규모 기준 데이터셋을 구축하는 데 목적이 있다.
- 딥러닝 모델, 자기지도 학습, 전통적 방법의 효과성을 작은, 비정형 조각에 대해 비교하는 데 목적이 있다.
제안 방법
- 다이아몬드-스쿼어 알고리즘에 기반한 반자동 분할 파이프라인을 통해 고해상도 문서 이미지에서 랜덤형 및 직사각형 형태의 조각을 생성한다.
- 랜덤형 조각은 높이 맵을 이진화하여 마진 임계값을 설정함으로써 조각 간 분리 정도를 제어한다.
- 직사각형 조각은 수평 및 수직 축을 따라 비선형적이고 전진 방향의 다각형 체인을 사용하여 자연스러운 자르기 효과를 시뮬레이션한다.
- 데이터셋은 약 20,000건의 문서에서 유래한 120,000건 이상의 조각을 포함하며, 9,800명의 고유 글쓰는 이가 포함되어 있으며, 훈련, 검증, 테스트 세트로 분할된다.
- 4개 팀이 방법을 제출하였으며, 이중 경로 네트워크, 자기지도 학습 ResNet20, 기준 SIFT 기반 검색 포함, mAP, Pr@10, Pr@100 기준 평가.
- 조각 크기(유효 픽셀 수), 형태 유형(랜덤 대비 직사각형), 작업 유형(글쓰는 이 대비 페이지 검색)에 따른 성능을 비교한다.
실험 결과
연구 질문
- RQ1다양한 딥러닝 아키텍처는 작은, 비정형 역사적 수기 조각 검색에서 어떻게 성능을 내는가?
- RQ2자기지도 학습 모델과 글쓰는 이 지도 학습 모델은 조각 유형 및 크기에 걸쳐 일반화 능력에서 얼마나 다른가?
- RQ3조각의 형태와 픽셀 밀도가 다양한 방법에 대해 검색 성능에 상당한 영향을 미치는가?
- RQ4자기지도 학습이 글쓰는 이 레이블 없이도 경쟁 가능한 성능을 달성할 수 있으며, 지도 학습 접근법과 비교해 볼 때 어떤가?
- RQ5전통적 방법인 SIFT 기반 검색은 이 조각 수준 검색 작업에서 현대 딥러닝 모델과 비교해 어떻게 성능을 내는가?
주요 결과
- 우승한 방법은 자기지도 학습 기반 기술 특징 학습(ResNet20_ssl)에 기반하여 페이지 조각 검색 작업에서 가장 높은 mAP와 1위 정확도를 기록하며 다른 방법들을 압도했다.
- 글쓰는 이 레이블을 사용해 훈련한 TwoPath 모델(TwoPath_writer)은 페이지 검색을 위해 훈련한 TwoPath 모델(TwoPath_page)보다 성능이 뛰어나, 글쓰는 이 지도 학습이 일반화 능력을 향상시킨다는 것을 시사한다.
- 작은 조각(10,000~100,000 유효 픽셀)에서는 TwoPath 모델가 뛰어난 성능을 보였고, 더 큰, 거의 직사각형인 조각에서는 ResNet20_ssl이 그들을 능가했다.
- SIFT 키포인트에 의존하는 방법은 배경 간섭으로 인해 성능이 열악했고, 기준 방법은 상위 참가자들과 유사한 높은 성능을 기록했다.
- 직사각형 조각은 높은 픽셀 밀도(0.60 대비 0.35)를 보이며 모든 방법에서 유의미하게 더 좋은 결과를 보였고, 형태와 콘텐츠의 밀도가 검색 성공 여부를 강력하게 예측하는 요소임을 시사한다.
- 모든 조각 크기에서 단일 방법이 우세하지 않음을 고려할 때, 모델 융합이 추가적인 성능 향상 가능성을 가짐을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.