[논문 리뷰] Chinese Text Recognition with A Pre-Trained CLIP-Like Model Through Image-IDS Aligning
이 논문은 인쇄된 한자 이미지와 그들의 한자 기술 서열(_IDS_)을 정렬함으로써 정규화된 문자 표현을 학습하는 CLIP 유사 모델(CCR-CLIP)을 사전 훈련하는 이중 단계 프레임워크를 제안한다. 이는 미세조정 없이도 제로샷 인식을 가능하게 하며, 중국어 문자 인식 및 텍스트 인식 벤치마크에서 최신 기술 성능(SOTA)을 달성한다. 특히 제로샷 및 희소샷 설정에서 뛰어난 성능을 보인다.
Scene text recognition has been studied for decades due to its broad applications. However, despite Chinese characters possessing different characteristics from Latin characters, such as complex inner structures and large categories, few methods have been proposed for Chinese Text Recognition (CTR). Particularly, the characteristic of large categories poses challenges in dealing with zero-shot and few-shot Chinese characters. In this paper, inspired by the way humans recognize Chinese texts, we propose a two-stage framework for CTR. Firstly, we pre-train a CLIP-like model through aligning printed character images and Ideographic Description Sequences (IDS). This pre-training stage simulates humans recognizing Chinese characters and obtains the canonical representation of each character. Subsequently, the learned representations are employed to supervise the CTR model, such that traditional single-character recognition can be improved to text-line recognition through image-IDS matching. To evaluate the effectiveness of the proposed method, we conduct extensive experiments on both Chinese character recognition (CCR) and CTR. The experimental results demonstrate that the proposed method performs best in CCR and outperforms previous methods in most scenarios of the CTR benchmark. It is worth noting that the proposed method can recognize zero-shot Chinese characters in text images without fine-tuning, whereas previous methods require fine-tuning when new classes appear. The code is available at https://github.com/FudanVI/FudanOCR/tree/main/image-ids-CTR.
연구 동기 및 목표
- 최근 라틴 스크립트 인식의 발전에도 불구하고 여전히 미비한 연구가 이루어지고 있는 제로샷 및 희소샷 중국어 문자 인식의 과제를 해결하기 위해.
- 자기부문의 분해를 통해 라디칼으로 분해함으로써 인간과 유사한 인식 방식을 모방하기 위해.
- 사전 훈련된 정규화된 표현을 활용하여 엔드 투 엔드 텍스트 인식 성능을 향상시키는 이중 단계 프레임워크를 개발하기 위해.
- 기존 방법의 한계인 모델의 미세조정이 필요로 하지 않는, 새로운 중국어 문자의 인식을 가능하게 하기 위해.
제안 방법
- 대응 손실을 사용하여 이미지-IDS 정렬을 통해 인쇄된 중국어 문자의 이미지 임베딩과 해당하는 이디오그래믹 기술 서열(_IDS_)의 텍스트 임베딩을 정렬하는 CLIP 유사 모델(CCR-CLIP)을 사전 훈련한다.
- 동일한 문자의 다른 폰트 스타일을 가진 이미지 간의 추가 대응 손실을 도입하여 도메인 일반화를 향상시키고 폰트 편향을 줄인다.
- 사전 훈련된 텍스트 인코더를 사용하여 라디칼 서열의 정규화된 표현을 생성하고, 이를 CTR 단계에서의 감독으로 사용한다.
- CTR 단계에서 특성 추출된 문자 임베딩과 학습된 정규화된 표현 간의 유사도를 계산하는 이미지-IDS 매칭 헤드를 사용한다.
- 대응 손실($\mathcal{L}_{ctr}$)에 매칭 헤드와 정규화 항을 적용하여 특징의 분류 능력과 일반화 능력을 향상시킨다.
- 특징 공간에서 방향성 관련 혼동을 줄이기 위해 수직 텍스트 이미지를 반시계방향으로 90도 회전시키는 사전 처리 단계를 통합한다.
실험 결과
연구 질문
- RQ1사전 훈련된 CLIP 유사 모델이 이미지-IDS 정렬을 통해 중국어 문자의 정규화된 표현을 효과적으로 학습할 수 있는가?
- RQ2학습된 정규화된 표현이 미세조정 없이도 텍스트 이미지 내에서 본 적 없는 중국어 문자의 제로샷 인식을 가능하게 할 수 있는가?
- RQ3제안된 이중 단계 프레임워크는 중국어 문자 인식 및 텍스트 인식 벤치마크에서 기존 방법과 비교해 성능 면에서 어떻게 다른가?
- RQ4다른 분해 수준(라디칼, 획)이 CCR-CLIP 모델의 성능에 어떤 영향을 미치는가?
- RQ5희소 데이터 환경, 예를 들어 희소 학습 데이터나 제한된 학습 데이터 시나리오에서 이 방법의 견고성은 어떠한가?
주요 결과
- CCR-CLIP 모델은 중국어 문자 인식 벤치마크에서 최신 기술 성능(SOTA)을 달성하며, 이전 방법들보다 명확한 격차를 확보한다.
- CTR 벤치마크에서 제안된 방법은 대부분의 시나리오에서 이전 SOTA 방법을 능가하며, 특히 제로샷 및 희소샷 설정에서 두각을 나타낸다.
- 제안된 매칭 헤드를 사용할 경우 웹 데이터셋에서 3.14%의 성능 향상과 필기 데이터셋에서 5.54%의 성능 향상을 달성한다.
- $\mathcal{L}_{ctr}$의 정규화 항은 네 개의 데이터셋에서 평균 성능을 1.12% 향상시킨다.
- 희소 데이터 환경에서도 강력한 견고성을 유지하며, 장면 및 문서 데이터셋에서 학습 데이터가 감소했을 때 TransOCR를 명확한 격차로 능가한다.
- t-SNE를 통한 시각화 결과, 손실 $\mathcal{L}_{I}$가 특징 클러스터링을 향상시켜 특히 필기 및 노이즈가 많은 샘플의 잘못된 분류를 줄이는 데 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.