[논문 리뷰] 1st Place Solution to ICDAR 2021 RRC-ICTEXT End-to-end Text Spotting and Aesthetic Assessment on Integrated Circuit
이 논문은 ICDAR 2021 RRC-ICTEXT 챌린지의 최우수 솔루션을 제시하며, YOLOv5 기반 모델을 사용하여 통합 회로 이미지에서 엔드 투 엔드 텍스트 스포팅과 미학 평가를 통합한다. 이 접근법은 데이터 증강, 합성 데이터 생성, 준지도 학습, 마스크된 손실을 사용한 지식 정복, 그리고 TensorRT 배포를 통해 작업 3.1에서 59.1 mAP(1위), 작업 3.2에서 78.7% F2 스코어(1위)를 달성하였으며, 31 FPS 및 306MB 메모리로 구동된다.
This paper presents our proposed methods to ICDAR 2021 Robust Reading Challenge - Integrated Circuit Text Spotting and Aesthetic Assessment (ICDAR RRC-ICTEXT 2021). For the text spotting task, we detect the characters on integrated circuit and classify them based on yolov5 detection model. We balance the lowercase and non-lowercase by using SynthText, generated data and data sampler. We adopt semi-supervised algorithm and distillation to furtherly improve the model's accuracy. For the aesthetic assessment task, we add a classification branch of 3 classes to differentiate the aesthetic classes of each character. Finally, we make model deployment to accelerate inference speed and reduce memory consumption based on NVIDIA Tensorrt. Our methods achieve 59.1 mAP on task 3.1 with 31 FPS and 306M memory (rank 1), 78.7\% F2 score on task 3.2 with 30 FPS and 306M memory (rank 1).
연구 동기 및 목표
- 통합 회로 텍스트 스포팅 데이터셋에서 소문자와 비소문자 문자 간의 불균형을 해결한다.
- 3,000개의 레이블이 없는 샘플을 활용한 준지도 학습을 통해 모델의 일반화 능력과 정확도를 향상시킨다.
- 흐릿함, 저대비, 손상된 텍스트를 위한 3개 클래스 분류 헤드를 추가하여 검출 파이프라인에 미학 평가를 통합한다.
- 작업 3.1과 3.2의 3S 스코어 기준을 충족하기 위해 추론 속도와 메모리 소비를 최적화하여 최상위 순위를 확보한다.
- 고정밀도를 유지하면서 추론 속도를 향상시키고 메모리 사용량을 감소시키기 위해 최종 모델을 NVIDIA TensorRT로 배포한다.
제안 방법
- 학생 모델로 YOLOv5s, 교사 모델로 YOLOv5x를 사용하고, 희귀 클래스에 우선순위를 두기 위해 마스크를 적용한 지식 정복을 수행한다.
- 마스크된 지식 정복 손실을 정의한다: $\text{loss}_{\text{distillation}} = \text{MSE}(f_t*\text{mask}, f_s*\text{mask}) + \text{KL}(f_{t-\text{cls}}, f_{s-\text{cls}})$, 여기서 마스크는 희귀 클래스의 고iou 예측에 집중한다.
- 흰색 폰트와 스타일 전이 기법을 사용해 합성 소문자 문자를 생성하여 클래스 분포를 균형 잡는다.
- 반복 요소 샘플링(RFS)과 데이터 증강(Mosaic, 히스토그램 평준화, 90°-회전)을 적용해 모델의 강건성을 향상시킨다.
- 검증 데이터에 대해 의사 레이블링과 함께 예측의 가중 평균 융합(WBF)을 사용해 준지도 학습을 구현한다.
- 입력 크기 672×672, 배치 크기 1, NMS 임계값 0.1로 최종 YOLOv5s 모델을 NVIDIA TensorRT로 배포하여 속도와 메모리 소비를 최적화한다.
실험 결과
연구 질문
- RQ1통합 회로 텍스트 스포팅에서 소문자와 비소문자 문자 간의 불균형을 효과적으로 완화할 수 있는 방법은 무엇인가?
- RQ23,000개의 레이블이 없는 샘플만 제공될 경우 준지도 학습이 모델 성능 향상에 얼마나 기여할 수 있는가?
- RQ3통합된 검출 및 분류 헤드는 문자 인식과 미학 품질을 동시에 효과적으로 예측할 수 있는가?
- RQ4클래스 인식 마스크를 사용한 지식 정복은 표준 정복 방식에 비해 소형 학생 모델의 성능을 어떻게 향상시키는가?
- RQ5실제 배포 환경에서 모델 크기, 추론 속도, 정확도 간의 상충 관계는 무엇이며, 이를 어떻게 최적화할 수 있는가?
주요 결과
- 최종 모델은 31 FPS 및 306MB GPU 메모리로 작업 3.1에서 59.1 mAP를 달성하여 벤치마크에서 1위를 차지했다.
- 작업 3.2에서는 29.68 FPS 및 305.88MB 메모리로 78.7% F2 스코어를 기록하여 역시 1위를 달성했다.
- 마스크를 사용한 지식 정복은 검증 데이터에서 YOLOv5s의 mAP를 58.5%에서 59.4%로 향상시켜 표준 정복 방식을 뛰어넘었다.
- 합성 데이터 생성으로 소문자 문자 수가 4.4k 증가하여 희귀 클래스의 AP가 크게 향상되었다.
- TensorRT 배포로 메모리 소비가 745.75MB(파이토치 기준)에서 305.88MB로 감소하고, 작업 3.1에서 추론 속도가 25.45 FPS에서 31.04 FPS로 향상되었다.
- 3S 스코어는 작업 3.1에서 0.74, 작업 3.2에서 0.85를 기록하여 속도, 크기, 정확도의 우수한 최적화를 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.