[논문 리뷰] Self-Training for Domain Adaptive Scene Text Detection
이 논문은 비정형 영상 및 이미지를 활용하여 고품질의 가짜 레이블이 부여된 어려운 예제를 추출하는 도메인 적응형 스트리트 텍스트 검출을 위한 자기학습 프레임워크를 제안한다. 새로운 텍스트 마이닝 모듈(TMM)을 통해 검출 및 추적 결과를 융합하고, 영상이 가용하지 않을 경우 영상 생성 방법(Gen-Loop)을 사용함으로써, ICDAR2015 및 MSRA-TD500에서 최고 성능을 기록하며 최소한의 레이블링 비용으로도 효과를 달성한다.
Though deep learning based scene text detection has achieved great progress, well-trained detectors suffer from severe performance degradation for different domains. In general, a tremendous amount of data is indispensable to train the detector in the target domain. However, data collection and annotation are expensive and time-consuming. To address this problem, we propose a self-training framework to automatically mine hard examples with pseudo-labels from unannotated videos or images. To reduce the noise of hard examples, a novel text mining module is implemented based on the fusion of detection and tracking results. Then, an image-to-video generation method is designed for the tasks that videos are unavailable and only images can be used. Experimental results on standard benchmarks, including ICDAR2015, MSRA-TD500, ICDAR2017 MLT, demonstrate the effectiveness of our self-training method. The simple Mask R-CNN adapted with self-training and fine-tuned on real data can achieve comparable or even superior results with the state-of-the-art methods.
연구 동기 및 목표
- 새로운 도메인에 적용되었을 때 레이블링 데이터가 제한된 상황에서 딥러닝 기반 스트리트 텍스트 검출기의 심각한 성능 저하 문제를 해결하기 위해.
- 비용이 많이 들고 시간이 오래 걸리는 레이블링에 의존도를 줄이기 위해, 비정형 영상 및 이미지를 활용하여 자기학습을 수행함으로써.
- 자동화된 노이즈 감소 하드 예제 마이닝을 통해 타겟 도메인에서의 모델 일반화 능력과 성능 향상을 도모하기 위해.
- 실제 영상이 가용하지 않을 경우에도 이미지에서 영상 유사 시퀀스를 생성하는 이미지-에서-영상 생성 방법을 통해 효과적인 자기학습을 가능하게 하기 위해.
제안 방법
- 자신의 도메인 데이터로 초기화된 검출기를 바탕으로, 비정형 타겟 도메인 영상 또는 이미지에서 유도된 가짜 레이블 예제를 사용하여 재학습하는 자기학습 프레임워크를 제안한다.
- 텍스트 마이닝 모듈(TMM)은 검출 및 추적 결과를 융합하여 노이즈가 있는 예측을 걸러내고 높은 신뢰도의 하드 예제를 식별한다.
- 검출 결과는 마스크 R-CNN 기반 검출기를 통해 생성되며, 추적은 템플릿 매칭을 사용하여 영상 프레임 간 객체 일관성을 유지한다.
- 실제 영상이 가용하지 않을 경우, 이미지에서 영상 유사 시퀀스를 생성하는 이미지-에서-영상 생성 방법(Gen-Loop)을 사용한다.
- 재학습 과정에서 균형 손실을 적용하여 학습 안정성과 가짜 레이블 데이터에 대한 수렴 성능을 향상시킨다.
- 영상 및 이미지 입력을 모두 지원하며, 다중 자기학습 루프를 통해 반복적인 개선을 수행한다.
실험 결과
연구 질문
- RQ1비정형 영상 및 이미지에서 유도된 가짜 레이블 예제를 활용한 자기학습이, 레이블이 없거나 최소한의 레이블링만 있는 타겟 도메인에서 스트리트 텍스트 검출 성능을 효과적으로 향상시킬 수 있는가?
- RQ2검출 및 추적 결과를 어떻게 효과적으로 융합하여 가짜 레이블의 노이즈를 줄이고 마이닝된 하드 예제의 품질을 향상시킬 수 있는가?
- RQ3이미지-에서-영상 생성 방법(Gen-Loop)이 타겟 도메인에서 영상이 가용하지 않을 경우 자기학습을 얼마나 효과적으로 가능하게 하는가?
- RQ4데이터 생성 및 도메인 적응 기법과 비교했을 때, 제안된 방법은 훈련 데이터의 성능 및 현실성 측면에서 어떤가?
- RQ5단순한 검출기(Mask R-CNN 등)가 아키텍처 수정 없이 자기학습을 통해 최고 성능(SOTA)을 달성할 수 있는가?
주요 결과
- 실제 타겟 데이터에 대해 피지컬 튜닝을 수행한 결과, 제안된 자기학습 프레임워크는 ICDAR2015에서 기준 최고 성능 모델보다 F1 점수 1.2% 높은 84.2 F1을 기록하여 이전의 최고 기술(SOTA)을 초월한다.
- MSRA-TD500에서 15VID를 소스로 사용하고 타겟 데이터에서 자기학습을 수행할 경우, F1 점수를 70.0에서 79.1로 향상시켜 강력한 도메인 적응 능력을 입증한다.
- 외부 데이터 없이도 ICDAR2015에서 81.0 F1을 기록하여, 800만 장의 합성 이미지를 추가 데이터로 사용하는 기존 방법들을 능가한다.
- 데이터 증강(AUG)을 추가하면 ICDAR2015에서 F1 점수가 88.2로 상승하여 문헌에 보고된 최고 성능과 동일하거나 이를 초월한다.
- Gen-Loop 방법을 통해 이미지 전용 데이터에서도 효과적인 자기학습이 가능하며, 증강 데이터를 사용할 경우 MSRA-TD500에서 F1 점수 84.3을 기록하여 자료가 부족한 상황에서의 효과성을 입증한다.
- TMM는 다양한 벤치마크 및 도메인에서 일관된 성능 향상을 통해 가짜 레이블의 노이즈를 크게 감소시켰다는 점에서 뚜렷한 효과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.