[논문 리뷰] I3CL:Intra- and Inter-Instance Collaborative Learning for Arbitrary-shaped Scene Text Detection
I3CL은 다중 수용장치 필터를 통한 내부 인스턴스 공동 학습과 텍스트 인스턴스 트랜스포머를 통한 외부 인스턴스 공동 학습을 활용하여 임의의 형태를 가진 텍스트에서 발생하는 균열 검출과 배경 혼동 문제를 해결하는 새로운 이단계적 스트리트 텍스트 검출기이다. ResNeSt-101을 사용하여 ArT에서 77.5%의 F-측정치, Total-Text에서 86.9%, CTW-1500에서 86.4%를 기록하며 최신 기술 성능을 달성했으며, ArT 랭킹에서 1위를 기록했다.
Existing methods for arbitrary-shaped text detection in natural scenes face two critical issues, i.e., 1) fracture detections at the gaps in a text instance; and 2) inaccurate detections of arbitrary-shaped text instances with diverse background context. To address these issues, we propose a novel method named Intra- and Inter-Instance Collaborative Learning (I3CL). Specifically, to address the first issue, we design an effective convolutional module with multiple receptive fields, which is able to collaboratively learn better character and gap feature representations at local and long ranges inside a text instance. To address the second issue, we devise an instance-based transformer module to exploit the dependencies between different text instances and a global context module to exploit the semantic context from the shared background, which are able to collaboratively learn more discriminative text feature representation. In this way, I3CL can effectively exploit the intra- and inter-instance dependencies together in a unified end-to-end trainable framework. Besides, to make full use of the unlabeled data, we design an effective semi-supervised learning method to leverage the pseudo labels via an ensemble strategy. Without bells and whistles, experimental results show that the proposed I3CL sets new state-of-the-art results on three challenging public benchmarks, i.e., an F-measure of 77.5% on ICDAR2019-ArT, 86.9% on Total-Text, and 86.4% on CTW-1500. Notably, our I3CL with the ResNeSt-101 backbone ranked 1st place on the ICDAR2019-ArT leaderboard. The source code will be available at https://github.com/ViTAE-Transformer/ViTAE-Transformer-Scene-Text-Detection.
연구 동기 및 목표
- 문자 간 간격의 약한 특징 표현으로 인해 발생하는 임의의 형태의 텍스트 인스턴스에서의 균열 검출 문제를 해결하기 위해.
- 텍스트 인스턴스 간 장거리 의존성을 모델링하여 복잡한 배경에서의 검출 정확도를 향상시키기 위해.
- 단일 인스턴스 내에서 문자 및 간격 영역의 공동 학습을 통해 특징 표현을 향상시키기 위해.
- 다수의 텍스트 인스턴스 간 공유되는 의미적 배경 정보를 활용하여 텍스트와 비텍스트 영역 간의 구분 능력을 향상시키기 위해.
- 제한된 애너테이션 자료를 바탕으로 한 효과적인 준지도 학습 전략을 개발하여 일반화 능력을 향상시키기 위해.
제안 방법
- I3CL은 다중 수용장치를 가진 캐스케이드 구조의 컨볼루션 블록을 사용하여 단일 텍스트 인스턴스 내의 문자와 간격 영역에서 특징을 동시에 학습하는 내부 공동 학습(Intra-CL) 모듈을 도입한다.
- 외부 공동 학습(Inter-CL) 모듈은 이미지 내 서로 다른 텍스트 인스턴스 간 장거리 의존성을 모델링하기 위해 트랜스포머 기반 아키텍처를 활용한다.
- 글로벌 컨텍스트 모듈은 공유된 배경에서 의미 정보를 캡처하여 인스턴스 간 특징 구분 능력을 향상시킨다.
- 이 방법은 엔드 투 엔드로 학습 가능한 이단계 검출 프레임워크 내에서 내부 및 외부 인스턴스 공동 학습을 통합한다.
- 준지도 학습을 위해 앙상블 기반의 가짜 레이블링 전략을 설계하여 비정답 데이터를 효과적으로 활용한다.
- 모델은 ResNet 및 ResNeSt 백본을 사용하여 ArT, Total-Text, CTW-1500 세 가지 공개 벤치마크에서 훈련 및 평가된다.
실험 결과
연구 질문
- RQ1단일 텍스트 인스턴스 내에서의 공동 학습이 문자 및 간격 영역의 특징 표현을 향상시켜 균열 검출을 줄일 수 있는가?
- RQ2다른 텍스트 인스턴스 간의 의존성을 모델링하면 복잡한 배경에서의 검출 정확도가 향상되는가?
- RQ3트랜스포머 기반 모듈이 임의의 형태의 텍스트 검출에서 인스턴스 간 관계를 효과적으로 포착할 수 있는가?
- RQ4글로벌 배경 컨텍스트를 효과적으로 활용하여 텍스트 영역와 비텍스트 영역 간의 특징 구분 능력을 향상시킬 수 있는가?
- RQ5준지도 학습에서 앙상블 기반의 가짜 레이블링 전략이 제한된 애너테이션 자료로도 검출 성능을 크게 향상시킬 수 있는가?
주요 결과
- I3CL은 ArT 벤치마크에서 77.5%의 새로운 최고 성능 F-측정치를 기록하며 공식 랭킹에서 1위를 달성했다.
- Total-Text에서 I3CL은 86.9%의 F-측정치를 기록하여 이전 방법들을 능가했다.
- CTW-1500에서 I3CL는 86.4%의 F-측정치를 달성하여 장거리이고 굴곡진 텍스트에 대한 강력한 일반화 능력을 입증했다.
- 계산량이 20.7% 증가했음에도 불구하고 마스크 R-CNN 베이스라인 대비 F-측정치가 3% 이상 향상되었다.
- CTW-1500에서 I3CL는 7.6 fps의 추론 속도를 기록하여 속도와 정확도 모두에서 PSENet 및 ContourNet을 능가했다.
- 제거 실험을 통해 내부 및 외부 인스턴스 공동 학습 구성 요소가 성능 향상에 필수적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.