[논문 리뷰] DEER: Detection-agnostic End-to-End Recognizer for Scene Text Spotting
DEER는 영역 기반 특징 추출 대신 텍스트 인스턴스당 하나의 기준점으로 특징 추출을 대체함으로써 전체 이미지 특징을 활용해 강력한 인식 성능을 달성하는 검출기 의존성 없는 엔드 투 엔드 인식기입니다. 바운딩 박스나 다각형 애너테이션 없이도 임의의 형태의 텍스트 벤치마크에서 경쟁 가능한 성능을 달성하며, 검출 오차에 대해 뛰어난 강건성을 보여줍니다.
Recent end-to-end scene text spotters have achieved great improvement in recognizing arbitrary-shaped text instances. Common approaches for text spotting use region of interest pooling or segmentation masks to restrict features to single text instances. However, this makes it hard for the recognizer to decode correct sequences when the detection is not accurate i.e. one or more characters are cropped out. Considering that it is hard to accurately decide word boundaries with only the detector, we propose a novel Detection-agnostic End-to-End Recognizer, DEER, framework. The proposed method reduces the tight dependency between detection and recognition modules by bridging them with a single reference point for each text instance, instead of using detected regions. The proposed method allows the decoder to recognize the texts that are indicated by the reference point, with features from the whole image. Since only a single point is required to recognize the text, the proposed method enables text spotting without an arbitrarily-shaped detector or bounding polygon annotations. Experimental results present that the proposed method achieves competitive results on regular and arbitrarily-shaped text spotting benchmarks. Further analysis shows that DEER is robust to the detection errors. The code and dataset will be publicly available.
연구 동기 및 목표
- 검출기와 인식기 간의 강한 결합을 줄이기 위해 특징 추출을 영역 기반 풀링에서 분리한다.
- 정확한 바운딩 폴리곤이나 세그멘테이션 마스크에 의존하지 않고도 임의의 형태, 기울임, 곡선 텍스트를 인식할 수 있도록 한다.
- 다각형 수준의 감독이 아닌 단지 기준점 애너테이션만으로도 엔드 투 엔드 모델을 훈련시킨다.
- 단일 기준점에서 전체 이미지의 특징에 주의를 기울일 수 있도록 하여 검출 오차에 대한 강건성을 향상시킨다.
- 최소한의 감독(점 수준의 애너테이션)으로 고성능 텍스트 스포팅을 가능하게 하며, 영역 수준의 애너테이션 대신 점 수준의 애너테이션에 집중한다.
제안 방법
- 모델은 각 텍스트 인스턴스당 하나의 기준점을 사용하여, 디코더가 전체 이미지의 관련 특징에 주의를 기울일 수 있도록 유도한다.
- 학습 중에는 기준점을 예측하는 가속 가능한 위치 헤드가 작동하며, 텍스트 디코더는 크로스 어텐션 메커니즘을 통해 이러한 기준점 중심의 이미지 특징에 주의를 기울인다.
- 디코더는 지역화된 패치가 아닌 전체 이미지의 특징에 주의를 기울여, 검출이 정확하지 않거나 텍스트가 곡선일 경우에도 인식이 가능하다.
- 훈련 중에 기준점 편향 전략을 도입하여 노이즈가 있거나 정확도가 떨어지는 검출 출력에 대한 강건성을 향상시킨다.
- 기준점 샘플링의 대체 방법(Inner 방법)을 제안하며, 훈련 시에는 다각형 내부의 무작위 점을 사용하고, 추론 시에는 중심 단면의 중점 사용.
- 특징 학습을 유도하기 위해 검출 감독을 사용하지만, 추론 시에는 오직 점 수준의 감독만으로도 기능 가능하다.
실험 결과
연구 질문
- RQ1바운딩 박스나 세그멘테이션 마스크와 같은 영역 수준의 애너테이션 없이도 엔드 투 엔드 텍스트 스포팅을 달성할 수 있는가?
- RQ2검출이 정확하지 않을 경우 인식 성능가 어떻게 저하되며, 특징 추출 방식을 변경함으로써 이를 완화할 수 있는가?
- RQ3단일 기준점에서 전체 이미지 특징에 주의를 기울일 경우, 국소화된 영역이 아닌 전역적 특징에 기반해 인식기가 얼마나 일반화될 수 있는가?
- RQ4검출기가 오직 기준점만 제공할 경우, 기준점 의존성 있는 인식기가 곡선이나 비정형 텍스트에서도 높은 정확도를 유지할 수 있는가?
- RQ5노이즈가 있거나 편향된 기준점을 사용해 훈련하면, 검출 오차에 대한 모델의 강건성이 향상되는가?
주요 결과
- DEER는 다각형 애너테이션이나 영역 풀링 없이도 TotalText와 ICDAR2015를 포함한 정규 및 비정형 텍스트 스포팅 벤치마크에서 경쟁 가능한 성능을 달성한다.
- 모델은 검출 오차에 대해 강력한 강건성을 보이며, 정확하지 않은 검출에서 유도된 기준점을 사용할지라도 DEER는 정확하게 텍스트를 인식한다. 세그멘테이션 기반 모델과의 정성적 비교에서 이를 입증한다.
- 훈련 중 기준점 편향 전략이 강건성을 크게 향상시켜, 노이즈가 있는 검출 입력에서의 성능 저하를 줄인다.
- 기준점 샘플링을 위한 Inner 방법은 표준 방법과 유사한 성능을 보이며, 효과적인 인식을 위해 기준점이 텍스트 영역 내부에 있어야 한다는 요구 조건이 필요하지 않음을 시사한다.
- 검출 감독을 통해 훈련하면 인식 성능가 향상되지만, 이는 없이도 모델이 효과적으로 기능하므로 점 수준의 감독만으로도 높은 정확도를 달성할 수 있음을 시사한다.
- 모호한 경우(예: 빨간 배경에 'SALE' 예측, 'SALE' 이후에 'OFF' 예측)에서 구조적인 오류 패tern을 보이며, 전역적 맥락으로 인해 편향 증폭 가능성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.