Skip to main content
QUICK REVIEW

[논문 리뷰] Omnidirectional Scene Text Detection with Sequential-free Box Discretization

Yuliang Liu, Sheng Zhang|arXiv (Cornell University)|2019. 06. 06.
Handwritten Text Recognition Techniques참고 문헌 17인용 수 13
한 줄 요약

이 논문은 순서 없는 상자 이산화(Sequential-free Box Discretization, SBD)라는 새로운 방법을 제안한다. SBD는 정점 순서에 민감한 레이블링 문제를 해결하기 위해 사각형 바운딩 박스를 순서에 관계없는 핵심 모서리(KEs)로 매개변수화함으로써, 다각도로 기울어진 시나리오 텍스트 검출에서 레이블 순서 민감도를 제거한다. SBD는 정확도와 일반화 능력을 향상시켜, ICDAR2015, MLT, MSRA-TD500, HRSC2016에서 최신 기술보다 최대 7.7% mAP 향상을 기록하며, Mask R-CNN에 통합된 경우 Hmean에서 2.4% 향상을 달성한다.

ABSTRACT

Scene text in the wild is commonly presented with high variant characteristics. Using quadrilateral bounding box to localize the text instance is nearly indispensable for detection methods. However, recent researches reveal that introducing quadrilateral bounding box for scene text detection will bring a label confusion issue which is easily overlooked, and this issue may significantly undermine the detection performance. To address this issue, in this paper, we propose a novel method called Sequential-free Box Discretization (SBD) by discretizing the bounding box into key edges (KE) which can further derive more effective methods to improve detection performance. Experiments showed that the proposed method can outperform state-of-the-art methods in many popular scene text benchmarks, including ICDAR 2015, MLT, and MSRA-TD500. Ablation study also showed that simply integrating the SBD into Mask R-CNN framework, the detection performance can be substantially improved. Furthermore, an experiment on the general object dataset HRSC2016 (multi-oriented ships) showed that our method can outperform recent state-of-the-art methods by a large margin, demonstrating its powerful generalization ability. Source code: https://github.com/Yuliang-Liu/Box_Discretization_Network.

연구 동기 및 목표

  • 사각형 기반 시나리오 텍스트 검출에서 순서에 따라 달라지는 레이블링으로 인한 혼동 문제를 해결하기 위해.
  • 다각도로 기울어진 텍스트 검출의 바운딩 박스 회귀에서 레이블 순서 순서에 의존하는 문제를 제거하기 위해.
  • 순서 없는 바운딩 박스 매개변수화로써 불변 핵심 모서리(KEs)를 도입함으로써 검출 신뢰도와 성능을 향상시키기 위해.
  • 시나리오 텍스트를 넘어 다각도로 기울어진 선박 검출과 같은 다른 기울어진 객체 검출 작업으로의 일반화를 보여주기 위해.
  • 특히 Mask R-CNN에 통합된 경우 최소한의 아키텍처 변경으로 최신 기술 성능을 달성하기 위해.

제안 방법

  • SBD는 사각형 바운딩 박스를 중심점과 대각선 교차점과 같은 불변 기하학적 점에서 유도된 네 개의 핵심 모서리(KEs)로 이산화한다. 이는 레이블 순서에 영향을 받지 않는다.
  • 점 순서에 의존하지 않고 예측된 KEs를 진짜 KEs와 정렬하는 새로운 매칭 기반 학습 전략을 도입한다.
  • Mask R-CNN 프레임워크에 KEs를 예측하는 새로운 브랜치를 추가하여 순서 없는 지도 학습을 가능하게 하고, 레이블 혼동을 줄인다.
  • 후처리 단계에서 KE에서 유도된 좌표를 사용해 더 타이트하고 정확한 사각형 바운딩 박스를 재구성한다.
  • 감도 기반 재순위 매기기 전략을 도입하고 감마 파라미터를 사용하여 검출 결과를 추가로 정밀하게 다듬는다.
  • 이 방법은 엔드 투 엔드로 학습되며, 기존의 인스턴스 세그멘테이션 및 검출 파이프라인과 호환된다.

실험 결과

연구 질문

  • RQ1사각형 바운딩 박스의 순서 없는 매개변수화 방식이 레이블 혼동을 줄이고 검출의 강건성을 향상시킬 수 있는가?
  • RQ2KEs에 불변 기하학적 점을 사용함으로써 일관되지 않은 레이블 순서로 인한 성능 저하를 제거할 수 있는가?
  • RQ3SBD가 아키텍처를 대대적으로 수정하지 않고도 Mask R-CNN에 원활하게 통합되어 검출 정확도를 향상시킬 수 있는가?
  • RQ4SBD는 시나리오 텍스트를 넘어 다른 기울어진 객체 검출 작업으로도 잘 일반화되는가?
  • RQ5다양한 데이터 증강 및 레이블 노이즈 조건에서 SBD는 최신 기술 대비 어떻게 성능을 내는가?

주요 결과

  • SBD는 Mask R-CNN에 통합된 ICDAR2015에서 Hmean을 2.4% 향상시키며, 재순위 매기기 기법을 사용할 경우 추가로 0.6% 향상된다.
  • SBD는 HRSC2016 선박 검출 벤치마크에서 93.7% mAP를 기록하여 이전 최신 기술인 RRD 방법보다 7.7% 높은 성능을 달성한다.
  • SBD는 레이블 순서 변화에 강건하다: 랜덤으로 회전된 데이터로 훈련 데이터를 증강했을 때 Hmean은 오직 0.3% 감소하지만, EAST는 9.7%, CTD는 13.7% 감소한다.
  • 절단 분석 결과 SBD는 검출 신뢰도를 향상시키고 더 타이트한 예측을 위한 효과적인 후처리를 가능하게 한다.
  • SBD는 훈련 데이터가 제한된 상황에서도 강력한 성능 유지를 보이며, HRSC2016 실험에서 훈련 시간이 단 두 시간으로도 충분히 높은 성능을 달성한다.
  • 이 방법은 뛰어난 일반화 능력을 보이며, MLT, ICDAR2015, MSRA-TD500를 포함한 여러 벤치마크에서 최신 기술을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.