[논문 리뷰] ICDAR 2019 Robust Reading Challenge on Reading Chinese Text on Signboard
이 논문은 ICDAR 2019에서 열린 중국어 간판 텍스트(ReCTS)에 대한 내구성 있는 독서 도전 과제를 제시하며, 세부 문자 및 텍스트 라인 주석이 포함된 25,000장의 레이블이 부여된 간판 이미지로 구성된 대규모 데이터셋을 소개한다. 이 도전 과제는 문자 인식, 텍스트 라인 인식, 텍스트 라인 검출, 엔드 투 엔드 인식의 네 가지 과제를 포함하며, 중국어 텍스트의 모호성을 다루기 위해 새로운 다중 기준값 평가 방법을 사용하여 전 세계 기관에서 46개 팀, 262건의 제출을 기반으로 뛰어난 성능을 달성하였다.
Chinese scene text reading is one of the most challenging problems in computer vision and has attracted great interest. Different from English text, Chinese has more than 6000 commonly used characters and Chinesecharacters can be arranged in various layouts with numerous fonts. The Chinese signboards in street view are a good choice for Chinese scene text images since they have different backgrounds, fonts and layouts. We organized a competition called ICDAR2019-ReCTS, which mainly focuses on reading Chinese text on signboard. This report presents the final results of the competition. A large-scale dataset of 25,000 annotated signboard images, in which all the text lines and characters are annotated with locations and transcriptions, were released. Four tasks, namely character recognition, text line recognition, text line detection and end-to-end recognition were set up. Besides, considering the Chinese text ambiguity issue, we proposed a multi ground truth (multi-GT) evaluation method to make evaluation fairer. The competition started on March 1, 2019 and ended on April 30, 2019. 262 submissions from 46 teams are received. Most of the participants come from universities, research institutes, and tech companies in China. There are also some participants from the United States, Australia, Singapore, and Korea. 21 teams submit results for Task 1, 23 teams submit results for Task 2, 24 teams submit results for Task 3, and 13 teams submit results for Task 4. The official website for the competition is http://rrc.cvc.uab.es/?ch=12.
연구 동기 및 목표
- 실세계의 간판에서 복잡한 레이아웃, 다양한 폰트, 높은 문자 변동성으로 인해 발생하는 중국어 텍스트 인식의 과제를 해결하기 위해.
- 25,000장의 간판 이미지로 구성된 대규모이고 세밀하게 주석이 부여된 데이터셋을 구축하여 중국어 장면 텍스트 인식을 위한 내구성 있는 벤치마크를 개발하기 위해.
- 문자 인식, 텍스트 라인 인식, 텍스트 라인 검출, 엔드 투 엔드 인식의 다양한 과제를 평가하고 비교하기 위해.
- 중국어 텍스트 전사에 내재된 모호성을 공정하게 반영하기 위해 다중 기준값(Multi-GT) 평가 전략을 도입하기 위해.
- 중국어 텍스트 인식 분야의 국제적 협력과 혁신을 촉진하기 위해 대학, 연구소, 기술 기업이 참여하는 글로벌 경쟁을 조직하기 위해.
제안 방법
- 25,000장의 스트리트 뷰 간판 이미지로 구성된 대규모 데이터셋을 수집하고, 모든 문자와 텍스트 라인에 대해 경계 상자와 전사를 정확히 주석 처리하였다.
- 문자 인식, 텍스트 라인 인식, 텍스트 라인 검출, 엔드 투 엔드 인식의 네 가지 별도의 과제를 정의하여 시스템 능력의 다양한 수준을 평가하였다.
- 한 이미지당 여러 개의 정답 전사가 가능하도록 하는 다중 기준값(Multi-GT) 평가 방법을 제안하여 중국어 텍스트 인식의 모호성을 반영하였다.
- 온라인으로 대회를 개최하고 전용 웹사이트를 운영하여 중국, 미국, 호주, 싱가포르, 한국을 포함한 10개 국가에서 46개 팀이 참가할 수 있도록 하였다.
- 전사 변형에 강건한 평가 지표를 설계하여 다양한 인식 접근 방식 간의 공정한 비교를 보장하였다.
실험 결과
연구 질문
- RQ1내구성 있는 텍스트 인식 연구를 지원하기 위해 어떻게 대규모이고 고품질의 중국어 간판 이미지 데이터셋을 구축할 수 있는가?
- RQ2레이아웃, 폰트, 문자 복잡성으로 인해 실세계 간판에서 중국어 텍스트를 인식하는 데 발생하는 주요 과제는 무엇인가?
- RQ3다중 기준값 평가 방법은 중국어 텍스트 인식 시스템 평가의 공정성과 정확성을 어떻게 향상시키는가?
- RQ4실세계 중국어 간판 데이터에서 문자 인식, 텍스트 라인 인식, 검출, 엔드 투 엔드 인식 등의 다양한 과제에서 달성할 수 있는 성능 수준는 어떠한가?
- RQ5다양한 기관에서 개발한 최신 기술 방법들이 실세계 조건에서 중국어 장면 텍스트의 복잡성을 어떻게 다루는가?
주요 결과
- 대회에는 전 세계 46개 팀에서 총 262건의 제출이 이루어져 중국어 텍스트 인식 연구에 대한 강력한 글로벌 참여를 보였다.
- Task 1(문자 인식)에 21개 팀, Task 2(텍스트 라인 인식)에 23개 팀, Task 3(텍스트 라인 검출)에 24개 팀, Task 4(엔드 투 엔드 인식)에 13개 팀이 결과를 제출하였다.
- 다중 기준값 평가 방법은 전사의 모호성으로 인한 편향을 효과적으로 줄여 공정하고 신뢰할 수 있는 성능 비교를 가능하게 하였다.
- 25,000장의 주석이 부여된 간판 이미지로 구성된 공개된 데이터셋은 향후 중국어 장면 텍스트 이해 연구를 위한 종합적인 벤치마크를 제공한다.
- 모든 과제에서 높은 성능가 달성되었으며, 특히 엔드 투 엔드 인식에서 검출과 인식의 통합 모델링 기술의 진전이 두드러졌다.
- 도전 과제는 중국 소속 팀의 우수성을 부각시켰으며, 미국, 호주, 싱가포르, 한국의 기관에서도 주목할 만한 기여가 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.