Skip to main content
QUICK REVIEW

[논문 리뷰] Fully-Convolutional Intensive Feature Flow Neural Network for Text Recognition

Zhao Zhang, Zemin Tang|arXiv (Cornell University)|2019. 12. 13.
Handwritten Text Recognition Techniques참고 문헌 50인용 수 7
한 줄 요약

이 논문은 전면 컨볼루션 신경망인 IntensiveNet을 제안한다. 이는 기존의 풀링을 스트라이드-2 컨볼루션으로 대체하고, 밀집 통합과 깊이 분리형 컨볼루션을 활용한 인тен시브 블록을 도입하여 특징 흐름을 향상시키고 공간 정보를 유지한다. 모델은 특징 활용도와 학습 효율성을 향상시켜 대규모 중국어 텍스트 및 MNIST 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

The Deep Convolutional Neural Networks (CNNs) have obtained a great success for pattern recognition, such as recognizing the texts in images. But existing CNNs based frameworks still have several drawbacks: 1) the traditaional pooling operation may lose important feature information and is unlearnable; 2) the tradi-tional convolution operation optimizes slowly and the hierar-chical features from different layers are not fully utilized. In this work, we address these problems by developing a novel deep network model called Fully-Convolutional Intensive Feature Flow Neural Network (IntensiveNet). Specifically, we design a further dense block called intensive block to extract the feature information, where the original inputs and two dense blocks are connected tightly. To encode data appropriately, we present the concepts of dense fusion block and further dense fusion opera-tions for our new intensive block. By adding short connections to different layers, the feature flow and coupling between layers are enhanced. We also replace the traditional convolution by depthwise separable convolution to make the operation efficient. To prevent important feature information being lost to a certain extent, we use a convolution operation with stride 2 to replace the original pooling operation in the customary transition layers. The recognition results on large-scale Chinese string and MNIST datasets show that our IntensiveNet can deliver enhanced recog-nition results, compared with other related deep models.

연구 동기 및 목표

  • 기존의 컨볼루션 신경망에서 풀링 연산으로 인해 발생하는 공간적 및 의미적 특징 정보 손실 문제를 해결하기 위해.
  • 표준 컨볼루션을 깊이 분리형 컨볼루션으로 대체하여 학습 속도를 향상시키고 특징 활용도를 높이기 위해.
  • 밀집 통합과 스킵 연결을 갖춘 새로운 인тен시브 블록을 통해 레이어 간 특징 흐름을 향상시키기 위해.
  • 다운샘플링에 의한 정보 손실을 방지하기 위해 완전히 컨볼루션 기반의 아키텍처를 개발하기 위해.
  • 대규모 및 다양한 텍스트 데이터셋에서 뛰어난 텍스트 인식 정확도를 달성하기 위해.

제안 방법

  • 원래 입력과 두 개의 밀집 블록을 강하게 연결하는 인тен시브 블록을 도입하여 특징 재사용을 촉진한다.
  • 밀집 융합 블록과 연산을 활용해 다중 레이어의 특징을 집계하여 계층적 특징 표현을 향상시킨다.
  • 전이 레이어에서 기존의 최대 풀링을 스트라이드-2 컨볼루션 연산으로 대체하여 공간 해상도를 유지하고 정보 손실을 줄인다.
  • 계산 비용을 줄이면서도 모델 용량과 효율성을 유지하기 위해 깊이 분리형 컨볼루션을 사용한다.
  • 완전히 컨볼루션 기반의 인코더-디코더 구조를 설계하여 완전히 연결된 레이어 없이 엔드 투 엔드 텍스트 인식을 지원한다.
  • 레이어 간 잔여 스타일의 스킵 연결을 적용하여 기울기 흐름을 향상시키고 학습 안정성을 높인다.

실험 결과

연구 질문

  • RQ1기존의 풀링을 스트라이드-2 컨볼루션으로 대체함으로써 텍스트 인식 네트워크에서 특징 정보 손실을 줄일 수 있는가?
  • RQ2다중 레이어에 걸친 특징의 밀집 융합은 정확도 향상에 어떤 영향을 미치는가?
  • RQ3깊이 분리형 컨볼루션을 사용할 경우 성능 저하 없이 학습 효율성이 얼마나 향상되는가?
  • RQ4밀집 특징 흐름을 갖춘 완전히 컨볼루션 기반 아키텍처가 기존의 CNN 기반 텍스트 인식 모델을 초월할 수 있는가?
  • RQ5제안된 인텐시브 블록은 다양한 텍스트 데이터셋에서 특징 표현을 얼마나 효과적으로 향상시키는가?

주요 결과

  • IntensiveNet은 대규모 중국어 텍스트 인식 데이터셋에서 최신 기준 성능을 달성하여 기존 모델을 능가한다.
  • 모델은 표준 벤치마크인 MNIST 데이터셋에서도 정확도 향상을 보이며, 그 효과를 확인한다.
  • 풀링을 스트라이드-2 컨볼루션으로 대체함으로써 최대 풀링 대비 특징 정보 손실이 크게 감소한다.
  • 깊이 분리형 컨볼루션을 사용함으로써 모델 파라미터 수와 FLOPs를 줄이면서도 높은 인식 정확도를 유지한다.
  • 밀집 융합과 스킵 연결을 갖춘 인텐시브 블록은 특징 흐름을 향상시키고 학습 중 기울기 전파를 개선한다.
  • 완전히 컨볼루션 기반의 설계 덕분에 공간적 특징 보존이 향상된 엔드 투 엔드 학습이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.