Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Scale Attention with Dense Encoder for Handwritten Mathematical Expression Recognition

Jianshu Zhang, Jun Du|arXiv (Cornell University)|2018. 01. 05.
Handwritten Text Recognition Techniques참고 문헌 25인용 수 20
한 줄 요약

이 논문은 수작업 수학식 인식을 위한 다중 척도 주의 메커니즘과 조밀한 인코더를 제안하여 풀링 연산에서 잃어버리는 세밀한 세부 정보를 보존하고 특징 추출을 향상시킨다. 경량화된 그라디언트 흐름을 향상시키기 위해 DenseNet을 통합하고, 다중 척도 주의를 통해 고해상도 및 저해상도 특징을 모두 고려함으로써, 공식 훈련 데이터만을 사용하여 CROHME 2014에서 52.8%의 최고 성능 정확도와 CROHME 2016에서 50.1%의 최고 성능 정확도를 달성한다.

ABSTRACT

Handwritten mathematical expression recognition is a challenging problem due to the complicated two-dimensional structures, ambiguous handwriting input and variant scales of handwritten math symbols. To settle this problem, we utilize the attention based encoder-decoder model that recognizes mathematical expression images from two-dimensional layouts to one-dimensional LaTeX strings. We improve the encoder by employing densely connected convolutional networks as they can strengthen feature extraction and facilitate gradient propagation especially on a small training set. We also present a novel multi-scale attention model which is employed to deal with the recognition of math symbols in different scales and save the fine-grained details that will be dropped by pooling operations. Validated on the CROHME competition task, the proposed method significantly outperforms the state-of-the-art methods with an expression recognition accuracy of 52.8% on CROHME 2014 and 50.1% on CROHME 2016, by only using the official training dataset.

연구 동기 및 목표

  • 복잡한 2차원 구조, 수작업의 모호성, 기호의 변동 크기 등 수작업 수학식 인식의 과제를 해결하기 위해.
  • 사전 정의된 문법과 복잡한 구문 분석 알고리즘에 의존하는 전통적 방법의 한계를 극복하기 위해.
  • CNN 기반 인코더에서의 풀링 과정에서 손실되는 세밀한 세부 정보를 개선하고 특징 표현을 향상시키기 위해.
  • 명시적인 기호 세그멘테이션 없이도 엔드 투 엔드로 훈련 가능한 데이터 기반 모델을 개발하기 위해.

제안 방법

  • 소규모 데이터셋에서도 특징 추출과 그라디언트 흐름을 강화하기 위해, 인코더로 조밀하게 연결된 컨볼루션 네트워크(DenseNet)를 채택한다.
  • 저해상도(의미가 풍부한) 및 고해상도(세부 정보를 유지하는) 특징 맵을 모두 생성하는 다중 척도 조밀한 인코더를 도입한다.
  • 디코더가 순서 생성 중 고해상도 및 저해상도 브랜치의 특징을 모두 고려할 수 있도록 하는 다중 척도 주의 메커니즘을 설계한다.
  • 디코더가 다중 척도 특징을 통해 관련 이미지 영역에 주의를 기울이며 토큰 단위로 LaTeX 문자열을 생성하는 주의 기반 인코더-디코더 프레임워크를 사용한다.
  • 특징 재사용과 표현 학습을 향상시키기 위해, DenseNet의 스킵 연결을 활용해 이전 모든 레이어의 특징 맵을 연결한다.
  • 이미지-TeX 문자열 매핑에 대해 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 모델을 훈련하고, 추론 시 빔 서치를 적용한다.

실험 결과

연구 질문

  • RQ1표준 CNN과 비교해 조밀하게 연결된 인코더가 수작업 수학식 인식에서 특징 표현과 정확도 향상에 기여하는가?
  • RQ2다중 척도 주의를 통합하면 풀링 과정에서 손실되는 세밀한 시각적 세부 정보—특히 소수점과 같은 작은 기호—를 복구하는 데 도움이 되는가?
  • RQ3공식 훈련 데이터만을 사용하여, 제안된 방법이 CROHME 2014 및 CROHME 2016와 같은 표준 벤치마크에서 최고 성능 기술과 비교해 어떻게 성능을 내는가?
  • RQ4다중 척도 주의 메커니즘이 작은 기호나 모호한 기호에 대한 과소 분석 오류를 어느 정도 줄이는가?
  • RQ5외부 또는 비공식 훈련 데이터에 의존하지 않고도, 다양한 데이터셋에 대해 잘 일반화되는가?

주요 결과

  • 제안된 모델은 CROHME 2014 테스트 세트에서 52.8%의 식 인식 정확도를 달성하여 공식 훈련 데이터만을 사용한 모든 다른 시스템보다 뛰어난 성능을 보였다.
  • CROHME 2016 벤치마크에서 모델은 50.1%의 정확도를 기록했으며, 두 번째로 우수한 시스템(Wiris, 49.6%)을 초월하여 강력한 일반화 능력을 입증했다.
  • 다중 척도 주의 메커니즘이 소수점과 '7'과 같은 작은 숫자 기호를 성공적으로 복구하여 단일 척도 주의 모델이 자주 놓치는 요소들을 회복했다.
  • 시각화 결과는 고해상도 주의 브랜치가 '3.14'의 소수점과 같은 세밀한 세부 정보를 탐지함을 확인했으며, 저해상도 특징 맵에서는 이러한 정보가 손실됨을 보여주었다.
  • 조밀한 인코더는 특징 학습과 그라디언트 흐름을 향상시켜 특히 제한된 훈련 데이터에서 유용한 성능 향상을 이끌었다.
  • CROHME 2014에서 예측이 한 기호 오차 이내인 정확도는 72.7%를 기록하여 강력한 내구성과 향후 개선 가능성을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.