Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Attention-Based Handwritten Mathematical Expression Recognition with Scale Augmentation and Drop Attention

Zhe Li, Lianwen Jin|arXiv (Cornell University)|2020. 07. 20.
Handwritten Text Recognition Techniques참고 문헌 27인용 수 7
한 줄 요약

이 논문은 스케일 증강과 드롭 어텐션을 통해 성능을 향상시키는 새로운 어텐션 기반 인코더-디코더 모델을 제안한다. 이는 수작업 수학식 인식(HMER)에 적용되며, CROHME 2014 및 2016 데이터셋에서 앙상블 없이도 최신 기술 수준(SOTA) 성능을 달성한다. 스케일 증강은 훈련 중에 이미지의 비율을 유지하면서 무작위로 크기를 조정하여 기호 크기의 변동성에 대한 강건성을 향상시키며, 드롭 어텐션은 신뢰할 수 없는 어텐션 가중치를 억제하여 어텐션 메커니즘의 신뢰성을 높인다.

ABSTRACT

Handwritten mathematical expression recognition (HMER) is an important research direction in handwriting recognition. The performance of HMER suffers from the two-dimensional structure of mathematical expressions (MEs). To address this issue, in this paper, we propose a high-performance HMER model with scale augmentation and drop attention. Specifically, tackling ME with unstable scale in both horizontal and vertical directions, scale augmentation improves the performance of the model on MEs of various scales. An attention-based encoder-decoder network is used for extracting features and generating predictions. In addition, drop attention is proposed to further improve performance when the attention distribution of the decoder is not precise. Compared with previous methods, our method achieves state-of-the-art performance on two public datasets of CROHME 2014 and CROHME 2016.

연구 동기 및 목표

  • 2D 구조적 복잡성으로 인해 비균일한 스케일링이 발생하는 수작업 수학식(ME)에서 기호 크기의 변동성 문제를 해결함으로써 모델 성능 저하를 완화하기 위해.
  • 특히 어텐션 기능이 관련이 없거나 노이즈가 많은 특징에 집중할 경우에 발생하는 시퀀스 생성에서 어텐션 메커니즘의 신뢰성 향상.
  • 스케일 정규화가 필요 없이 다양한 크기의 ME에 대해 일반화 능력을 향상시키는 훈련 단계 기법 개발.
  • 앙상블 기법 없이도 공개 HMER 벤치마크에서 최신 기술 수준의 성능 달성.

제안 방법

  • 스케일 증강은 훈련 중에 ME 이미지를 비율을 유지하면서 무작위로 확대/축소한 후 고정된 크기로 0 패딩을 적용하여, 모델이 척도 불변 특징을 학습하도록 한다.
  • 어텐션 기반 인코더-디코더 네트워크를 사용하며, 인코더는 이미지를 처리하고 디코더는 컨텍스트 인식 어텐션을 사용하여 단계적으로 LaTeX 토큰을 생성한다.
  • 드롭 어텐션은 훈련 중에 어텐션 가중치를 무작위로 억제하거나 무시함으로써, 어텐션이 정확하지 않을 경우에도 견고한 특징에 의존하도록 모델을 강제한다.
  • 모델은 CNN 기반 인코더와 RNN 기반 디코더를 사용하며, 어텐션 메커니즘은 디코더 상태와 인코더 특징 간의 정렬 점수를 계산한다.
  • 손실 함수는 참값 LaTeX 시퀀스와 예측 시퀀스 간의 교차 엔트로피이며, 역전파를 통해 최적화된다.
  • 이 방법은 오직 LaTeX 수준의 레이블만을 사용하여 오프라인 ME 이미지에서 엔드 투 엔드로 훈련되며, 궤적 데이터나 비공개 훈련 세트에 의존하지 않는다.

실험 결과

연구 질문

  • RQ12D 구조적 복잡성으로 인해 기호 크기가 일관되지 않은 ME에서 스케일 증강이 HMER 성능 향상에 기여하는가?
  • RQ2훈련 중에 드롭 어텐션 메커니즘을 도입함으로써 어텐션 분포가 정확하지 않거나 불안정할 경우 모델의 강건성이 향상되는가?
  • RQ3앙성 기법 없이도 제안된 방법이 최신 기술 수준의 HMER 모델과 비교해 정확도와 일반화 능력 면에서 뛰어나게 성능을 발휘하는가?
  • RQ4스케일 증강과 드롭 어텐션의 조합이 공식 훈련 데이터만을 사용하여 CROHME 2014 및 2016과 같은 표준 벤치마크에서 SOTA 성능을 달성할 수 있는가?

주요 결과

  • CROHME 2014 테스트 세트에서 제안된 방법은 앙상블 없이 56.59%의 정확도를 달성했으며, 이는 이전 SOTA인 PAL-v2보다 5.58% 높고, 앙상블 사용 시 60.45%로 7.71% 높은 성능을 기록했다.
  • CROHME 2016 테스트 세트에서 방법은 앙상블 없이 54.58%의 정확도를 기록했으며, 이는 이전 SOTA인 PAL-v2보다 4.97% 높고, 앙상블 사용 시 58.06%로 0.17% 높은 성능을 기록했다.
  • 비공개 데이터를 사용하지 않아도 CROHME 2016에서 첫 번째로 높은 성능을 기록한 Wiris 시스템(49.61% ExpRate)을 뛰어넘어 54.58%의 ExpRate를 달성했다.
  • 제거 분석 결과, 스케일 증강과 드롭 어텐션은 성능 향상에 독립적으로 기여하며, 스케일 증강은 크기 변화에 대한 강건성을 향상시키고, 드롭 어텐션은 어텐션의 신뢰성을 높인다.
  • 다양한 손글씨 스타일과 복잡한 2D 구조에 대해 잘 일반화되며, 첨자, 상첨자, 중첩된 표현을 정확히 인식한다.
  • 시각화 결과, 모델이 특징을 구분하는 기능에 집중하고 있으며, 예를 들어 "{"와 같은 문법 기호에 의해 어텐션이 산산이 깨져도 정확한 LaTeX 시퀀스를 생성할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.