Skip to main content
QUICK REVIEW

[논문 리뷰] Handwritten Mathematical Expression Recognition with Bidirectionally Trained Transformer

Wenqi Zhao, Liangcai Gao|arXiv (Cornell University)|2021. 05. 06.
Handwritten Text Recognition Techniques참고 문헌 44인용 수 7
한 줄 요약

이 논문은 수식 인식을 위한 양방향으로 훈련된 트랜스포머(BTTR) 모델을 제안하며, RNN 기반 디코더를 트랜스포머 디코더로 대체하고 양방향 언어 모델링을 가능하게 하는 새로운 훈련 전략을 도입한다. 이 방법은 CROHME 2014에서 2.23%, CROHME 2016에서 1.92%, CROHME 2019에서 2.28%의 정확도 향상을 이끌어내며, 데이터 증강 기법 없이도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Encoder-decoder models have made great progress on handwritten mathematical expression recognition recently. However, it is still a challenge for existing methods to assign attention to image features accurately. Moreover, those encoder-decoder models usually adopt RNN-based models in their decoder part, which makes them inefficient in processing long $\LaTeX{}$ sequences. In this paper, a transformer-based decoder is employed to replace RNN-based ones, which makes the whole model architecture very concise. Furthermore, a novel training strategy is introduced to fully exploit the potential of the transformer in bidirectional language modeling. Compared to several methods that do not use data augmentation, experiments demonstrate that our model improves the ExpRate of current state-of-the-art methods on CROHME 2014 by 2.23%. Similarly, on CROHME 2016 and CROHME 2019, we improve the ExpRate by 1.92% and 2.28% respectively.

연구 동기 및 목표

  • 장거리 의존성 모델링이 부족하여 모델이 기호를 과도하게 또는 부족하게 예측하는 HMER의 커버리지 문제를 해결하기 위해.
  • 장거리 LaTeX 시퀀스를 처리할 때 RNN 기반 디코더의 비효율성과 순차적 성질을 해결하기 위해.
  • 단일 트랜스포머 디코더가 좌에서 우로 및 우에서 좌로의 디코딩을 수행함으로써 구문 인식 능력을 향상시키기 위해.
  • 이미지 및 단어의 위치 인코딩을 공동으로 사용하여 모델 일반화 능력과 정확도를 향상시키기 위해.
  • 데이터 증강 기법에 의존하지 않고 CROHME 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 장거리 의존성의 더 나은 모델링을 가능하게 하기 위해 RNN 기반 디코더를 트랜스포머 디코더로 대체함으로써 병렬 훈련을 가능하게 하였다.
  • 입력 특징 맵의 특정 영역에 주의를 기울이기 위해 이미지 위치 인코딩(IPE)을 도입하였다.
  • 단일 트랜스포머 디코더 내에서 좌에서 우로 및 우에서 좌로의 디코딩을 동시에 최적화하는 양방향 훈련 전략을 제안하였다.
  • 예측의 균형과 구문 정확도를 향상시키기 위해 근사 공동 검색(AJS)을 활용하여 양 방향의 예측을 재평가하였다.
  • 다섯 개의 독립적으로 초기화된 모델의 예측을 평균화함으로써 앙상블 기법을 적용하여 성능을 추가로 향상시켰다.
  • 스케줄링 샘플링을 사용한 교차 엔트로피 손실을 통해 엔드 투 엔드로 모델을 훈련하였으며, 자기주의성의 특성을 활용하여 양방향 학습을 구현하였다.

실험 결과

연구 질문

  • RQ1모델 복잡도를 증가시키지 않고도 단일 트랜스포머 디코더가 HMER에 대해 효과적으로 양방향 언어 모델링을 학습할 수 있는가?
  • RQ2이미지 위치 인코딩의 통합이 주의 분포 정렬을 향상시키고 HMER에서 과도 및 부족 분석 문제를 감소시키는가?
  • RQ3양방향 훈련이 단방향 훈련에 비해 정확도 및 구문 정확도 측면에서 어떻게 성능을 높이는가?
  • RQ4근사 공동 검색이 장거리 LaTeX 시퀀스에서 예측의 균형과 정확도를 어느 정도 향상시키는가?
  • RQ5제안된 BTTR 모델이 표준 CROHME 벤치마크에서 데이터 증강 기법 없이 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • BTTR 모델은 CROHME 2014 테스트 세트에서 57.91%의 ExpRate를 기록하여 기존 최고 성능 대비 2.23% 향상되었으며, 데이터 증강 없이도 성과를 달성하였다.
  • CROHME 2016에서 모델은 54.49%의 ExpRate를 기록하여 이전 방법보다 1.92% 향상되었다.
  • CROHME 2019에서 모델은 56.88%의 ExpRate를 기록하여 현재 최고 성능 대비 2.28% 상대적 향상이 이루어졌다.
  • 제거 실험 결과, 이미지 위치 인코딩이 다양한 척도에서 일반화 능력을 향상시킨다는 것이 확인되었다.
  • 양방향 훈련 전략은 단순히 좌에서 우로의 디코딩만을 사용하는 경우에도 단방향 훈련 대비 2.52% 향상된 성능을 보였다.
  • 근사 공동 검색과 앙상블 기법을 활용할 경우 각각 ExpRate에서 4.68%와 3.35%의 추가 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.