Skip to main content
QUICK REVIEW

[논문 리뷰] When Counting Meets HMER: Counting-Aware Network for Handwritten Mathematical Expression Recognition

Bohan Li, Ye Yuan|arXiv (Cornell University)|2022. 07. 23.
Handwritten Text Recognition Techniques인용 수 4
한 줄 요약

이 논문은 약한 감독 기반의 카운팅 모듈을 사용하여 수기 수식 인식(HMER)과 기호 수를 동시에 최적화하는 엔드 투 엔드 프레임워크인 Counting-Aware Network(CAN)을 제안한다. 추가 레이블링 없이 LaTeX 애너테이션을 활용함으로써, CAN은 주의 메커니즘의 정확도를 향상시키고 인식 오류를 감소시키며, 계산 비용을 최소화하면서 CROHME 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recently, most handwritten mathematical expression recognition (HMER) methods adopt the encoder-decoder networks, which directly predict the markup sequences from formula images with the attention mechanism. However, such methods may fail to accurately read formulas with complicated structure or generate long markup sequences, as the attention results are often inaccurate due to the large variance of writing styles or spatial layouts. To alleviate this problem, we propose an unconventional network for HMER named Counting-Aware Network (CAN), which jointly optimizes two tasks: HMER and symbol counting. Specifically, we design a weakly-supervised counting module that can predict the number of each symbol class without the symbol-level position annotations, and then plug it into a typical attention-based encoder-decoder model for HMER. Experiments on the benchmark datasets for HMER validate that both joint optimization and counting results are beneficial for correcting the prediction errors of encoder-decoder models, and CAN consistently outperforms the state-of-the-art methods. In particular, compared with an encoder-decoder model for HMER, the extra time cost caused by the proposed counting module is marginal. The source code is available at https://github.com/LBH1024/CAN.

연구 동기 및 목표

  • HMER의 인코더-디코더 모델에서 주의 메커니즘이 복잡하거나 장수식 상황에서 불안정해지는 문제를 해결하기 위해.
  • 기호 수와 HMER 간의 상호보완적 관계를 탐색하여, 수를 세는 것이 주의 정렬과 인식 정확도를 향상시킬 수 있음을 제안하기 위해.
  • 기본적인 HMER 애너테이션(LaTeX 시퀀스)만을 사용하여, 비용이 많이 드는 기호 수준의 바운딩 박스 애너테이션을 피하는 약한 감독 기반의 카운팅 모듈을 설계하기 위해.
  • HMER와 기호 수를 동시에 최적화하는 통합된 엔드 투 엔드 학습 가능한 네트워크를 개발하여, 더 높은 강인성과 일반화 능력을 확보하기 위해.

제안 방법

  • LaTeX 시퀀스만을 감독으로 사용하여 각 기호 클래스의 수를 예측하는 약한 감독 기반의 카운팅 모듈(MSCM)을 제안하며, 위치 애너테이션은 필요로 하지 않는다.
  • MSCM을 주의 기반 인코더-디코더 모델(DWAP 등)에 통합하여 HMER와 기호 수를 동시에 최적화하는 Counting-Aware Network(CAN)을 구성한다.
  • 예측된 카운팅 맵을 시공간 인식 신호로 활용하여 디코더의 주의를 유도함으로써, 첨자나 상첨자 같은 기호의 정렬 정확도를 향상시킨다.
  • HMER와 카운팅 신호를 모두 활용하는 맥락 인식 디코더(CCAD)를 도입하여 순차적 디코딩 중 주의 정확도를 향상시킨다.
  • HMER와 카운팅 목표를 결합한 다중 태스크 손실을 사용하여 전체 네트워크를 엔드 투 엔드로 학습하며, 카운팅 감독에는 평균 절대 오차(MAE)와 평균 제곱 오차(MSE)를 사용한다.
  • CROHME 2014, 2016, 2019 벤치마크에서 강력한 기준 모델(DWAP, ABM 등)과의 비교를 통해 방법을 검증한다.

실험 결과

연구 질문

  • RQ1기호 수를 세는 것이 복잡한 레이아웃이나 장수식 상황에서 HMER의 인코더-디코더 모델의 주의 정확도를 향상시킬 수 있는가?
  • RQ2LaTeX 시퀀스만을 사용하는 약한 감독 기반의 카운팅이, 완전히 애너테이션된 카운팅과 비교해 HMER 성능에 어떤 영향을 미치는가?
  • RQ3HMER와 기호 수를 동시에 최적화함으로써, 인식 정확도와 카운팅 신뢰도가 얼마나 향상되는가?
  • RQ4공유된 표현 학습을 통해 HMER 작업 자체가 카운팅 모듈의 성능 향상에 기여할 수 있는가?
  • RQ5제안된 카운팅 모듈은 유의미한 추론 오버헤드를 유발하는가? 실세계 적용에 실용적인가?

주요 결과

  • ABM을 기준 모델로 사용할 경우, CAN은 CROHME 2014, 2016, 2019에서 각각 57.26%, 56.15%, 55.96%의 정확 일치율을 기록하며 최신 기술 수준의 성능을 달성한다.
  • DWAP을 기준 모델로 사용할 경우, CAN은 CROHME 2014에서 57.00%, 2016년에는 56.06%, 2019년에는 54.88%의 정확 일치율을 기록하며 원본 모델을 초월한다.
  • 정답 카운팅 벡터를 사용할 경우, CROHME 2014에서 정확 일치율이 62.44%로 상승하여 정확한 카운팅 감독의 강력한 영향을 입증한다.
  • HMER와 함께 최적화할 경우, MAE와 MSE가 각각 31.25%, 15.91% 감소하여 HMER가 카운팅 정확도 향상에 기여함을 보여준다.
  • 카운팅 모듈의 추가 추론 시간 비용은 미미하여 실시간 응용에 실용적임을 확인한다.
  • 시각화 결과, 기준 모델이 주의를 기울이지 못한 빠진 또는 중복된 기호들(예: 'dy', '∑', 'i')을 CAN이 정확히 식별함을 확인하여 주의 정렬 향상이 입증된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.