Skip to main content
QUICK REVIEW

[논문 리뷰] Translating Math Formula Images to LaTeX Sequences Using Deep Neural Networks with Sequence-level Training

Zelun Wang, Jyh‐Charn Liu|arXiv (Cornell University)|2019. 08. 29.
Handwritten Text Recognition Techniques참고 문헌 39인용 수 9
한 줄 요약

이 논문은 수식 이미지를 LaTeX 시퀀스로 변환하는 데 사용되는 인코더-디코더 아키텍처를 가진 딥 네ural 네트워크를 제안한다. 모델은 시퀀스 수준 학습을 통해 훈련되며, 컨볼루션 네트워크(2D 위치 인코딩 포함)를 사용하는 인코더와 소프트 어텐션을 갖춘 양방향 LSTM 디코더를 활용한다. 노출 편향을 완화하고 IM2LATEX-100K 데이터셋에서 최신 기술 수준 성능을 달성하기 위해 정책 기반 강화 학습을 적용한다.

ABSTRACT

In this paper we propose a deep neural network model with an encoder-decoder architecture that translates images of math formulas into their LaTeX markup sequences. The encoder is a convolutional neural network (CNN) that transforms images into a group of feature maps. To better capture the spatial relationships of math symbols, the feature maps are augmented with 2D positional encoding before being unfolded into a vector. The decoder is a stacked bidirectional long short-term memory (LSTM) model integrated with the soft attention mechanism, which works as a language model to translate the encoder output into a sequence of LaTeX tokens. The neural network is trained in two steps. The first step is token-level training using the Maximum-Likelihood Estimation (MLE) as the objective function. At completion of the token-level training, the sequence-level training objective function is employed to optimize the overall model based on the policy gradient algorithm from reinforcement learning. Our design also overcomes the exposure bias problem by closing the feedback loop in the decoder during sequence-level training, i.e., feeding in the predicted token instead of the ground truth token at every time step. The model is trained and evaluated on the IM2LATEX-100K dataset and shows state-of-the-art performance on both sequence-based and image-based evaluation metrics.

연구 동기 및 목표

  • 수식 이미지를 정확하게 LaTeX 마크업 시퀀스로 변환하는 신경망 모델을 개발한다.
  • 시퀀스 생성 과정에서 발생하는 노출 편향 문제를 해결하기 위해 훈련 중 피드백 루프를 닫는다.
  • 단지 최대우도 추정법에 의존하는 것 외에 정책 기반 강화 학습 최적화를 통해 시퀀스 수준 성능을 향상시킨다.
  • 인코더에서 2D 위치 인코딩을 통한 수식 기호의 공간적 이해를 향상시킨다.
  • 이미지 기반 및 시퀀스 기반 평가 지표 모두에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 인코더는 입력 수식 이미지의 특징 맵을 추출하기 위해 컨볼루션 신경망(CNN)을 사용한다.
  • 특징 맵은 기호 간의 공간적 관계를 유지하기 위해 2D 위치 인코딩으로 향상된다.
  • 인코더 출력은 디코더의 입력으로 사용하기 위해 벡터 시퀀스로 전개된다.
  • 디코더는 단계적으로 LaTeX 토큰을 생성하기 위해 소프트 어텐션을 갖춘 스택형 양방향 LSTM으로 구성된다.
  • 모델은 먼저 토큰 수준에서 최대우도 추정(MLE)을 통해 훈련된다.
  • 이후 시퀀스 수준 학습이 정책 기반 강화 학습 알고리즘을 사용하여 적용되며, 디코딩 중에 예측된 토큰을 진짜 레이블 대신 사용함으로써 노출 편향을 줄인다.

실험 결과

연구 질문

  • RQ1시퀀스 수준 학습을 적용한 딥 네트워크가 수식 이미지를 LaTeX로 번역하는 데 있어 기존의 MLE 학습 방식을 초월할 수 있는가?
  • RQ22D 위치 인코딩의 통합이 수식 기호의 공간적 구조를 포착하는 데 얼마나 효과적인가?
  • RQ3디코더에서 피드백 루프를 닫는 것이 시퀀스 생성 과정에서의 노출 편향을 어느 정도 감소시키는가?
  • RQ4정책 기반 강화 학습 미세조정이 BLEU 및 ROUGE와 같은 시퀀스 수준 지표를 향상시키는가?
  • RQ5이 모델은 이전 최고 기술 수준의 방법들과 비교하여 IM2LATEX-100K 벤치마크에서 어떤 성능을 보이는가?

주요 결과

  • 모델은 IM2LATEX-100K 데이터셋에서 시퀀스 기반 및 이미지 기반 평가 지표 모두에서 최신 기술 수준의 성능을 달성한다.
  • 정책 기반 강화 학습을 통한 시퀀스 수준 학습은 단지 토큰 수준의 MLE 학습에 비해 생성 품질을 크게 향상시킨다.
  • 시퀀스 수준 학습 중 피드백 루프를 닫는 것은 노출 편향 문제를 효과적으로 완화한다.
  • 2D 위치 인코딩의 사용은 수식 표현 내 기호 간의 공간적 관계를 포착하는 데 모델의 능력을 향상시킨다.
  • 모델은 미리 보지 않은 수식 이미지에 대해 강력한 일반화 능력을 보이며, 높은 BLEU 및 ROUGE 점수를 기록한다.
  • CNN 인코더, 어텐션 기반 양방향 LSTM 디코더, 시퀀스 수준 최적화의 조합은 견고하고 정확한 LaTeX 시퀀스 생성을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.