Skip to main content
QUICK REVIEW

[논문 리뷰] Differentiable Weighted Finite-State Transducers

Awni Hannun, Vineel Pratap|arXiv (Cornell University)|2020. 10. 02.
Topic Modeling참고 문헌 38인용 수 10
한 줄 요약

이 논문은 가중 유한상태변환기(WFST)를 위한 미분 가능 프레임워크를 제안하며, 딥러닝 파이프라인에 WFST 연산을 통합함으로써 구조적 시퀀스 모델의 엔드 투 엔드 학습을 가능하게 한다. 자동 미분을 지원함으로써 이 프레임워크는 손실 함수, 잠재 변수 모델링(예: 워드피ece 분해) 및 새로운 레이어(예: 컨볼루션 WFST 레이어)의 공동 최적화를 가능하게 하여 더 적은 파라미터로 더 높은 정확도를 달성하며, 음성 및 필기 인식 작업에서 검증되었다.

ABSTRACT

We introduce a framework for automatic differentiation with weighted finite-state transducers (WFSTs) allowing them to be used dynamically at training time. Through the separation of graphs from operations on graphs, this framework enables the exploration of new structured loss functions which in turn eases the encoding of prior knowledge into learning algorithms. We show how the framework can combine pruning and back-off in transition models with various sequence-level loss functions. We also show how to learn over the latent decomposition of phrases into word pieces. Finally, to demonstrate that WFSTs can be used in the interior of a deep neural network, we propose a convolutional WFST layer which maps lower-level representations to higher-level representations and can be used as a drop-in replacement for a traditional convolution. We validate these algorithms with experiments in handwriting recognition and speech recognition.

연구 동기 및 목표

  • 모델 학습 중에 자동 미분을 가능하게 하여 기존의 추론 시 정적 WFST 사용의 한계를 극복하기 위해 가중 유한상태변환기(WFST)에 대한 미분 가능성을 제공한다.
  • 구조적 시퀀스 수준의 손실 함수(예: CTC, ASG)를 수동으로 구현하는 대신 그래프 연산을 통해 표현하고 최적화할 수 있도록 한다.
  • 학습 중에 잠재 분해를 통합함으로써 작업에 맞는 워드피ece 분해를 학습함으로써 모델의 적응성을 향상시킨다.
  • WFST를 딥 네URAL 네트워크 내에서 학습 가능한 레이어로 통합하여 기존의 컨볼루션 레이어를 대체하거나 보완한다.
  • 미분 가능한 WFST가 음성 및 필기 인식에서 모델 정확도를 향상시키면서도 파라미터 수와 계산 비용을 줄일 수 있음을 입증한다.

제안 방법

  • WFST 연산(조합, 교차, 전방 스코어링)을 통해 자동 미분가능성을 확보하기 위해 그래프 구조와 연산을 분리한다.
  • 시퀀스 수준의 손실 함수(예: ASG, CTC)를 그래프 연산으로 표현: 제약 조건이 부여된 그래프와 정규화 그래프의 전방 스코어 차이를 통해 손실을 계산한다.
  • 큰 어휘집을 고려하여 절삭 및 백오프 기능을 갖춘 전이 WFST를 사용함으로써 대규모 토큰 집합에서의 효율적 계산을 가능하게 한다.
  • 학습 중에 가능한 서브워드 단위에 대해 통합함으로써 잠재적 워드피ece 분해를 WFST로 모델링함으로써, 작업에 맞는 서브워드 단위를 학습할 수 있도록 한다.
  • 하위 수준 표현(예: 문자)을 고수준 표현(예: 워드피ece)으로 매핑하는 컨볼루션 WFST 레이어를 설계하며, 학습 가능한 변환 규칙를 포함한다.
  • 프레임워크의 C++ 및 파이썬 프론트엔드를 통해 미분 가능한 WFST 연산을 거쳐 백프로파게이션을 사용해 전체 모델을 엔드 투 엔드로 학습한다. 기울기는 프레임워크의 C++ 및 파이썬 인터페이스를 통해 계산된다.

실험 결과

연구 질문

  • RQ1가중 유한상태변환기(WFST)를 어떻게 미분 가능하게 만들 수 있을까? 이는 딥러닝 모델에서 엔드 투 엔드 학습을 지원하기 위함이다.
  • RQ2미분 가능한 WFST는 수동으로 작성된 대안보다 더 탄력적으로 새로운 구조적 시퀀스 수준의 손실 함수를 표현하고 최적화할 수 있는가?
  • RQ3WFST 기반의 통합을 통해 학습 중에 동적으로 잠재적 워드피ece 분해를 학습시킬 수 있을까? 이는 대규모 어휘집 작업에서 성능 향상에 기여할 수 있는가?
  • RQ4WFST를 딥 네URAL 네트워크 내에서 학습 가능한 레이어로 사용할 수 있을까? 이는 기존의 컨볼루션 레이어를 대체하거나 슈퍼어리어할 수 있는가?
  • RQ5미분 가능한 WFST를 통합함으로써 음성 및 필기 인식에서 정확도 향상과 함께 모델 복잡도를 줄일 수 있는가?

주요 결과

  • 미분 가능한 WFST 프레임워크는 그래프 연산과 자동 미분를 통해 ASG 및 CTC와 같은 구조적 손실 함수를 엔드 투 엔드 학습에 활용할 수 있게 하였다.
  • 잠재적 워드피ece 분해를 통합함으로써 특히 대규모 어휘집 작업에서 인식 정확도가 향상되었으며, 고정된 서브워드 토크나이제이션으로 인한 성능 손실을 복구하였다.
  • IAM 필기 인식 데이터셋에서 컨볼루션 WFST 레이어는 단지 2,048개의 파라미터로 CER 19.5를 달성하였고, 기존의 컨볼루션 레이어(79,000개 파라미터, CER 20.7)를 능가하였다.
  • WFST 컨볼루션 레이어는 입력 채널 수(ci)가 아닌 워드피ece 길이(w)에 따라 확장되므로, 표준 컨볼루션 대비 파라미터 수와 연산 수를 줄였다.
  • 모델은 입력에 따라 최적의 워드피ece 분해를 동적으로 선택하며, 예를 들어 조밀하게 배열된 필기체에서는 고수준 토큰을 선호함으로써 적응형 표현 학습을 보여주었다.
  • 실험 결과, 미분 가능한 WFST는 데이터와 그래프에 코딩된 사전 지식을 함께 최적화함으로써 일반화 성능 향상과 노출 편향 감소를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.