Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Dynamic WFST Decoding for Personalized Language Models

Jun Liu, Jiedan Zhu|arXiv (Cornell University)|2019. 10. 23.
Algorithms and Data Compression참고 문헌 9인용 수 6
한 줄 요약

이 논문은 음성 인식에서 개인화된 언어 모델을 사용하는 동적 WFST 복호화를 가속화하기 위해 공용 및 비공용 총 두 층의 캐시 메커니즘을 제안한다. 전역적으로 정적 그래프 구성 요소를 사전 조합하고 사용자별 언어 모델 상태를 로컬로 캐시함으로써, 다중 전환 대화에서 복호화 시간을 약 5배 감소시키며, WER 영향은 최소화하고 고병렬 처리 시스템의 메모리 효율성을 향상시킨다.

ABSTRACT

We propose a two-layer cache mechanism to speed up dynamic WFST decoding with personalized language models. The first layer is a public cache that stores most of the static part of the graph. This is shared globally among all users. A second layer is a private cache that caches the graph that represents the personalized language model, which is only shared by the utterances from a particular user. We also propose two simple yet effective pre-initialization methods, one based on breadth-first search, and another based on a data-driven exploration of decoder states using previous utterances. Experiments with a calling speech recognition task using a personalized contact list demonstrate that the proposed public cache reduces decoding time by factor of three compared to decoding without pre-initialization. Using the private cache provides additional efficiency gains, reducing the decoding time by a factor of five.

연구 동기 및 목표

  • 개인화된 언어 모델을 사용하는 동적 WFST 기반 음성 인식의 복호화 효율을 향상시키기.
  • 실시간 음성 보조자에서 사용자별 언어 모델을 위한 실시간 조합에 의한 높은 지연 시간과 메모리 오버헤드 문제를 해결하기.
  • 다중 사용자, 다중 스레드 환경에서 저지연, 확장 가능한 개인화된 언어 모델 배포를 가능하게 하기.
  • 인식 정확도를 훼손하지 않으면서도 동적 그래프 조합의 계산 비용을 감소시키기.

제안 방법

  • 공용 캐시를 도입하여 WFST의 정적 HCL 부분을 전역적으로 사전 조합한다.
  • 사용자별 언어 모델 FST를 저장하고 재사용하는 비공용 캐시를 구현하여 세션 내 사용자 발화 간에 공유한다.
  • HCL 그래프의 비종단 상태를 사전 조합하기 위해 너비 우선 탐색(BFS) 기반의 단순화된 사전 초기화 방법을 사용한다.
  • 소량의 이전 발화를 기반으로 한 데이터 기반 사전 초기화 기법을 제안하여 상태 전개를 이끄는 데 성능을 향상시킨다. 이는 BFS보다 효율성이 뛰어나다.
  • 두 가지 사전 초기화 방법을 조합하여 최적의 성능 및 메모리 효율성을 달성한다.
  • 복호화 중에 클래스 기반 언어 모델을 사용자별 FST로 동적으로 교체하기 위해 FST 교체 기법을 적용하여, 필요 시 조합 비용을 최소화한다.

실험 결과

연구 질문

  • RQ1정적 WFST 구성 요소를 사전 조합함으로써 동적 언어 모델 환경에서 복호화 지연 시간을 줄일 수 있는가?
  • RQ2데이터 기반 사전 초기화 방법이 너비 우선 탐색(BFS)에 비해 복호화 속도와 메모리 효율성 측면에서 어떻게 비교되는가?
  • RQ3사용자별 언어 모델을 위한 비공용 캐시가 다중 전환 대화 시스템에서 효율성 향상에 얼마나 기여하는가?
  • RQ4고병렬 환경에서 사전 조합된 그래프와 완전히 동적 그래프 간의 추가 요청당 메모리 비용 증가율은 어느 정도인가?

주요 결과

  • 공용 캐시를 통한 사전 조합은 완전히 동적 복호화 대비 복호화 시간을 3배 감소시킨다.
  • 데이터 기반 사전 초기화 방법은 RTF 감소와 메모리 효율성 측면에서 BFS보다 뛰어난 성능을 보인다.
  • 5회 전환의 다중 전환 대화 세션에서 비공용 캐시는 완전히 동적 복호화 대비 복호화 시간을 5배 감소시킨다.
  • 사전 조합된 그래프의 경우 추가 동시 요청당 메모리 비용 증가율이 완전히 동적 그래프 대비 1.5배 낮다.
  • BFS 사전 조합을 5단계를 초과해 확장해도 RTF 향상에 기여하지 않으며, 드물게 발생하는 상태 조합으로 인해 메모리 사용량만 증가한다.
  • 두 가지 사전 초기화 방법을 조합함으로써 최적의 성능을 달성하였으며, RTF 감소와 함께 p50/p95 백분위수 간격이 더욱 좁아졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.