Skip to main content
QUICK REVIEW

[论文解读] Mobile Keyboard Input Decoding with Finite-State Transducers

Tom Ouyang, David Rybach|arXiv (Cornell University)|Apr 13, 2017
Speech Recognition and Synthesis参考文献 3被引用 21
一句话总结

本文提出了一种用于移动键盘输入的有限状态转换器(FST)解码器,该解码器借鉴语音识别技术,在严格内存和速度约束下实现低延迟、设备端解码。FST框架支持高级功能,如自动纠错、词补全、下一个词预测,以及新颖的后纠错功能——利用后续上下文修正先前已确认的词语,与基线系统相比,打字输入的词错误率降低18.5%,手势输入降低22.7%。

ABSTRACT

We propose a finite-state transducer (FST) representation for the models used to decode keyboard inputs on mobile devices. Drawing from learnings from the field of speech recognition, we describe a decoding framework that can satisfy the strict memory and latency constraints of keyboard input. We extend this framework to support functionalities typically not present in speech recognition, such as literal decoding, autocorrections, word completions, and next word predictions. We describe the general framework of what we call for short the keyboard "FST decoder" as well as the implementation details that are new compared to a speech FST decoder. We demonstrate that the FST decoder enables new UX features such as post-corrections. Finally, we sketch how this decoder can support advanced features such as personalization and contextualization.

研究动机与目标

  • 解决在移动设备典型严格内存和延迟约束下,对噪声大、精度低的移动键盘输入进行解码的挑战。
  • 将此前仅用于语音识别的有限状态转换器技术扩展至移动键盘输入领域,以提升准确率和功能支持。
  • 支持新型用户体验功能,如后纠错,即基于后续输入对先前已确认的词语进行修正。
  • 通过动态语言模型实现设备端个性化和上下文自适应,同时不损害性能。

提出的方法

  • FST解码器采用分层转换器架构,结合词典FST、语言模型FST和空间模型FST,将输入按键序列映射为候选词语。
  • 采用时间同步解码算法实现实时处理,保持低延迟(<20ms)和极低内存占用(语言模型<10MB)。
  • 通过流式、连续识别架构实现后纠错,当新上下文可用时重新评估先前词语。
  • 通过动态模型(如用户特定n-gram、联系人列表)的实时图重评分实现集成,支持OOV词处理而无需预先定义全部词汇。
  • 系统支持点击输入和手势输入两种模式,对字面解码和基于建议的纠错采用不同处理方式。
  • 在解码图中插入字符到词语的转换器,通过直接将字符序列映射为输出词语,以处理OOV词。

实验结果

研究问题

  • RQ1为语音识别设计的有限状态转换器框架能否在移动设备严格约束下有效适配移动键盘输入?
  • RQ2能够修正先前已确认词语的后纠错机制是否能提升整体解码准确率?
  • RQ3通过实时图重评分集成动态设备端个性化模型,对解码性能和内存使用有何影响?
  • RQ4FST解码器在打字和手势输入方面,与传统令牌传递解码器相比,在词错误率方面能提升多少?

主要发现

  • 与基线系统相比,FST解码器在点击输入中将词错误率(WER)降低了18.5%(从6.31%降至5.07%),在手势输入中降低了22.7%(从11.90%降至9.20%)。
  • 后纠错功能使系统能够通过利用后续词语的上下文,将错误‘a while lot’修正为‘a whole lot’,证明了未来上下文在消歧中的价值。
  • 解码器实现了低延迟性能(<20ms)和内存占用控制在10MB以内,满足实时移动部署要求。
  • 通过实时图重评分集成动态模型,实现了有效的个性化和OOV词处理,且未增加静态模型大小。
  • FST框架天然支持高级功能,如下一个词预测、词补全和自动纠错,且在统一、数学上严谨的架构中实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。