Skip to main content
QUICK REVIEW

[论文解读] Learning Compressed Sentence Representations for On-Device Text Processing

Dinghan Shen, Pengyu Cheng|arXiv (Cornell University)|Jun 19, 2019
Topic Modeling参考文献 39被引用 10
一句话总结

本文提出四种策略,将预训练的连续句向量二值化,用于设备端自然语言处理,实现与连续向量几乎相同的性能(仅约2%相对下降),同时将内存使用量减少98%以上。最佳方法采用带语义保持损失的正则化自编码器,支持基于汉明距离的快速相似性搜索,其速度比余弦相似性计算快12倍以上。

ABSTRACT

Vector representations of sentences, trained on massive text corpora, are widely used as generic sentence embeddings across a variety of NLP problems. The learned representations are generally assumed to be continuous and real-valued, giving rise to a large memory footprint and slow retrieval speed, which hinders their applicability to low-resource (memory and computation) platforms, such as mobile devices. In this paper, we propose four different strategies to transform continuous and generic sentence embeddings into a binarized form, while preserving their rich semantic information. The introduced methods are evaluated across a wide range of downstream tasks, where the binarized sentence embeddings are demonstrated to degrade performance by only about 2% relative to their continuous counterparts, while reducing the storage requirement by over 98%. Moreover, with the learned binary representations, the semantic relatedness of two sentences can be evaluated by simply calculating their Hamming distance, which is more computational efficient compared with the inner product operation between continuous embeddings. Detailed analysis and case study further validate the effectiveness of proposed methods.

研究动机与目标

  • 解决在低资源设备(如手机)上,连续实值句向量带来的高内存和计算成本问题。
  • 通过将通用句向量转换为紧凑的二进制表示,实现在设备端高效处理文本。
  • 在二值化后的嵌入中保留语义丰富性,使其在下游自然语言处理任务中依然有效。
  • 证明二进制编码之间的汉明距离可替代余弦相似性用于语义相似性评估,且计算效率更高。
  • 探索多种二值化策略,包括可训练与不可训练方法,以实现灵活部署。

提出的方法

  • 提出四种二值化策略:硬阈值法、随机投影、基于主成分分析(PCA)的变换,以及一种带语义保持损失的可训练正则化自编码器。
  • 采用自编码器架构,结合重建损失和额外的语义保持损失项,以在二进制编码中保持语义结构。
  • 语义保持损失通过最小化正样本对之间的汉明距离,促使语义相似的句子拥有相似的二进制编码。
  • 采用确定性阈值策略进行二值化,实证评估显示其优于随机采样方法。
  • 使用汉明距离评估二进制表示的相似性,其计算效率高于连续向量的内积运算。
  • 使用SentEval工具包在多个下游自然语言处理任务上进行性能基准测试,包括句子匹配和分类任务。

实验结果

研究问题

  • RQ1能否在保留下游自然语言处理任务语义效用的前提下,有效二值化连续句向量?
  • RQ2在多样化的自然语言处理基准上,二进制嵌入的性能与连续嵌入相比如何?
  • RQ3二进制编码之间的汉明距离能否作为语义相似性计算的有效且更快速的替代方案?
  • RQ4不同二值化策略(尤其是可训练与不可训练方法)对嵌入质量与内存效率的影响如何?
  • RQ5所学习的二进制表示对嵌入维度的选择有多敏感?

主要发现

  • 所提出的带语义保持损失的正则化自编码器在多个下游自然语言处理任务中,仅导致与连续嵌入相比约2%的相对性能下降。
  • 二进制表示将内存占用减少至原始连续嵌入的1.5%,实现超过98%的存储节省。
  • 二进制编码间汉明距离的计算速度比连续向量的余弦相似性计算快12倍以上,实测加速比达12.7倍(3.67μs vs. 288ns)。
  • 表现最佳的模型AE-binary-SP在MR数据集上,语义保持损失权重λsp = 0.8时达到最优性能。
  • 即使仅使用512位,随机投影和基于PCA的二值化方法也表现出良好性能,适用于低内存场景。
  • 使用二进制编码进行最近邻检索可成功检索出语义相似的句子,其结果通常比连续嵌入更连贯。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。