Skip to main content
QUICK REVIEW

[论文解读] System Demo for Transfer Learning across Vision and Text using Domain Specific CNN Accelerator for On-Device NLP Applications

Baohua Sun, Lin Yang|arXiv (Cornell University)|Jun 4, 2019
Advanced Neural Network Applications参考文献 13被引用 5
一句话总结

本论文展示了一种基于领域专用卷积神经网络加速器(CNN-DSA)的设备端自然语言处理系统演示,通过二维词嵌入实现从视觉模型到文本的迁移学习。通过将文本转换为类似图像的超字符(Super Characters)或方形英文词(Squared English Words),该方法在300mW的CNN-DSA芯片上实现了高效、低精度推理,英文本体分类准确率达到97.4%,中文情感分析准确率达到89.2%,与全精度模型相比仅损失不到0.2%的准确率。

ABSTRACT

Power-efficient CNN Domain Specific Accelerator (CNN-DSA) chips are currently available for wide use in mobile devices. These chips are mainly used in computer vision applications. However, the recent work of Super Characters method for text classification and sentiment analysis tasks using two-dimensional CNN models has also achieved state-of-the-art results through the method of transfer learning from vision to text. In this paper, we implemented the text classification and sentiment analysis applications on mobile devices using CNN-DSA chips. Compact network representations using one-bit and three-bits precision for coefficients and five-bits for activations are used in the CNN-DSA chip with power consumption less than 300mW. For edge devices under memory and compute constraints, the network is further compressed by approximating the external Fully Connected (FC) layers within the CNN-DSA chip. At the workshop, we have two system demonstrations for NLP tasks. The first demo classifies the input English Wikipedia sentence into one of the 14 ontologies. The second demo classifies the Chinese online-shopping review into positive or negative.

研究动机与目标

  • 在移动和嵌入式系统中,于严格的功耗和内存限制下,实现高效的设备端NLP推理。
  • 探索利用二维词嵌入将基于视觉的CNN模型迁移至文本分类任务的可行性。
  • 通过低精度量化和片上内存优化,最小化NLP应用中的功耗和推理延迟。
  • 在Raspberry Pi等移动平台上的领域专用加速器(CNN-DSA)上,展示实时、高精度的文本分类。
  • 评估超字符(Super Characters)和方形英文词(Squared English Word)方法在多种语言(包括英文和中文)上的性能。

提出的方法

  • 使用超字符方法将文本转换为类似图像的表示形式,其中字符被映射到2D网格,像素值对应嵌入向量。
  • 对于英文文本,应用方形英文词(SEW)方法,将每个单词转换为方形图形以提升CNN识别效果,同时保持一对一映射以实现无损重建。
  • 将生成的2D图像输入经微调的量化VGG16基线二维CNN模型,利用ImageNet预训练权重进行迁移学习。
  • 通过1比特和3比特定点精度对网络系数进行量化,激活值使用5比特精度,实现超过200倍的模型压缩,且准确率损失极小。
  • 全连接(FC)层通过近似并集成至CNN-DSA芯片中,以减少内存占用并加速推理。
  • 所有处理均在片上完成,使用内部SRAM,避免外部DRAM访问,将功耗降低至300mW以下。

实验结果

研究问题

  • RQ1在图像数据上训练的二维CNN能否通过迁移学习在文本分类任务中实现高准确率?
  • RQ2超字符方法在低功耗硬件上将文本表示为2D图像以用于NLP任务时,效果如何?
  • RQ3模型量化与压缩在降低内存和功耗的同时,能在多大程度上保持准确率?
  • RQ4CNN-DSA芯片能否在功耗低于300mW且延迟低于20ms的条件下实现NLP应用的实时推理?
  • RQ5在英文文本的NLP任务中,SEW方法与标准超字符方法相比性能如何?

主要发现

  • 在DBpedia数据集上,系统在14个英文维基百科句子本体分类任务中达到97.4%的测试准确率,仅比全精度VGG模型低0.2%。
  • 在JD二元中文情感分析数据集上,系统达到89.2%的测试准确率,证明了其在具有方形字符的亚洲语言文本上的有效性。
  • 总推理时间(包括预处理和片上计算)为21ms,每秒可处理近50个句子,满足实时性要求。
  • 由于采用片上内存和高效数据流设计,CNN-DSA芯片功耗低于300mW,预处理和后处理功耗可忽略不计。
  • 通过1比特和3比特量化,模型压缩实现超过200倍的尺寸缩减(从58.9MB压缩至2.8MB),准确率仅出现轻微下降。
  • 该方法成功实现了通过视觉CNN加速器和图像分类迁移学习,在移动设备上实现高效、低功耗的NLP推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。