Skip to main content
QUICK REVIEW

[论文解读] Radical-level Ideograph Encoder for RNN-based Sentiment Analysis of Chinese and Japanese

Yuanzhi Ke, Masafumi Hagiwara|arXiv (Cornell University)|Aug 10, 2017
Sentiment Analysis and Opinion Mining被引用 11
一句话总结

本文提出了一种针对中文和日文的基于RNN的情感分析的字素级表征编码器,将汉字表示为字素嵌入序列,而非完整字符。该模型在性能上与基于字符嵌入的模型相当,并接近基于词嵌入的最先进模型结果,同时词汇量减少90%,参数量最多减少82%,证明字素级编码是大型汉字集非拉丁字母语言的一种高性价比替代方案。

ABSTRACT

The character vocabulary can be very large in non-alphabetic languages such as Chinese and Japanese, which makes neural network models huge to process such languages. We explored a model for sentiment classification that takes the embeddings of the radicals of the Chinese characters, i.e, hanzi of Chinese and kanji of Japanese. Our model is composed of a CNN word feature encoder and a bi-directional RNN document feature encoder. The results achieved are on par with the character embedding-based models, and close to the state-of-the-art word embedding-based models, with 90% smaller vocabulary, and at least 13% and 80% fewer parameters than the character embedding-based models and word embedding-based models respectively. The results suggest that the radical embedding-based approach is cost-effective for machine learning on Chinese and Japanese.

研究动机与目标

  • 为解决中文和日文自然语言处理中大型字符词汇表带来的高计算与存储成本问题。
  • 探究字素级嵌入是否能有效表征中文和日文字符,以用于情感分类。
  • 在不牺牲与基于字符和基于词的嵌入基线模型性能的前提下,减少模型大小和参数数量。
  • 评估卷积神经网络(CNN)和循环神经网络(RNN)组件在基于字素的架构中用于情感分析的有效性。
  • 探究高速公路层是否能提升所提出的字素编码器框架的性能。

提出的方法

  • 每个中文或日文字符被表示为字素级嵌入序列,保留空间顺序,而非将字素视为无序集合。
  • 模型使用具有不同感受野的多个卷积核(filters)的卷积神经网络(CNN),从字素嵌入序列中提取词级特征。
  • 对每个卷积核的输出进行时间维度上的最大池化(max-pooling),以生成每个卷积核的固定长度特征向量,捕捉最显著的模式。
  • 双向循环神经网络(bi-directional RNN)处理池化后的词级特征,以编码文档级上下文并捕捉长距离依赖关系。
  • 最终的文档级表征通过全连接层和Softmax层进行情感分类。
  • 采用不同步长(1和3)的卷积核,以同时捕捉细粒度的字素级和更粗粒度的字符级模式。

实验结果

研究问题

  • RQ1字素级嵌入能否作为中文和日文情感分析中基于字符嵌入的有效且高效替代方案?
  • RQ2与基于字符嵌入和基于词嵌入的基线模型相比,字素编码器模型在准确率和模型效率方面的表现如何?
  • RQ3在所提出的字素编码器架构中,引入高速公路层是否能提升性能?
  • RQ4在保持竞争性准确率的前提下,使用字素能否显著减少词汇量和模型参数?
  • RQ5基于CNN的特征编码器在从字素序列中提取有意义表征以用于下游情感分类方面是否有效?

主要发现

  • 所提出的模型在中文和日文情感分析数据集上的性能与基于字符嵌入的模型相当,并与基于词嵌入的最先进模型结果相差1-2%以内。
  • 与基于字符嵌入的基线模型相比,该模型词汇量减少90%,中文模型参数减少91%,日文模型参数减少82%。
  • 与基于字符嵌入的模型相比,参数量至少减少13%;与基于词嵌入的模型相比,参数量减少80%,展现出显著的效率优势。
  • 高速公路层未带来显著的性能提升,表明该任务中其为非必要组件。
  • CNN编码器能有效从字素序列中提取层次化特征,从而生成紧凑而强大的表征。
  • 结果证实,字素级编码是大型汉字集表意语言自然语言处理的一种高性价比替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。