[论文解读] Phonetic-enriched Text Representation for Chinese Sentiment Analysis with Reinforcement Learning
本文通过基于强化学习的DISA网络,利用深层音位正字法和语调变化,提出了一种新颖的中文情感分析语音丰富文本表示方法。该方法将学习到的和提取的语音特征与文本和视觉模态相结合,在五个中文情感分析数据集上实现了最先进性能,显著通过语音消歧提高了情感分类准确率。
The Chinese pronunciation system offers two characteristics that distinguish it from other languages: deep phonemic orthography and intonation variations. We are the first to argue that these two important properties can play a major role in Chinese sentiment analysis. Particularly, we propose two effective features to encode phonetic information. Next, we develop a Disambiguate Intonation for Sentiment Analysis (DISA) network using a reinforcement network. It functions as disambiguating intonations for each Chinese character (pinyin). Thus, a precise phonetic representation of Chinese is learned. Furthermore, we also fuse phonetic features with textual and visual features in order to mimic the way humans read and understand Chinese text. Experimental results on five different Chinese sentiment analysis datasets show that the inclusion of phonetic features significantly and consistently improves the performance of textual and visual representations and outshines the state-of-the-art Chinese character level representations.
研究动机与目标
- 解决中文语音学中尚未被充分探索的作用——特别是深层音位正字法和语调变化在情感分析中的作用。
- 开发一种方法,为每个拼音学习并消歧语调,以提升情感分类性能。
- 将语音特征与文本和视觉表示相结合,以模拟人类对中文文本的多模态理解。
- 证明语音信息能够增强中文情感分析中的文本和视觉表示。
提出的方法
- 提出两种语音特征:来自真实音频片段的基于音频的特征,以及来自拼音语料库的已学习拼音标记嵌入,每种特征均包含和不包含语调。
- 设计一种基于强化学习框架的DISA(用于情感分析的语调消歧)网络,采用演员-评论家架构。
- 演员网络为每个拼音选择五个语调之一,而评论家网络使用LSTM编码拼音序列并计算情感预测。
- 策略网络通过基于情感分类性能的延迟奖励进行更新,而评论家网络则使用交叉熵损失进行训练。
- 将语音特征与文本和视觉特征融合,以创建用于情感分类的多模态表示。
- 采用t-SNE可视化验证,所学习的嵌入能够捕捉语音相似性与语义关系。

实验结果
研究问题
- RQ1语音信息,特别是语调变化,是否能超越仅依赖文本和视觉特征,提升中文情感分析性能?
- RQ2强化学习模型在上下文中能否有效消歧每个拼音的正确语调,以解决语义和情感歧义?
- RQ3在多模态中文情感分析中,语音特征在多大程度上增强了文本和视觉表示?
- RQ4所学习的语音嵌入能否同时捕捉中文拼音的语音相似性与语义含义?
主要发现
- 提取的(Ex04)和学习的(PW)语音特征的组合(Ex04+PW)在五个数据集上的平均准确率较仅使用Ex04提升了1.43%。
- 将语音特征与文本和视觉模态结合(T+P)后,性能显著优于最先进方法,且具有统计学显著性。
- t-SNE可视化证实,Ex04+PW嵌入能够捕捉语音相似性(如相似元音)和语义相似性(如'miú2'和'nǎi3'表示'牛奶')。
- 融合的T+P表示成功编码了语义关系(如'mǔ4'和'yǔ4'表示'洗澡')和语音关系(如'huán2'和'huán2'表示同音词)。
- DISA网络能有效消歧语调,解决情感极性歧义——例如'hǎochī'(美味)与'hàochī'(贪吃)。
- 本研究证明,深层音位正字法和语调携带了文本本身无法捕捉的有意义的语义和情感线索。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。