Skip to main content
QUICK REVIEW

[论文解读] Feature Weight Tuning for Recursive Neural Networks

Jiwei Li|arXiv (Cornell University)|Dec 11, 2014
Neural Networks and Applications参考文献 29被引用 13
一句话总结

本文提出加权神经网络(WNN)和二值期望神经网络(BENN),通过引入可学习的特征权重,递归地组合句子表示,实现对关键词汇的自动强调和对无关词汇的抑制。这些模型显著优于标准的递归神经网络,在IMDB情感分类任务上达到91.0%的准确率,在句子连贯性评估任务上达到93.6%,通过动态权重调节提升了表征学习能力。

ABSTRACT

This paper addresses how a recursive neural network model can automatically leave out useless information and emphasize important evidence, in other words, to perform "weight tuning" for higher-level representation acquisition. We propose two models, Weighted Neural Network (WNN) and Binary-Expectation Neural Network (BENN), which automatically control how much one specific unit contributes to the higher-level representation. The proposed model can be viewed as incorporating a more powerful compositional function for embedding acquisition in recursive neural networks. Experimental results demonstrate the significant improvement over standard neural models.

研究动机与目标

  • 解决标准递归神经网络在自动抑制无关词汇和强调关键语义单元方面的局限性。
  • 将支持向量机(SVM)中的“权重调节”概念引入深度学习架构,以实现更鲁棒的表征学习。
  • 通过在组合过程中动态调整单个词嵌入的贡献度,提升高层表征的获取能力。
  • 评估加权组合机制在需要建模长距离依赖关系的任务(如情感分析和连贯性预测)中的有效性。
  • 证明即使在标准神经网络模型性能低于传统基线(如词袋模型)的情况下,可学习权重仍能提升性能。

提出的方法

  • 提出WNN,一种在组合前对每个输入单元应用可学习标量权重的递归神经网络,实现对特征贡献度的动态控制。
  • 提出BENN,一种基于二值软阈值的变体,使用可微分近似方法强制特征权重的稀疏性,促进对显著输入的选择。
  • 采用树状结构的组合过程,隐藏表征通过加权拼接和非线性变换计算:$ h_{ ext{parent}} = f(W ullet [w_1, w_2] + b) $,其中$ W $为可学习的权重矩阵。
  • 使用固定词嵌入(如GloVe),并通过反向传播和AdaGrad优化,联合训练组合参数与特定任务目标。
  • 在句子级和文档级均递归应用相同的加权组合机制,实现层次化表征学习。
  • 在连贯性评估中采用基于窗口的评分机制,将相邻句子的表征拼接后通过逻辑回归分类。

实验结果

研究问题

  • RQ1可学习的特征权重是否能提升递归神经网络抑制无关词汇并强调关键语义单元的能力?
  • RQ2将SVM中的权重调节机制引入深度神经网络,对情感分类和连贯性预测任务的性能有何影响?
  • RQ3WNN和BENN在自然语言处理任务的表征学习中,相较于标准递归神经网络,能多大程度上实现性能提升?
  • RQ4在低资源设置下,加权组合机制是否比固定权重组合具有更好的泛化能力?
  • RQ5所提出方法在文档级情感分析中是否能与强大的基线模型(如词袋模型和Paragraph Vector)达到相当的性能?

主要发现

  • 在IMDB数据集上,WNN在二元情感分类中达到90.2%的精确率,BENN达到91.0%,优于标准递归神经网络(87.0%)。
  • BENN在句子连贯性预测任务中达到93.6%的准确率,超过标准递归模型(92.0%),在该任务中成为非神经网络与神经网络模型中的新SOTA。
  • 所提模型在长文档情感分析任务中显著提升了性能,而标准神经网络模型在此类任务中通常表现不如词袋基线。
  • 尽管WNN和BENN仍低于SOTA的Paragraph Vector模型(92.58%准确率),但在同一数据集上优于词袋模型。
  • 结果表明,可学习的特征权重通过实现对关键词汇的动态关注,显著提升了表征质量,尤其在深层组合结构中表现更优。
  • 该框架具有通用性,可通过为节点关联可学习权重,扩展至递归网络之外的其他深度学习模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。