Skip to main content
QUICK REVIEW

[论文解读] End-to-End Multi-View Networks for Text Classification

Hongyu Guo, Colin Cherry|arXiv (Cornell University)|Apr 19, 2017
Topic Modeling参考文献 13被引用 6
一句话总结

本文提出了一种用于文本分类的端到端多视角网络(MVN),通过可学习的软注意力机制聚焦于输入文本的不同词子集,生成多个基于注意力的视角。通过堆叠并连接这些视角以增强深度与宽度,该模型在Stanford情感树库和AG新闻数据集上实现了最先进性能,相较于深度卷积神经网络(CNN)和TF-IDF基线模型,收敛速度更快且鲁棒性更强。

ABSTRACT

We propose a multi-view network for text classification. Our method automatically creates various views of its input text, each taking the form of soft attention weights that distribute the classifier's focus among a set of base features. For a bag-of-words representation, each view focuses on a different subset of the text's words. Aggregating many such views results in a more discriminative and robust representation. Through a novel architecture that both stacks and concatenates views, we produce a network that emphasizes both depth and width, allowing training to converge quickly. Using our multi-view architecture, we establish new state-of-the-art accuracies on two benchmark tasks.

研究动机与目标

  • 解决单路径神经网络在捕捉多样化、鲁棒表示方面的局限性。
  • 通过允许多个基于注意力的视角对同一输入文本进行建模,提升模型泛化能力与判别能力。
  • 通过在新颖架构中结合深度(序列化视角处理)与宽度(拼接视角)来改善梯度流动与训练稳定性。
  • 证明自动生成的多样化视角可优于固定或人工设计的特征视角。
  • 通过端到端可训练框架,在两个主要文本分类基准上建立新的最先进结果。

提出的方法

  • 该模型通过在词袋或卷积特征表示上应用特定视角的软注意力机制,生成 V 个不同的视角,其中每个视角通过可学习的注意力权重聚焦于不同的词子集。
  • 每个视角通过基于可学习相关性分数的 softmax 计算词嵌入的加权和,注意力权重由经过双曲正切激活的前馈层生成。
  • 后续视角通过将所有先前视角与当前选择结果拼接后递归应用双曲正切变换生成,从而实现层次化的特征精炼。
  • 最终表示通过拼接所有视角向量形成,随后输入一个含 dropout 的两层前馈网络进行分类。
  • 该架构同时采用类似残差的横向连接(通过拼接先前视角)与序列堆叠,以改善梯度流动与模型表达能力。
  • 该方法通过反向传播进行端到端训练,注意力机制与最终分类器联合优化。

实验结果

研究问题

  • RQ1一个能够对同一输入文本生成多个多样化注意力视角的深度神经网络,是否能比单路径架构实现更好的泛化能力?
  • RQ2将堆叠(深度)与拼接(宽度)的视角处理方式结合,是否能提升训练稳定性与收敛速度?
  • RQ3自动学习的视角是否能在文本分类任务中优于固定或人工设计的特征表示?
  • RQ4各个视角是否在区分特定类别方面表现出专业化特征,且这种专业化是否有助于整体性能提升?
  • RQ5多视角方法是否能在 Stanford 情感树库和 AG News 等标准文本分类基准上超越最先进结果?

主要发现

  • 在 Stanford 情感树库上,MVN 达到了 94.2% 的测试准确率,创下新最先进水平,优于包括深度 CNN 在内的先前最先进方法。
  • 在 AG News 数据集上,使用卷积特征的 MVN 实现了 7.13% 的错误率,超越了此前 8.67% 的最先进水平(来自使用 K 最大池化的 29 层 CNN)。
  • 消融研究显示,若移除视角间依赖关系(横向连接),性能下降至 49.0%,证明视角间交互的重要性。
  • 仅使用最后一个视角(无交互)的模型准确率为 50.5%,表明序列化处理优于独立视角。
  • 朴素贝叶斯分析显示,不同视角在不同类别上表现出专业化特征——例如,某些视角擅长识别中性情感,而其他视角则专注于负面或正面类别。
  • 训练过程稳定且快速收敛,AG News 数据集的验证准确率与损失曲线显示,最优性能仅在数千次迭代内即达致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。