[论文解读] Applying Deep Belief Networks to Word Sense Disambiguation
该论文将深度置信网络(DBN)——一种深度学习生成模型——应用于词义消歧(WSD),使用SENSEVAL-2数据集。DBN通过利用受限玻尔兹曼机进行贪婪预训练并进行微调,优于SVM、最大熵、朴素贝叶斯和KPCA等最先进浅层学习算法,在组合特征上的微平均召回率达到61.30%,表现最佳。
In this paper, we applied a novel learning algorithm, namely, Deep Belief Networks (DBN) to word sense disambiguation (WSD). DBN is a probabilistic generative model composed of multiple layers of hidden units. DBN uses Restricted Boltzmann Machine (RBM) to greedily train layer by layer as a pretraining. Then, a separate fine tuning step is employed to improve the discriminative power. We compared DBN with various state-of-the-art supervised learning algorithms in WSD such as Support Vector Machine (SVM), Maximum Entropy model (MaxEnt), Naive Bayes classifier (NB) and Kernel Principal Component Analysis (KPCA). We used all words in the given paragraph, surrounding context words and part-of-speech of surrounding words as our knowledge sources. We conducted our experiment on the SENSEVAL-2 data set. We observed that DBN outperformed all other learning algorithms.
研究动机与目标
- 评估深度置信网络(DBN)在词义消歧(WSD)任务中相对于已建立的浅层学习算法的有效性。
- 探究深度学习是否能够从稀疏、高维的WSD数据中提取有意义的层次化特征,而无需大量手工特征工程。
- 确定DBN在每词任务训练样本有限的情况下,是否能对不同词义实现良好泛化。
- 比较DBN在不同知识源(主题、局部和词性特征)上的性能表现。
提出的方法
- DBN采用两阶段训练:首先使用受限玻尔兹曼机(RBMs)进行贪婪层叠式预训练,随后通过判别性反向传播进行微调。
- 特征向量基于上下文词、词性标注和词义构建,采用SENSEVAL-2英语词汇样本任务的设置。
- 该模型采用深层架构,包含多层随机隐层单元,以学习上下文的层次化表示。
- 使用交叉验证选择最优超参数,包括学习率和网络深度,尤其针对小规模训练集进行优化。
- 通过在SENSEVAL-2测试集上对多个词任务进行微平均召回率评估模型性能。
- 基线模型包括1-NN、朴素贝叶斯、SVM、最大熵、KPCA和MLP,性能比较基于p值进行。
实验结果
研究问题
- RQ1深度置信网络是否能在词义消歧任务中超越SVM和最大熵等传统浅层学习模型?
- RQ2当DBN在由局部上下文和词性标注派生的稀疏、高维特征上进行训练时,其表现如何?
- RQ3当仅使用局部特征而无额外的主题或词性特征时,DBN是否仍保持优越性能?
- RQ4与传统分类器相比,DBN在多大程度上减少了WSD任务中对手工特征工程的依赖?
主要发现
- 在组合特征集上,DBN实现了61.30%的最高微平均召回率,显著优于基线模型及其他所有浅层模型。
- 在局部特征设置下,DBN相比基线模型提升13.63%,相比逻辑回归提升3.97%,相比线性SVM提升2.73%。
- 在词性特征设置下,DBN相比线性SVM提升8.13%,相比逻辑回归提升5.21%,显示出在该类特征上的强劲表现。
- 在主题特征上,DBN实现了57.25%的微平均召回率,相比基线提升13.70%,且显著优于其他模型。
- 尽管特征维度高且稀疏,DBN在每词任务仅75至300个训练样本的情况下仍表现出良好泛化能力,表明其对数据稀缺具有鲁棒性。
- 结果表明,DBN能够从原始上下文特征中提取有用的非线性表示,从而降低对手工特征的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。