[论文解读] Incorporating Glosses into Neural Word Sense Disambiguation
本文提出GAS,一种新颖的神经词义消歧模型,将上下文信息与WordNet中的词汇释义整合到统一的记忆网络框架中。通过在原始释义中引入语义关系(上下位与下位关系),GAS提升了词义表征能力,在多个英语全词WSD基准测试中达到最先进性能,相比先前的神经网络与基于知识的方法,F1分数最高提升2.2%。
Word Sense Disambiguation (WSD) aims to identify the correct meaning of polysemous words in the particular context. Lexical resources like WordNet which are proved to be of great help for WSD in the knowledge-based methods. However, previous neural networks for WSD always rely on massive labeled data (context), ignoring lexical resources like glosses (sense definitions). In this paper, we integrate the context and glosses of the target word into a unified framework in order to make full use of both labeled data and lexical knowledge. Therefore, we propose GAS: a gloss-augmented WSD neural network which jointly encodes the context and glosses of the target word. GAS models the semantic relationship between the context and the gloss in an improved memory network framework, which breaks the barriers of the previous supervised methods and knowledge-based methods. We further extend the original gloss of word sense via its semantic relations in WordNet to enrich the gloss information. The experimental results show that our model outperforms the state-of-theart systems on several English all-words WSD datasets.
研究动机与目标
- 解决神经WSD模型忽略WordNet释义等词汇知识的局限性。
- 通过在端到端框架中联合编码上下文与释义,统一监督学习与基于知识的方法。
- 通过在WordNet中使用上下位与下位关系扩展原始释义,改进释义表征。
- 开发一种可扩展、参数共享的模型,能够处理全词WSD,而无需为每个词单独训练分类器。
- 证明整合结构化词汇知识可显著提升神经WSD性能,超越仅依赖上下文的模型。
提出的方法
- 提出GAS,一种基于记忆网络的模型,将目标词的上下文与释义在统一框架中联合编码。
- 在记忆模块中采用多轮机制,模拟重新阅读过程,提升对相关释义的关注度。
- 引入两种记忆更新策略:拼接与相加,其中拼接策略表现更优。
- 通过层次化方式扩展释义模块,纳入上下位与下位词的释义,丰富词义表征。
- 采用分层记忆结构,以匹配WordNet词义层级,实现更优的语义建模。
- 使用标注的上下文数据与释义信息进行端到端训练,结合注意力机制实现上下文与释义的对齐。
实验结果
研究问题
- RQ1将WordNet中的释义整合到神经WSD模型中,是否能超越仅依赖上下文的模型,实现性能提升?
- RQ2通过WordNet中的上下位与下位关系扩展释义,是否能带来更优的词义表征与消歧效果?
- RQ3记忆网络中的多轮注意力机制如何影响模型识别正确词义的能力?
- RQ4统一的神经模型能否在全词WSD基准测试中超越基于词专家的监督系统?
- RQ5在上下文-释义对齐过程中,最优记忆轮数是多少,以在性能与过拟合之间取得平衡?
主要发现
- 在四个基准数据集的拼接测试集上,GAS相比最佳先前神经WSD模型,F1分数最高提升2.2%。
- 扩展版本GAS ext通过整合上下位与下位词的释义,在合并测试集上达到70.6的最先进F1分数。
- GAS ext在四个测试集中的三个(SE3、SE13、SE15)超越了强大的词专家基线模型IMS+emb。
- 记忆模块中的多轮处理可提升性能,最优结果出现在三轮;超过此轮数后,性能趋于平稳或下降,归因于过拟合。
- 基于拼接的记忆更新策略在所有数据集上均持续优于基于相加的策略。
- 通过释义扩展整合词汇知识,显著增强了模型的泛化能力,尤其对罕见或歧义性高的词义表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。