[论文解读] Word Sense Disambiguation by Web Mining for Word Co-occurrence Probabilities
本论文介绍了NRC在Senseval-3英语词汇样本任务中的词义消歧系统,该系统利用网络挖掘的词共现概率生成语义特征,无需依赖外部词典。该系统采用监督学习方法,结合Weka与Brill标注器,取得了75.9%的粗粒度F1分数,证明基于语料的语义特征能显著提升词义消歧性能。
This paper describes the National Research Council (NRC) Word Sense Disambiguation (WSD) system, as applied to the English Lexical Sample (ELS) task in Senseval-3. The NRC system approaches WSD as a classical supervised machine learning problem, using familiar tools such as the Weka machine learning software and Brill's rule-based part-of-speech tagger. Head words are represented as feature vectors with several hundred features. Approximately half of the features are syntactic and the other half are semantic. The main novelty in the system is the method for generating the semantic features, based on word \hbox{co-occurrence} probabilities. The probabilities are estimated using the Waterloo MultiText System with a corpus of about one terabyte of unlabeled text, collected by a web crawler.
研究动机与目标
- 开发一个稳健的监督式WSD系统,利用大规模未标注网络文本生成语义特征。
- 探究基于语料的语义特征(源自词共现概率)是否能有效替代WSD中的词典特征。
- 评估在Senseval-3 ELS基准上,基于丰富特征的句法-语义混合模型的性能。
- 确定特征选择与归一化策略对使用真实网络数据的WSD准确率的影响。
- 比较在基于语料的特征背景下,细粒度与粗粒度词义标注的有效性。
提出的方法
- 系统以每个中心词为中心,使用九词窗口,使用Brill的基于规则的标注器分配词性标签。
- 句法特征通过词性标签使用三种匹配类型生成:ptag(部分标签匹配)、tag(精确标签匹配)和word(精确词匹配)。
- 语义特征通过使用Waterloo MultiText系统从1TB网络语料中估计的词共现概率生成。
- 共现概率被转换为点互信息(PMI)分数,随后按每个特征向量进行百分位数归一化。
- 特征向量结合了约50%的句法特征与约50%的语义特征,所有特征均内部归一化为百分位数,以提升学习稳定性。
- 使用五种Weka基础分类器的投票集成模型,结合袋装法进行最终分类,采用一对多策略进行多分类预测。
实验结果
研究问题
- RQ1能否有效挖掘大规模未标注网络文本,以在不依赖外部词典的情况下生成对WSD有意义的语义特征?
- RQ2基于网络挖掘共现概率的WSD系统性能与使用精心整理词典资源的系统相比如何?
- RQ3在监督式WSD框架中,句法特征与语义特征的最佳平衡点是什么?
- RQ4对语义特征进行百分位数归一化是否能提升模型的泛化能力与在未见测试数据上的性能?
- RQ5当使用基于语料的特征时,将细粒度词义重新标记为粗粒度等价类是否有助于提升WSD性能?
主要发现
- NRC-Fine系统在Senseval-3 ELS任务中取得了69.4%的细粒度F1分数与75.9%的粗粒度F1分数。
- NRC-Coarse2系统取得了75.7%的粗粒度F1分数,表明粗粒度标注并未提升性能,与细粒度系统相比无明显优势。
- 保留更多语义特征(通过减少激进的剪枝)可提升性能,表明特征选择阈值应保持保守。
- 该系统的性能在47个Senseval-3参赛系统中处于中游水平,介于最佳系统(细粒度72.9%,粗粒度79.5%)与中位数系统(细粒度65.1%,粗粒度73.7%)之间。
- 对语义特征进行百分位数归一化提升了模型稳定性和性能,与以往基于PMI学习的研究结果一致。
- 缺乏词典并未影响性能,证实大规模网络语料可作为WSD的有效语义知识来源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。