Skip to main content
QUICK REVIEW

[论文解读] Evaluating the Effectiveness of Ensembles of Decision Trees in Disambiguating Senseval Lexical Samples

Ted Pedersen|ArXiv.org|May 27, 2002
Bayesian Modeling and Causal Inference参考文献 6被引用 8
一句话总结

本文评估了基于Senseval-1和Senseval-2词汇样本中的一元、二元和共现特征的决策树集成模型在词义消歧任务中的表现。该系统采用袋装决策树(基于Weka的J48)在不同特征视图上进行训练,其中共现特征单独表现最佳,表明集成模型对单一模型的改进有限。

ABSTRACT

This paper presents an evaluation of an ensemble--based system that participated in the English and Spanish lexical sample tasks of Senseval-2. The system combines decision trees of unigrams, bigrams, and co--occurrences into a single classifier. The analysis is extended to include the Senseval-1 data.

研究动机与目标

  • 评估基于集成的决策树是否在词义消歧准确率上优于单一分类器。
  • 确定Duluth38集成中各基分类器是否具有互补性或冗余性。
  • 评估一元、二元和共现特征在消歧性能中的相对贡献。
  • 将Duluth38系统的性能与Senseval-1和Senseval-2中的顶尖系统进行比较。
  • 探究更简单的模型(如多数分类器、决策桩)在最优组合下是否能达到与复杂集成模型相当的性能。

提出的方法

  • 系统使用袋装决策树(通过Weka的J48实现)在三种不同的特征视图上进行训练:一元特征、二元特征和共现特征。
  • 一元特征是指在目标词上下文中出现五次或以上且不包括停用词的词。
  • 二元特征是两词序列,其似然比值≥6.635(p ≤ 0.01),表示非独立性。
  • 共现特征是包含目标词及其前后一至两个位置内的邻近词的词对,其似然比值≥2.706(p ≤ 0.10)。
  • 每类特征形成独立的训练集,各分类器在对应数据集上独立训练。
  • 最终预测结果为三个分类器在集成中进行多数投票的结果。

实验结果

研究问题

  • RQ1Duluth38集成中的成员分类器是否具有互补性,还是其预测存在冗余?
  • RQ2通过集成投票结合多个决策树是否能显著提升词义消歧的准确率,超过单一分类器?
  • RQ3在一元、二元和共现特征中,哪类特征对消歧准确率的贡献最大?
  • RQ4Duluth38集成的性能与Senseval-1和Senseval-2中的顶尖系统相比如何?
  • RQ5在最优组合下,简单的基线模型(如多数分类器、决策桩)在多大程度上能达到与复杂集成模型相当的性能?

主要发现

  • 仅使用共现决策树在Senseval-1数据上达到了68%的准确率,与完整集成模型的性能一致。
  • 集成系统(Duluth38)在Senseval-1上达到68%的准确率,在英语Senseval-2测试集上达到72.5%的准确率。
  • 共现特征分类器是表现最好的单一分类器,优于一元和二元特征分类器。
  • Duluth38与前两名系统在所有数据集上的测试实例中一致率超过80%。
  • 多数分类器和决策桩在33%至43%的测试实例上判断错误,表明通过最优组合仍有改进空间。
  • 集成模型仅对表现最佳的单一分类器(共现树)带来微小提升,表明成员之间互补性有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。