Skip to main content
QUICK REVIEW

[论文解读] Feature Construction for Relational Sequence Learning

Nicola Di Mauro, Teresa M. A. Basile|arXiv (Cornell University)|Jun 27, 2010
Data Mining Algorithms and Applications参考文献 21被引用 4
一句话总结

该论文提出Lynx,一种用于多类别关系序列学习的新方法,结合概率特征构建与基于包装器的特征选择,采用GRASP随机局部搜索和朴素贝叶斯分类器。该方法从关系序列中构建判别性模式,通过引导搜索选择最优子集,在蛋白质折叠分类任务上达到94.15%的准确率,优于TildeCRF和Fisher核等现有方法。

ABSTRACT

We tackle the problem of multi-class relational sequence learning using relevant patterns discovered from a set of labelled sequences. To deal with this problem, firstly each relational sequence is mapped into a feature vector using the result of a feature construction method. Since, the efficacy of sequence learning algorithms strongly depends on the features used to represent the sequences, the second step is to find an optimal subset of the constructed features leading to high classification accuracy. This feature selection task has been solved adopting a wrapper approach that uses a stochastic local search algorithm embedding a naive Bayes classifier. The performance of the proposed method applied to a real-world dataset shows an improvement when compared to other established methods, such as hidden Markov models, Fisher kernels and conditional random fields for relational sequences.

研究动机与目标

  • 解决在复杂、结构化领域中命题方法失效的多类别关系序列学习问题。
  • 通过模式挖掘将关系序列转换为信息丰富的特征向量,提升分类准确率。
  • 利用以分类器性能为搜索引导的包装器方法优化特征子集。
  • 证明概率特征构建与随机局部搜索相结合在真实关系序列数据上可取得更优结果。

提出的方法

  • 特征构建从关系序列中的频繁模式和新兴模式中生成布尔特征和概率特征。
  • 利用模式支持度和置信度值将每个序列映射为特征向量,实现概率化表示。
  • 包装器特征选择框架嵌入朴素贝叶斯分类器,基于预测准确率评估子集质量。
  • 通过贪婪随机自适应搜索程序(GRASP)的随机局部搜索高效探索特征子集空间。
  • 搜索过程以验证集上的误差最小化为指导,通过局部移动(添加/移除特征)迭代优化子集。
  • 使用置信度阈值(0.95和1.0)控制模式选择,其中1.0更倾向于选择高度判别性的“跳跃新兴模式”。

实验结果

研究问题

  • RQ1从关系序列中进行概率特征构建是否能提升多类别设置下的分类准确率?
  • RQ2基于随机局部搜索的包装器特征选择方法是否在关系序列学习中优于穷举法或过滤法?
  • RQ3在基于GRASP的搜索中,将朴素贝叶斯作为内部评估器用于特征子集优化的效果如何?
  • RQ4高置信度(置信度=1.0)模式相比低置信度模式在提升判别能力方面有多大优势?
  • RQ5Lynx在真实关系序列数据上与LoHHMs、Fisher核和TildeCRF等成熟方法相比表现如何?

主要发现

  • Lynx在蛋白质折叠分类数据集上实现了10折交叉验证的94.15%准确率,优于TildeCRF(92.96%)和Fisher核(84%)。
  • 在置信度设为0.95时,引入基于GRASP的特征选择使准确率从82.6%提升至87.8%,证明了优化方法的价值。
  • 使用置信度=1.0进行模式挖掘的准确率高于置信度=0.95,证实了‘跳跃新兴模式’具有高度判别性。
  • 在无特征选择时的基线性能(置信度=0.95时为82.6%)显著低于使用GRASP的版本,证明了子集优化的必要性。
  • 该方法优于LoHHMs(75%)和Fisher核(84%),显示出在先进统计关系学习系统中的强大竞争力。
  • 特征选择带来的性能提升在多个折叠中保持一致,表明方法具有鲁棒性和良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。