[论文解读] Classifying Patent Applications with Ensemble Methods
本文提出了一种基于集成SVM的系统,用于将澳大利亚专利申请分类到IPC分类法的八个粗粒度类别中。通过结合WIPO-alpha和WIPO-en gamma的大量训练数据,以及词级和字符级的TF-IDF特征,该方法在ALTA 2018共享任务中取得了0.778的微平均F1得分,位列14支队伍中的第一名。
We present methods for the automatic classification of patent applications using an annotated dataset provided by the organizers of the ALTA 2018 shared task - Classifying Patent Applications. The goal of the task is to use computational methods to categorize patent applications according to a coarse-grained taxonomy of eight classes based on the International Patent Classification (IPC). We tested a variety of approaches for this task and the best results, 0.778 micro-averaged F1-Score, were achieved by SVM ensembles using a combination of words and characters as features. Our team, BMZ, was ranked first among 14 teams in the competition.
研究动机与目标
- 开发一种自动化系统,将专利申请分类到八个主要IPC类别中。
- 利用WIPO数据仓库提供的大规模、非领域内训练数据,提升分类性能。
- 探究集成学习与半监督技术在低资源专利文本分类中的有效性。
- 评估结合词n-gram与字符n-gram的混合特征工程在提升泛化能力方面的效果。
- 在ALTA 2018共享任务的专利申请分类中实现最先进性能。
提出的方法
- 系统采用混合特征集,结合词n-gram(1–2)和字符n-gram(3–6)的TF-IDF得分。
- 特征从ALTA 2018数据集提取,并扩展了来自WIPO-alpha的46,319篇训练文档和28,924篇测试文档,以及来自WIPO-en gamma的100,000个样本。
- 采用线性支持向量机(SVM)作为基础分类器,并通过模型集成提升鲁棒性并减少过拟合。
- 应用了半监督微调步骤,将高置信度预测结果添加到未标记测试数据的训练集中。
- 文本预处理通过规范化空白字符并去除数字和大小写区分,将文档合并为单一文本块。
- 训练过程中使用10折交叉验证以评估性能并防止过拟合。
实验结果
研究问题
- RQ1与单模型基线相比,使用SVM的集成学习是否能提升专利申请分类的性能?
- RQ2在多大程度上,将来自WIPO仓库的大规模、非领域内专利数据纳入能提升分类准确率?
- RQ3词级与字符级n-gram特征的组合在捕捉专利特异性语言模式方面有多有效?
- RQ4当标注数据有限时,使用高置信度伪标签的半监督学习是否能提升性能?
- RQ5在专利文本分类中,混合特征工程是否优于传统的仅使用词特征的方法?
主要发现
- 结合词级与字符级特征的集成模型在私有测试集上取得了最高的性能,微平均F1得分为0.778。
- 引入WIPO-alpha和WIPO-en gamma数据显著提升了性能,F1得分从基线的0.744(仅使用WIPO-alpha)提升至最终系统的0.778。
- 半监督方法略微降低了性能,私有测试集上的F1得分为0.704,表明在此设置下收益有限。
- 表现最佳的系统在ALTA 2018共享任务中位列14支队伍中的第一名,优于所有其他提交结果。
- 集成学习的使用有助于防止过拟合并提升了模型在多样化专利文本上的泛化能力。
- 词n-gram与字符n-gram的混合特征集比仅使用词特征更有效,尤其是在结合大规模数据时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。