[论文解读] Feature Engineering and Ensemble Modeling for Paper Acceptance Rank Prediction
本文提出了一种特征工程与集成建模方法,用于预测顶级计算机科学会议中机构的论文录用等级,使用来自 Microsoft Academic Graph 的历史数据。该方法包括定义基础特征、引入相似会议的特征、应用主成分分析(PCA)进行降维,并通过集成学习结合多种排名模型,在 KDD Cup 2016 竞赛中取得第二名,验证集上的平均 NDCG@20 达到 0.7472。
Measuring research impact and ranking academic achievement are important and challenging problems. Having an objective picture of research institution is particularly valuable for students, parents and funding agencies, and also attracts attention from government and industry. KDD Cup 2016 proposes the paper acceptance rank prediction task, in which the participants are asked to rank the importance of institutions based on predicting how many of their papers will be accepted at the 8 top conferences in computer science. In our work, we adopt a three-step feature engineering method, including basic features definition, finding similar conferences to enhance the feature set, and dimension reduction using PCA. We propose three ranking models and the ensemble methods for combining such models. Our experiment verifies the effectiveness of our approach. In KDD Cup 2016, we achieved the overall rank of the 2nd place.
研究动机与目标
- 为解决基于顶级计算机科学会议预测的论文录用率,客观地对学术机构进行排名的挑战。
- 开发一个稳健的特征工程流程,以提升机构排名预测的性能。
- 设计并评估多种排名模型及集成策略,以提高泛化能力并降低预测不确定性。
- 验证通过相似会议扩展特征以及通过 PCA 进行降维的有效性。
提出的方法
- 基于每个机构-会议-年份组合在过去三年内的历史论文录用数量,定义基本机构特征。
- 利用引用和共同作者模式,为每个目标会议识别相似会议,以丰富特征集。
- 应用主成分分析(PCA)以降低特征维度,并减轻高维特征扩展带来的过拟合问题。
- 训练三种不同的排名模型:历史基线模型、回归模型(线性与 SVM)以及 Ranking SVM 模型。
- 采用模型融合(集成学习)结合多个模型的预测结果,以利用其互补优势。
- 在验证集上调整超参数,并使用 NDCG@20 在八个目标会议上的表现进行评估。
实验结果
研究问题
- RQ1如何利用历史数据与特征工程,高精度地预测机构的论文录用等级?
- RQ2在机构排名预测中,引入相似会议的特征对模型性能有何影响?
- RQ3在添加来自相似会议的高维特征后,通过 PCA 进行降维是否能提升模型的泛化能力?
- RQ4在这一开放性、不确定的预测任务中,集成建模是否能优于单一排名模型?
- RQ5在不同会议中,基线模型、回归模型与学习排序模型在 NDCG@20 表现上如何比较?
主要发现
- 集成模型在全部八个目标会议上的平均 NDCG@20 得分为 0.7472,优于所有单一模型。
- 仅添加相似会议特征并未提升性能,甚至在某些情况下导致性能下降,可能由于维度增加引发的过拟合。
- 在特征扩展后应用 PCA 显著提升了性能,平均使 NDCG@20 提高 0.0163,证实其在减轻过拟合方面的有效性。
- 回归模型在四个会议(SIGCOMM、KDD、FSE、MM)中表现最佳,而集成模型在三个会议(SIGIR、SIGMOD、MobiCom)中领先。
- 基线模型在 ICML 上表现出人意料的优异(NDCG@20 = 0.8918),但整体仍被集成模型超越,表明集成模型即使在基线性能较简单的情况下也具备强大鲁棒性。
- 该框架在 KDD Cup 2016 竞赛中获得总排名第二,各阶段排名分别为:SIGIR 第 10 名、KDD 第 39 名、MM 第 14 名。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。