[论文解读] Ranking academic institutions on potential paper acceptance in upcoming conferences
本文提出一种两阶段方法,基于顶级会议的预期论文录用情况来预测研究机构排名。该方法使用从ACM Digital Library和Microsoft Academic Graph爬取的网络数据来识别完整的研究论文,随后应用指数平滑模型预测录用趋势,在KDD Cup 2016中取得了0.7508的NDCG@20总体得分。
The crux of the problem in KDD Cup 2016 involves developing data mining techniques to rank research institutions based on publications. Rank importance of research institutions are derived from predictions on the number of full research papers that would potentially get accepted in upcoming top-tier conferences, utilizing public information on the web. This paper describes our solution to KDD Cup 2016. We used a two step approach in which we first identify full research papers corresponding to each conference of interest and then train two variants of exponential smoothing models to make predictions. Our solution achieves an overall score of 0.7508, while the winning submission scored 0.7656 in the overall results.
研究动机与目标
- 基于未来顶级会议中完整研究论文的预测录用情况,对学术机构进行排名。
- 解决仅使用公开可用的网络数据估算未来论文录用情况的挑战。
- 开发一个能够跨多样化会议动态和出版模式进行泛化的稳健预测流水线。
- 通过结合半自动化的论文分类与时间序列建模,提高预测准确性。
提出的方法
- 使用网络爬虫从目标会议的ACM Digital Library论文集提取论文元数据和章节信息。
- 采用半自动化方法,结合人工规则过滤与分类模型,从所有录用论文中识别完整的研究论文。
- 基于每所机构录用论文所占比例,构建机构层面的相关性得分(rel scores)的时间序列。
- 对每个会议应用指数平滑和ARIMA模型,预测未来的rel scores。
- 通过网格搜索调优指数平滑的平滑参数α,最优值分别为:ACM MM为0.4,FSE为0.2,MobiComm为0.35。
- 实施基于NDCG@20作为评估指标的交叉验证框架,以选择模型和参数。
实验结果
研究问题
- RQ1如何利用公开可用的数据源,从会议论文集中可靠地识别出完整的研究论文?
- RQ2在具有不同出版趋势的多样化会议动态下,哪种时间序列预测模型表现最佳?
- RQ3指数平滑模型是否能在预测学术机构未来论文录用率方面优于更复杂的ARIMA模型?
- RQ4基于NDCG@20的交叉验证框架在估计排名预测真实世界性能方面有多有效?
主要发现
- 对于ACM MM,α = 0.4的指数平滑模型在平均交叉验证NDCG@20得分中表现最佳(0.7294)。
- 该模型在ACM MM的实际Phase 3得分达到0.7334,证实了其在未见数据上的强大泛化能力。
- Phase 2的结果显示模型具有良好的泛化能力,交叉验证得分为0.8086,实际得分为0.8075。
- ARIMA模型表现较差,原因在于rel score时间序列波动较大,尤其是在Phase 3。
- 半自动化的论文识别流水线相比纯规则方法显著减少了误报,提升了数据质量。
- 整体解决方案最终取得0.7508的NDCG@20得分,在竞赛中排名第二,仅次于冠军提交结果(0.7656)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。