[论文解读] Classification of Research Citations (CRC)
本文提出了一种自动化方法,通过引用周围的5句话窗口和结合情感词典的朴素贝叶斯分类器,对研究引用进行正面或负面情感分类。在150篇计算机科学论文上进行评估,该方法达到了80%的准确率,显示出在科学文献分析中跨学科应用的潜力。
Research is a continuous phenomenon. It is recursive in nature. Every research is based on some earlier research outcome. A general approach in reviewing the literature for a problem is to categorize earlier work for the same problem as positive and negative citations. In this paper, we propose a novel automated technique, which classifies whether an earlier work is cited as sentiment positive or sentiment negative. Our approach first extracted the portion of the cited text from citing paper. Using a sentiment lexicon we classify the citation as positive or negative by picking a window of at most five (5) sentences around the cited place (corpus). We have used Naïve-Bayes Classifier for sentiment analysis. The algorithm is evaluated on a manually annotated and class labelled collection of 150 research papers from the domain of computer science. Our preliminary results show an accuracy of 80%. We assert that our approach can be generalized to classification of scientific research papers in different disciplines.
研究动机与目标
- 自动化将研究引用分类为正面或负面情感,以支持文献综述和引用分析。
- 提取引用周围的上下文文本,以提高情感分类的准确性。
- 评估朴素贝叶斯分类器结合情感词典在人工标注的引用数据集上的性能。
- 评估该方法在不同科学学科中的泛化能力。
- 提供一种可扩展的解决方案,用于识别学术文献中的支持性或批判性参考文献。
提出的方法
- 该方法提取每篇引用论文中引用周围最多五句话的上下文窗口。
- 应用情感词典分析提取的上下文窗口的情感。
- 训练朴素贝叶斯分类器,基于周围文本的情感得分将引用分类为正面或负面。
- 该方法依赖于对150篇计算机科学领域研究论文的人工标注,以创建有标签的训练和评估数据集。
- 将引用上下文视为情感分类的文档,重点关注引用的直接文本环境。
- 系统基于局部上下文中的词汇情感线索进行情感评估,而非引用本身。
实验结果
研究问题
- RQ1上下文感知的情感分析方法能否有效将研究引用分类为正面或负面?
- RQ2当结合情感词典应用于引用上下文时,朴素贝叶斯分类器的准确率如何?
- RQ3在引用周围包含5句话的窗口在多大程度上提升了分类性能?
- RQ4该方法能否推广到计算机科学以外的其他科学领域?
- RQ5局部文本上下文在区分支持性与批判性引用方面有何影响?
主要发现
- 所提出的方法在计算机科学领域150篇人工标注的研究论文数据集上达到了80%的准确率。
- 使用5句话的上下文窗口显著提升了情感分类效果,能够捕捉引用周围的修辞意图。
- 朴素贝叶斯分类器在结合情感词典用于引用情感分析时表现出色。
- 结果表明,利用局部文本上下文和词汇情感资源进行引用情感分类是可行的。
- 该方法在学术文献分析和基于引用的研究评估自动化方面展现出前景。
- 本研究为将引用情感分析扩展到其他科学学科奠定了基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。