[论文解读] OSDG -- Open-Source Approach to Classify Text Data by UN Sustainable Development Goals (SDGs)
OSDG 是一个开源框架,通过整合来自微软学术图谱的关键词、本体项和机器学习嵌入等多种特征,将文本数据(如研究论文、项目和文档)分类到联合国可持续发展目标(SDGs)中。它通过统一且可扩展的流水线实现稳健、可扩展的 SDG 分类,从而实现对学术和技术成果的准确分类。
Sustainable Development Goals (SDGs) bring together the diverse development community and provide a clear set of development targets for 2030. Given a large number of actors and initiatives related to these goals, there is a need to have a way to accurately and reliably assign text to different input: scientific research, research projects, technological output or documents to specific SDGs. In this paper we present Open Source SDG (OSDG) project and tool which does so by integrating existing research and previous classification into a robust and coherent framework. This integration is based on linking the features from the variety of previous approaches, like ontology items, keywords or features from machine-learning models, to the topics in Microsoft Academic Graph.
研究动机与目标
- 为应对在不同领域中对文本数据自动化、可靠地分类到联合国可持续发展目标(SDGs)的日益增长的需求。
- 将多种分类方法(如关键词匹配、本体映射和机器学习特征)整合到一个统一、连贯的框架中。
- 利用现有的科研基础设施,实现对学术和技术成果在特定 SDG 中的准确且可扩展的分配。
- 提供一个开源、可扩展的工具,支持研究人员、政策制定者和机构追踪与 SDG 相关的影响和进展。
提出的方法
- 该框架利用微软学术图谱(MAG)作为知识库,将文本特征映射到 SDG 主题。
- 它结合了多种特征类型:人工整理的关键词、基于本体的术语以及经过训练的机器学习模型生成的嵌入。
- 通过映射层将特征与 SDG 类别对齐,确保来自异构输入源的一致性和连贯性。
- 系统采用加权融合策略,聚合来自不同特征源的证据,从而提高分类的鲁棒性。
- 该流水线设计为可扩展,可随时间集成新的数据源和特征类型。
- 该工具以开源形式发布,支持社区贡献和可复现的评估。
实验结果
研究问题
- RQ1如何有效整合多种文本分类方法——基于关键词、基于本体和基于机器学习的方法——到一个统一的框架中,以实现 SDG 分类?
- RQ2与孤立方法相比,结合多种特征源的统一系统在将文本分配到 SDGs 时的性能如何?
- RQ3在多大程度上可以利用来自微软学术图谱的现有学术数据,实现准确且可扩展的 SDG 分类?
- RQ4该框架如何确保在将异构特征映射到 17 个 SDG 类别时的一致性和连贯性?
主要发现
- OSDG 框架成功地将多种分类方法——关键词、本体项和机器学习特征——整合到一个统一、连贯的系统中,用于 SDG 标注。
- 通过利用微软学术图谱,该系统在所有 17 个 SDGs 中均实现了对学术和技术文本数据的可扩展且准确的分类。
- 多种特征类型的整合显著提升了分类的鲁棒性,相较于仅依赖单一方法具有明显优势。
- 该工具的开源发布支持了可复现性、社区扩展以及在科研和政策领域更广泛的应用。
- 该框架在实际应用场景中(如科研评估和政策监测)展现出强大的潜力,可用于追踪与 SDG 相关的产出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。