Skip to main content
QUICK REVIEW

[论文解读] Descriptions of SNSF-funded research projects

Dominik Meier, Rui Mata|arXiv (Cornell University)|Oct 12, 2021
Computational and Text Analysis Methods被引用 5
一句话总结

该论文介绍了 text2sdg,一个开源 R 包,可通过现有或自定义查询系统在任意文本中检测联合国可持续发展目标(SDGs)。该工具通过高标签可靠性(克朗巴赫阿尔法系数 ≥0.88)支持多语言文本分析,与 tibble 兼容,便于用户使用,并能高效处理大规模文本语料,运行时间因系统复杂度而异——最快约 1 分钟处理 1000 万词(Elsevier),最慢约 40 分钟(SIRIS)。

ABSTRACT

Monitoring progress on the United Nations Sustainable Development Goals (SDGs) is important for both academic and non-academic organizations. Existing approaches to monitoring SDGs have focused on specific data types; namely, publications listed in proprietary research databases. We present the text2sdg package for the R language, a user-friendly, open-source package that detects SDGs in any kind of text data using different existing or custom-made query systems. The text2sdg package thereby facilitates the monitoring of SDGs for a wide array of text sources and provides a much-needed basis for validating and improving extant methods to detect SDGs from text.

研究动机与目标

  • 解决在学术出版物之外的多样化文本来源中,缺乏可访问、开源的 SDG 监测工具的问题。
  • 使研究人员和组织能够使用标准化或自定义查询系统为文本数据打上 SDG 标签。
  • 评估在翻译文本上应用 SDG 标签的可靠性,特别是针对非英语语料库。
  • 评估不同 SDG 标签系统在处理大规模文本语料时的计算效率和性能。
  • 提供一个灵活、用户友好的框架,用于在 R 中集成和测试 SDG 检测方法。

提出的方法

  • 采用模块化 R 包架构,通过统一接口支持多种 SDG 标签系统(Elsevier、Aurora、SIRIS、SDSN、OSDG)。
  • 允许用户通过包含系统名称、查询字符串、SDG 目标和查询 ID 列的 tibble 定义自定义标签系统。
  • 集成使用 DeepL 引擎的翻译管道,以支持非英语文本中的 SDG 检测,并通过回译验证。
  • 使用 detect_any 函数对每篇文档应用多个查询,返回包含相关特征和查询标识符的 SDG 匹配结果。
  • 通过预编译和索引查询模式来优化查询执行,减少每篇文档的处理开销。
  • 使用模拟文本语料库(1K–10K 篇文档,10K–1000 万词)进行性能基准测试,测量 7000 次重复实验的平均运行时间。

实验结果

研究问题

  • RQ1text2sdg 在翻译后能否可靠地检测多语言文本中的 SDGs,特别是在使用回译进行验证时?
  • RQ2在处理大规模文本语料时,不同 SDG 标签系统(如 Elsevier、SIRIS)在计算效率方面如何比较?
  • RQ3自定义查询系统在统一的基于 R 的 SDG 检测框架中能够多大程度上实现灵活集成?
  • RQ4文档中的词数和文档结构如何影响不同标签系统下 SDG 检测的运行时间?
  • RQ5text2sdg 包能否作为一个可扩展、可伸缩的平台,用于验证和改进现有的 SDG 检测方法?

主要发现

  • text2sdg 包能够在英文和翻译后的文本中实现准确的 SDG 检测,原始标签与回译标签之间的克朗巴赫阿尔法系数相关性高于 0.88,表明可靠性高。
  • Elsevier 系统最快,处理 1000 万词仅需约 1 分钟;SIRIS 系统最慢,处理相同量文本约需 40 分钟。
  • 运行时间主要与总词数成正比,且随着文档集规模增大,单位词的处理开销降低,这是由于查询优化和缓存机制。
  • 该包通过 tibble 格式输入支持无缝集成自定义查询系统,使研究人员能够测试新型或特定领域的 SDG 检测策略。
  • 性能基准测试实验表明,查询复杂度和系统特有开销显著影响处理速度,最快系统在大规模应用中更具效率。
  • 使用 DeepL 进行翻译并未显著降低标签准确性,表明 text2sdg 适用于多样化的组织和学术场景中的多语言 SDG 监测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。