[论文解读] Building a Pilot Software Quality-in-Use Benchmark Dataset
本文提出了一项针对软件质量使用中的 pilot 基准数据集,使用三位专家按照自定义方案标注的句子。经过整合以减少偏差后,标注者间的一致性达到中等到高度水平(kappa 统计量),为软件质量评估中的情感分析模型训练与评估提供了可靠资源。
Prepared domain specific datasets plays an important role to supervised learning approaches. In this article a new sentence dataset for software quality-in-use is proposed. Three experts were chosen to annotate the data using a proposed annotation scheme. Then the data were reconciled in a (no match eliminate) process to reduce bias. The Kappa, k statistics revealed an acceptable level of agreement; moderate to substantial agreement between the experts. The built data can be used to evaluate software quality-in-use models in sentiment analysis models. Moreover, the annotation scheme can be used to extend the current dataset.
研究动机与目标
- 为软件质量使用领域创建一个特定领域的标注数据集,以支持软件工程中的监督学习。
- 开发并验证一种用于标注与软件质量相关句子的标注方案。
- 通过使用“无匹配即剔除”流程的专家整合,确保数据集的可靠性并减少偏差。
- 为评估软件质量评估中的情感分析模型提供基础。
- 通过所提出的标注框架,实现未来对数据集的扩展。
提出的方法
- 三位领域专家使用聚焦于质量使用方面的自定义标注方案,对软件相关文本中的句子进行标注。
- 应用整合流程,移除不匹配的标注,以最小化偏差并提高一致性。
- 计算 Cohen's kappa 统计量,以衡量数据集中标注者间的一致性。
- 最终数据集的结构设计用于支持监督学习任务,特别是软件质量评估中的情感分析。
- 标注方案设计为可扩展,以支持未来数据集的扩展。
- 数据集的收集与处理与 CITA 2015 会议论文集保持一致。
实验结果
研究问题
- RQ1如何构建一个可靠且特定领域的软件质量使用基准数据集?
- RQ2使用所提出的方案,专家标注者在质量使用标签上的一致性程度如何?
- RQ3整合流程能否有效减少专家标注的软件质量数据中的偏差?
- RQ4该数据集在训练和评估情感分析模型方面的可靠性如何?
- RQ5所提出的标注方案是否可重复使用并扩展以支持未来数据集的扩充?
主要发现
- 通过 Cohen's kappa 测量的标注者间一致性达到中等到高度水平,表明标注质量可靠。
- “无匹配即剔除”整合流程成功减少了偏差,并提高了专家标注之间的一致性。
- 最终数据集适用于在软件质量使用情境中训练和评估情感分析模型。
- 所提出的标注方案具有鲁棒性,可重复使用,以通过新增数据扩展数据集。
- 该数据集已成功作为 9 届国际信息技术亚洲会议(CITA 2015)论文集的一部分发表。
- 本研究证明了利用专家标注句子构建高质量基准数据集用于软件质量使用评估的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。