[论文解读] A Transfer Learning Approach for Dialogue Act Classification of GitHub Issue Comments
本文提出一种迁移学习方法,用于使用预训练嵌入(GloVe、USE、BERT)对GitHub问题评论中的对话行为(DA)分类,由于缺乏大规模标注的GitHub语料库,因此借助外部数据集。通用句子编码器(USE)在平均F1得分上达到0.42,表现最佳,证明了尽管标注数据有限,仍可将问题评论映射到认知团队过程。
Social coding platforms, such as GitHub, serve as laboratories for studying collaborative problem solving in open source software development; a key feature is their ability to support issue reporting which is used by teams to discuss tasks and ideas. Analyzing the dialogue between team members, as expressed in issue comments, can yield important insights about the performance of virtual teams. This paper presents a transfer learning approach for performing dialogue act classification on issue comments. Since no large labeled corpus of GitHub issue comments exists, employing transfer learning enables us to leverage standard dialogue act datasets in combination with our own GitHub comment dataset. We compare the performance of several word and sentence level encoding models including Global Vectors for Word Representations (GloVe), Universal Sentence Encoder (USE), and Bidirectional Encoder Representations from Transformers (BERT). Being able to map the issue comments to dialogue acts is a useful stepping stone towards understanding cognitive team processes.
研究动机与目标
- 解决GitHub问题评论中对话行为分类缺乏大规模标注数据集的问题。
- 探索利用标准对话数据集中的预训练嵌入技术,以提升在低资源GitHub评论数据上的性能。
- 通过对话行为分类,将GitHub问题评论映射到认知团队过程,特别是与团队宏观认知模型(MITM)对齐。
- 发布一个公开可用的人工标注的GitHub问题评论数据集,以支持未来在团队认知和自然语言处理领域的研究。
- 评估并比较词级(GloVe)与句级(USE、BERT)嵌入模型在低资源设置下的有效性。
提出的方法
- 在新收集的人工标注的GitHub问题评论数据集上微调预训练的句嵌入模型——通用句子编码器(USE)、BERT和GloVe。
- 将Switchboard(SwDA)语料作为源领域用于迁移学习,利用其丰富的对话行为标注。
- 使用微调后的嵌入训练多种分类模型,并对学习率、训练轮数和批量大小进行超参数调优。
- 采用多分类框架将评论映射到DAMSL对话行为标签,重点关注高频且与认知相关的类别,如“陈述观点”、“同意/接受”和“确认”。
- 构建DAMSL标签与团队宏观认知模型(MITM)中认知状态之间的映射,以支持团队认知分析。
- 使用精确率、召回率和F1得分评估模型性能,重点关注类别级和宏平均指标。
实验结果
研究问题
- RQ1在低资源GitHub问题评论数据中,哪种预训练嵌入模型(GloVe、USE、BERT)在对话行为分类中表现最佳?
- RQ2当应用于风格和复杂性不同的GitHub问题评论时,从标准对话数据集(如SwDA)进行迁移学习的效果如何?
- RQ3能否通过GitHub评论的对话行为分类推断出认知团队过程,如信息收集和知识构建?
- RQ4在该低资源设置下,超参数调优(学习率、批量大小、训练轮数)对模型性能有何影响?
- RQ5该提出的标注方案在未来团队认知研究中是否可靠且可扩展?
主要发现
- 通用句子编码器(USE)在所有对话行为类别上的平均F1得分达到最高,为0.42,优于GloVe和BERT在低资源设置下的表现。
- 表现最佳的模型(USE)实现了0.42的宏平均F1,其中“陈述观点”类别的召回率高达0.92,但精确率仅为0.51,表明其对信息性评论的检测能力很强。
- BERT在微调后性能提升有限,与先前研究结果一致,表明BERT在某些NLP任务中对微调不敏感。
- 多个对话行为类别,包括“问题”、“同意/接受”和“确认”,表现出高精确率(如“qy”和“fp”类别的精确率为1.00),表明其在关键认知过程指标上的性能优异。
- “陈述非观点”类别的F1得分为0.43,表现中等,表明事实性或任务导向的评论可被合理分类。
- 数据集发布包含30个对话行为标签的859个标注的GitHub问题评论,未来工作将进一步评估标注者间一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。