[论文解读] An English-Hindi Code-Mixed Corpus: Stance Annotation and Baseline System
本论文提出了首个针对印度2016年货币废止政策的英语-印地语混合推特语料库,该语料库已对立场进行人工标注,包含3,545条手动标注的推文。论文提出了一套基线立场检测系统,采用字符n-gram、词n-gram和立场指示性词汇作为特征,通过使用RBF核SVM进行10折交叉验证,准确率达到58.7%,为低资源多语言环境下的混合语言立场检测提供了基础性资源。
Social media has become one of the main channels for peo- ple to communicate and share their views with the society. We can often detect from these views whether the person is in favor, against or neu- tral towards a given topic. These opinions from social media are very useful for various companies. We present a new dataset that consists of 3545 English-Hindi code-mixed tweets with opinion towards Demoneti- sation that was implemented in India in 2016 which was followed by a large countrywide debate. We present a baseline supervised classification system for stance detection developed using the same dataset that uses various machine learning techniques to achieve an accuracy of 58.7% on 10-fold cross validation.
研究动机与目标
- 创建一个大规模、人工标注的英语-印地语混合语料库,用于高影响力社交媒体事件的立场检测。
- 解决针对混合语言印度语言(尤其是英语-印地语)的舆论挖掘资源匮乏的问题。
- 在该新语料库上开发并评估多种机器学习技术的基线立场检测系统。
- 推动未来在混合语言NLP领域的发展,包括语言识别和多语言立场检测。
- 为可重现性和进一步开发,提供数据集和基线模型的开源访问。
提出的方法
- 使用Twitter Scraper API,在2016年之后的6个月内,通过关键词'notebandi'和'demonetisation'收集了3,545条英语-印地语混合推文。
- 由母语为印地语-英语的双语者对每条推文进行立场标注('FAVOR'、'AGAINST'或'NONE'),Cohen’s Kappa值达到0.82。
- 通过手动标记每个词元为英语或印地语,完成词元级别的语言标注,随后进行人工审核以纠正错误。
- 提取三种特征类型:字符n-gram(n=1至3,频率≥8)、词n-gram(n=1至5,频率≥10)以及立场指示性词汇(得分≥0.6,频率≥5)。
- 应用卡方特征选择方法,将特征空间缩减至每类500个最相关特征。
- 使用10折交叉验证,在完整特征集上评估三种分类器——RBF核SVM、随机森林和线性SVM。
实验结果
研究问题
- RQ1基线机器学习模型在英语-印地语混合社交媒体文本中的立场检测性能如何?
- RQ2不同特征类型(字符n-gram、词n-gram、立场指示性词汇)在单独和联合使用时对立场检测准确率的贡献如何?
- RQ3能否在新创建的、人工标注的混合语言语料库上有效训练出监督式立场检测系统,用于印度社交媒体话语?
- RQ4标注者间一致性如何反映在混合多语言文本中立场标注的可靠性?
- RQ5该语料库在推进混合语言NLP任务(如语言识别和情感分析)方面具有哪些潜力?
主要发现
- 当三种特征类型联合使用时,RBF核SVM达到最高准确率58.7%。
- 三种独立特征类型——字符n-gram、词n-gram和立场指示性词汇——的贡献几乎相等,准确率在54.6%至54.8%之间。
- 随机森林分类器在使用全部特征时达到54.7%的准确率,而线性SVM在相同条件下达到56.6%的准确率。
- 立场标注的标注者间一致性达到0.82(Cohen’s Kappa),表明标注具有一致性。
- 数据集和基线模型已公开发布于GitHub,支持可重现性及混合语言NLP的进一步发展。
- 本研究为印度混合语言社交媒体中的立场检测建立了基础性基准,尤其适用于英语-印地语等低资源语言对。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。