Skip to main content
QUICK REVIEW

[论文解读] An English-Hindi Code-Mixed Corpus: Stance Annotation and Baseline System

Sahil Swami, Ankush Khandelwal|arXiv (Cornell University)|May 30, 2018
Sentiment Analysis and Opinion Mining参考文献 7被引用 13
一句话总结

本论文提出了首个针对印度2016年货币废止政策的英语-印地语混合推特语料库,该语料库已对立场进行人工标注,包含3,545条手动标注的推文。论文提出了一套基线立场检测系统,采用字符n-gram、词n-gram和立场指示性词汇作为特征,通过使用RBF核SVM进行10折交叉验证,准确率达到58.7%,为低资源多语言环境下的混合语言立场检测提供了基础性资源。

ABSTRACT

Social media has become one of the main channels for peo- ple to communicate and share their views with the society. We can often detect from these views whether the person is in favor, against or neu- tral towards a given topic. These opinions from social media are very useful for various companies. We present a new dataset that consists of 3545 English-Hindi code-mixed tweets with opinion towards Demoneti- sation that was implemented in India in 2016 which was followed by a large countrywide debate. We present a baseline supervised classification system for stance detection developed using the same dataset that uses various machine learning techniques to achieve an accuracy of 58.7% on 10-fold cross validation.

研究动机与目标

  • 创建一个大规模、人工标注的英语-印地语混合语料库,用于高影响力社交媒体事件的立场检测。
  • 解决针对混合语言印度语言(尤其是英语-印地语)的舆论挖掘资源匮乏的问题。
  • 在该新语料库上开发并评估多种机器学习技术的基线立场检测系统。
  • 推动未来在混合语言NLP领域的发展,包括语言识别和多语言立场检测。
  • 为可重现性和进一步开发,提供数据集和基线模型的开源访问。

提出的方法

  • 使用Twitter Scraper API,在2016年之后的6个月内,通过关键词'notebandi'和'demonetisation'收集了3,545条英语-印地语混合推文。
  • 由母语为印地语-英语的双语者对每条推文进行立场标注('FAVOR'、'AGAINST'或'NONE'),Cohen’s Kappa值达到0.82。
  • 通过手动标记每个词元为英语或印地语,完成词元级别的语言标注,随后进行人工审核以纠正错误。
  • 提取三种特征类型:字符n-gram(n=1至3,频率≥8)、词n-gram(n=1至5,频率≥10)以及立场指示性词汇(得分≥0.6,频率≥5)。
  • 应用卡方特征选择方法,将特征空间缩减至每类500个最相关特征。
  • 使用10折交叉验证,在完整特征集上评估三种分类器——RBF核SVM、随机森林和线性SVM。

实验结果

研究问题

  • RQ1基线机器学习模型在英语-印地语混合社交媒体文本中的立场检测性能如何?
  • RQ2不同特征类型(字符n-gram、词n-gram、立场指示性词汇)在单独和联合使用时对立场检测准确率的贡献如何?
  • RQ3能否在新创建的、人工标注的混合语言语料库上有效训练出监督式立场检测系统,用于印度社交媒体话语?
  • RQ4标注者间一致性如何反映在混合多语言文本中立场标注的可靠性?
  • RQ5该语料库在推进混合语言NLP任务(如语言识别和情感分析)方面具有哪些潜力?

主要发现

  • 当三种特征类型联合使用时,RBF核SVM达到最高准确率58.7%。
  • 三种独立特征类型——字符n-gram、词n-gram和立场指示性词汇——的贡献几乎相等,准确率在54.6%至54.8%之间。
  • 随机森林分类器在使用全部特征时达到54.7%的准确率,而线性SVM在相同条件下达到56.6%的准确率。
  • 立场标注的标注者间一致性达到0.82(Cohen’s Kappa),表明标注具有一致性。
  • 数据集和基线模型已公开发布于GitHub,支持可重现性及混合语言NLP的进一步发展。
  • 本研究为印度混合语言社交媒体中的立场检测建立了基础性基准,尤其适用于英语-印地语等低资源语言对。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。