Skip to main content
QUICK REVIEW

[论文解读] SMPOST: Parts of Speech Tagger for Code-Mixed Indic Social Media Text

Deepak Gupta, Shubham Tripathi|arXiv (Cornell University)|Feb 1, 2017
Natural Language Processing Techniques参考文献 4被引用 10
一句话总结

该论文提出 SMPOST,一种基于条件随机场(CRF)并结合丰富语言学特征的监督式代码混杂印地语社交媒体文本词性标注工具。该方法在英语-印地语、英语-孟加拉语和英语-泰卢固语的推特、脸书及 WhatsApp 数据上均表现出色,其中 Run-1 在多数领域,尤其是在 WhatsApp 和推特平台上优于 Run-2,展现出在代码混杂社交媒体平台上的鲁棒性与泛化能力。

ABSTRACT

Use of social media has grown dramatically during the last few years. Users follow informal languages in communicating through social media. The language of communication is often mixed in nature, where people transcribe their regional language with English and this technique is found to be extremely popular. Natural language processing (NLP) aims to infer the information from these text where Part-of-Speech (PoS) tagging plays an important role in getting the prosody of the written text. For the task of PoS tagging on Code-Mixed Indian Social Media Text, we develop a supervised system based on Conditional Random Field classifier. In order to tackle the problem effectively, we have focused on extracting rich linguistic features. We participate in three different language pairs, ie. English-Hindi, English-Bengali and English-Telugu on three different social media platforms, Twitter, Facebook & WhatsApp. The proposed system is able to successfully assign coarse as well as fine-grained PoS tag labels for a given a code-mixed sentence. Experiments show that our system is quite generic that shows encouraging performance levels on all the three language pairs in all the domains.

研究动机与目标

  • 开发一种针对代码混杂的印度社交媒体文本的鲁棒词性标注系统,其中英语与印地语、孟加拉语和泰卢固语等区域语言混合使用。
  • 通过混合规则基础与分类器基础的方法,应对噪声大、非正式且高度多变的社交媒体文本挑战。
  • 使用粗粒度和细粒度词性标注集,在多个语言对和社交媒体平台(推特、脸书、WhatsApp)上评估系统的性能。
  • 探索在低资源、代码混杂的自然语言处理任务中,基于 CRF 的分类器结合手工设计语言学特征的有效性。

提出的方法

  • 采用两阶段流程:首先,利用正则表达式和词典查找,通过规则基础系统清洗并标注非字母字符(如标点符号、URL、数字、表情符号、Unicode 符号).
  • 清洗后的数据随后通过基于 CRF 的分类器进行处理,该分类器基于手工设计的语言学特征进行训练,包括词形、前缀、后缀和上下文特征。
  • CRF 模型使用 CRF++ 训练,特征模板在英语-印地语数据上进行优化,并统一应用于所有语言对。
  • 评估了两种受约束的系统运行方式:Run-1 在所有平台(脸书、推特、WhatsApp)的合并数据上进行训练;Run-2 则分别对每个平台进行训练和预测。
  • 系统使用 BIS 词性标注集进行训练和评估,性能在粗粒度和细粒度标注层级上均有报告。
  • 非约束系统通过引入前一年 ICON-2015 共享任务的数据扩展了 Run-1,但未观察到显著的性能提升。

实验结果

研究问题

  • RQ1混合规则基础与 CRF 基础的方法在代码混杂的印度社交媒体文本词性标注中效果如何?
  • RQ2在合并的社交媒体数据(涵盖脸书、推特和 WhatsApp)上进行训练,是否比平台特定的训练更具泛化能力?
  • RQ3该系统在不同语言对(英语-印地语、英语-孟加拉语、英语-泰卢固语)上,于不同社交媒体平台上的表现如何?
  • RQ4基于 CRF 的模型结合丰富的语言学特征,是否能在低资源的代码混杂词性标注任务中实现优异性能?
  • RQ5在受约束设置下,引入前一年的数据是否显著提升性能?

主要发现

  • Run-1 使用单一模型在合并的脸书、推特和 WhatsApp 数据上进行训练,在大多数领域表现更优,在粗粒度层级上,英语-泰卢固语 WhatsApp 数据的 F1 得分为 0.846。
  • 在英语-印地语数据中,Run-1 在推特数据上的粗粒度层级 F1 得分为 0.904,表明其在不同平台间具有强大的泛化能力。
  • 在所有语言对中,Run-2 在脸书数据上的表现更优,表明平台特定的语言模式从平台独立训练中受益。
  • 在 Run-1 中,英语-泰卢固语推特数据在粗粒度层级的 F1 得分为 0.879,表明其在低资源语言对上的强大性能。
  • 尽管引入了 ICON-2015 共享任务的数据,非约束系统在性能上并未显著优于受约束的 Run-1,表明当前数据量可能已足够,或数据分布差异限制了进一步提升。
  • 规则基础组件成功处理了 85% 的非字母字符(如标点符号、URL、数字),在 CRF 分类前有效降低了噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。