[论文解读] Prevalence of code mixing in semi-formal patient communication in low resource languages of South Africa
本研究调查了南非国家级MomConnect健康平台中半正式患者交流中的代码混用现象,分析了182,000条独立用户消息。利用Polyglot NLP库,研究发现代码混用的出现率约为10%,主要发生在英语、祖鲁语和科萨语之间,凸显了在低资源多语言环境中自然语言处理系统面临的重大挑战。
In this paper we address the problem of code-mixing in resource-poor language settings. We examine data consisting of 182k unique questions generated by users of the MomConnect helpdesk, part of a national scale public health platform in South Africa. We show evidence of code-switching at the level of approximately 10% within this dataset -- a level that is likely to pose challenges for future services. We use a natural language processing library (Polyglot) that supports detection of 196 languages and attempt to evaluate its performance at identifying English, isiZulu and code-mixed questions.
研究动机与目标
- 量化南非国家级公共卫生平台中半正式患者交流的代码混用频率。
- 评估Polyglot NLP库在识别低资源语言中语言和代码混用的能力。
- 评估代码混用对多语言、低资源环境中自然语言处理准确率的影响。
- 为开发支持多语言社会中公平数字健康接入的自然语言处理工具提供见解。
- 为未来开发自动化问答系统(如南非国家健康保险计划到2026年)提供信息支持。
提出的方法
- 从MomConnect帮助台平台收集并预处理了182,000条独立消息。
- 预处理包括去除标点符号、表情符号、数字,并将每条消息分割为四个部分。
- 应用Polyglot NLP库,对每个消息片段在196种支持语言中进行语言标注。
- 创建了四个手动标注的数据集:完整数据集、纯英语、纯祖鲁语和代码混用样本。
- 使用准确率、加权精确率和加权召回率评估分类器在完整数据样本上的性能。
- 对注册语言分布(表1)与实际消息语言使用情况(表3)进行统计比较。
实验结果
研究问题
- RQ1在南非国家级健康平台的半正式患者交流中,代码混用的频率是多少?
- RQ2Polyglot NLP库在识别低资源南非语言中的语言和代码混用时,准确度如何?
- RQ3实际消息中的语言使用分布与用户注册时的语言偏好相比有何差异?
- RQ4在多语言、低资源环境中,代码混用在多大程度上降低了标准自然语言处理技术的性能?
- RQ5代码混用对开发可扩展、自动化的公共健康应用语言处理工具有何影响?
主要发现
- 检测到约10%的消息存在代码混用,其中Polyglot模型将65.5%的代码混用消息分类为包含混合语言内容。
- Polyglot分类器在完整数据样本上的准确率为0.78,加权精确率为0.89,加权召回率为0.78。
- 分类器正确识别了100%的纯英语消息,但仅识别出75.75%的纯祖鲁语消息,表明在低资源语言上的表现较低。
- 用户注册的语言分布(表1)与实际消息内容的语言使用情况(表3)之间存在显著差异(χ² = 93.168,p < 2.2e-16)。
- 该模型的性能并未显著优于假设所有消息均为英语的基准(准确率0.765),凸显了数据不平衡问题。
- 代码混用在英语与祖鲁语组合中最为普遍(23.25%),其次是英语与科萨语(16%)和祖鲁语与科萨语(17.5%)的组合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。