Skip to main content
QUICK REVIEW

[论文解读] It's All in the Name: A Character Based Approach To Infer Religion

Rochana Chaturvedi, Sugat Chaturvedi|arXiv (Cornell University)|Oct 27, 2020
Names, Identity, and Discrimination Research被引用 4
一句话总结

本文提出一种基于字符的深度学习方法,用于推断南亚地区个人姓名中的宗教归属,通过利用姓名中的语言模式,在未见过的姓名上仍能实现高准确率。通过结合个人姓名与其父母或配偶的姓名,并使用逐层相关性传播(LRP)解释预测结果,该方法优于传统的字典匹配方法,并揭示了语音和拼写特征如何反映宗教与语言起源。

ABSTRACT

Demographic inference from text has received a surge of attention in the field of natural language processing in the last decade. In this paper, we use personal names to infer religion in South Asia - where religion is a salient social division, and yet, disaggregated data on it remains scarce. Existing work predicts religion using dictionary based method, and therefore, can not classify unseen names. We use character based models which learn character patterns and, therefore, can classify unseen names as well with high accuracy. These models are also much faster and can easily be scaled to large data sets. We improve our classifier by combining the name of an individual with that of their parent/spouse and achieve remarkably high accuracy. Finally, we trace the classification decisions of a convolutional neural network model using layer-wise relevance propagation which can explain the predictions of complex non-linear classifiers and circumvent their purported black box nature. We show how character patterns learned by the classifier are rooted in the linguistic origins of names.

研究动机与目标

  • 为解决南亚地区,尤其是个体层面,细粒度宗教人口统计数据稀缺的问题。
  • 克服基于字典的方法在分类未见姓名时的局限性。
  • 开发一种可扩展、高准确率的方法,利用姓名中的字符级模式进行宗教推断。
  • 通过逐层相关性传播(LRP)解释模型决策,减少深度学习分类器的黑箱特性。
  • 展示基于姓名的宗教推断在大规模社会科学研究与政策评估中的实用性。

提出的方法

  • 模型使用字符级嵌入来学习姓名中的局部模式,从而实现对未见姓名的泛化能力。
  • 通过时间维度上的最大池化操作,单层卷积神经网络(CNN)提取分层的字符级特征。
  • 模型采用二元交叉熵损失函数,并使用类别平衡权重,以处理宗教类别分布不均的问题。
  • 输入姓名被零填充至固定长度,并转换为29–30维的字符嵌入。
  • 最终输出为经过Sigmoid激活的全连接层,生成每个宗教类别的概率。
  • 应用逐层相关性传播(LRP)以解释预测结果,通过为输入字符分配相关性得分来实现。

实验结果

研究问题

  • RQ1基于字符的深度学习模型是否能在未见姓名上,比基于字典的方法实现更高的宗教推断准确率?
  • RQ2姓名中的语言与语音模式如何反映南亚地区宗教与语言的起源?
  • RQ3将个人姓名与其父母或配偶的姓名结合,是否能显著提升宗教分类的准确率?
  • RQ4LRP在多大程度上能够解释如CNN这类复杂非线性模型在此类任务中的决策过程?
  • RQ5印度教、穆斯林、基督徒、锡克教、佛教和耆那教群体的姓名中,字符级模式有何差异?

主要发现

  • 基于字符的CNN模型在未见姓名上的准确率显著高于传统字典匹配方法。
  • 将个人姓名与父母或配偶姓名结合,可将分类准确率提升至极高水平。
  • 模型成功识别出穆斯林姓名中 'F'、'Q' 和 'Z' 等字符的相对频率更高,反映了这些字符在阿拉伯语中出现的音素,而这些音素在梵语中并不存在。
  • 印度教、锡克教、耆那教和佛教姓名具有相似的字符分布,因其共同源于梵语或普拉克里特语。
  • LRP分析证实,模型依赖于语言上有意义的字符模式(如穆斯林姓名中的 'Q' 和 'Z')进行预测。
  • 使用TF-IDF与n-gram特征结合线性模型(SVM、LR)也表现良好,但CNN模型在处理罕见或未见姓名时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。