[论文解读] Can we track the geography of surnames based on bibliographic data?
本文提出利用书目数据通过两种统计方法推断姓氏的地理起源:基于最常见起源国的姓氏-国家归属分配方法以及基于Kullback-Leibler散度的方法,并使用基尼指数进行评估。该方法在追踪科学人才流动和姓氏起源方面表现出良好前景,但仍需进一步验证。
In this paper we explore the possibility of using bibliographic databases for tracking the geographic origin of surnames. Surnames are used as a proxy to determine the ethnic, genetic or geographic origin of individuals in many fields such as Genetics or Demography; however they could also be used for bibliometric purposes such as the analysis of scientific migration flows. Here we present two relevant methodologies for determining the most probable country to which a surname could be assigned. The first methodology assigns surnames based on the most common country that can be assigned to a surname and the Kullback-Liebler divergence measure. The second method uses the Gini Index to evaluate the assignment of surnames to countries. We test both methodologies with control groups and conclude that, despite needing further analysis on its validity; these methodologies already show promising results.
研究动机与目标
- 探究书目数据库是否可用于推断姓氏的地理起源。
- 开发并测试基于频率和分布模式将姓氏分配至国家的统计方法。
- 通过受控测试组评估姓氏-地理映射的可靠性和准确性。
- 实现文献计量学中的新应用,例如通过基于姓氏的地理推断分析科学人才流动。
提出的方法
- 第一种方法基于姓氏-国家数据库中姓氏出现频率最高的国家进行归属分配,并使用Kullback-Leibler散度衡量姓氏分布与各国特定分布之间的距离。
- 第二种方法应用基尼指数评估姓氏在各国之间的分配集中程度,以识别姓氏是否与单一国家强烈关联。
- 使用已知地理起源的姓氏控制组来验证两种方法的准确性。
- 该方法利用现有的书目数据(如作者隶属关系和出版记录)推断姓氏起源,无需直接使用民族或遗传数据。
- 使用Kullback-Leibler散度量化观察到的姓氏分布与各国预期分布之间的差异。
- 基尼指数评估姓氏在各国之间分配的不平等程度,值越高表示对单一国家的集中度越强。
实验结果
研究问题
- RQ1书目数据能否可靠地推断姓氏的地理起源?
- RQ2Kullback-Leibler散度在将姓氏分配至其最可能的起源国方面准确度如何?
- RQ3基尼指数在多大程度上反映了姓氏-国家关联的特异性?
- RQ4当应用于作者隶属关系时,这些方法能否检测到科学人才流动的模式?
- RQ5在已知姓氏起源的控制组上测试时,这些方法表现如何?
主要发现
- Kullback-Leibler散度方法通过比较分布模式,成功识别出姓氏最可能的起源国。
- 基尼指数有效衡量了姓氏分配的集中程度,表明存在强烈的国家特异性关联。
- 在控制组测试中,两种方法在将姓氏分配至地理起源方面均表现出良好结果。
- 本研究证明,书目数据可作为追踪姓氏地理分布的可行替代指标。
- 尽管结果令人鼓舞,作者仍指出需要进一步验证以确认方法的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。