Skip to main content
QUICK REVIEW

[论文解读] Multilingual person name recognition and transliteration

Bruno Pouliquen, Ralf Steinberger|ArXiv.org|Sep 11, 2006
Authorship Attribution and Profiling参考文献 5被引用 5
一句话总结

本文提出了一种多语言姓名识别与音译系统,可从多语言新闻中提取人名,匹配不同文字系统(拉丁字母、西里尔字母、希腊字母、阿拉伯字母)之间的跨语言姓名变体,并通过共现关系推断人物关联。该系统采用内部标准姓名表示法,而非传统的双语音译方法,从而在 NewsExplorer 新闻分析系统中实现可扩展的姓名匹配,该系统每日可对 25,000 篇文章进行多语言聚类。

ABSTRACT

We present an exploratory tool that extracts person names from multilingual news collections, matches name variants referring to the same person, and infers relationships between people based on the co-occurrence of their names in related news. A novel feature is the matching of name variants across languages and writing systems, including names written with the Greek, Cyrillic and Arabic writing system. Due to our highly multilingual setting, we use an internal standard representation for name representation and matching, instead of adopting the traditional bilingual approach to transliteration. This work is part of the news analysis system NewsExplorer that clusters an average of 25,000 news articles per day to detect related news within the same and across different languages.

研究动机与目标

  • 实现从涵盖多种书写系统的多语言新闻集合中准确提取人名。
  • 在不同语言和文字系统(包括拉丁字母、西里尔字母、希腊字母和阿拉伯字母)之间匹配指代同一人物的姓名变体。
  • 基于多语言新闻文章中的共现模式,推断人物之间的关联。
  • 通过使用统一的内部姓名表示法,克服传统双语音译方法的局限性。
  • 支持 NewsExplorer 系统中可扩展的多语言新闻聚类,每日处理约 25,000 篇文章。

提出的方法

  • 该系统使用多语言姓名识别模块,从多种语言的新闻文章中提取人名。
  • 采用标准化的内部姓名表示法,统一不同书写系统中的姓名,避免依赖双语音译对。
  • 通过比较内部表示中姓名的归一化形式,执行跨语言姓名匹配,实现不同文字系统间的匹配。
  • 关系推断基于同一新闻文章或聚类中姓名的共现频率。
  • 该系统已集成至 NewsExplorer,一个实时处理大规模多语言新闻流的新闻聚类流水线。
  • 该方法在 JRC 的 NewsExplorer 应用背景下进行评估,该应用可公开访问。

实验结果

研究问题

  • RQ1如何利用单一统一的表示方法,从多语言新闻源中可靠地提取人名?
  • RQ2在不依赖双语音译对的情况下,多大程度上可以匹配不同书写系统(如西里尔字母与拉丁字母)中的姓名变体?
  • RQ3基于共现关系的推断在链接多语言新闻文章中的人物方面有多有效?
  • RQ4单一内部姓名表示是否能够支持在真实世界新闻分析系统中实现可扩展的多语言姓名匹配?
  • RQ5该系统在每日处理 25,000 篇多语言新闻文章的同时,保持跨语言姓名一致性,其性能如何?

主要发现

  • 该系统成功地在多种语言和书写系统(包括希腊字母、西里尔字母和阿拉伯字母)中提取并归一化了人名。
  • 使用内部标准姓名表示法显著提高了跨语言姓名匹配的准确性,优于传统的双语音译方法。
  • 该系统在 NewsExplorer 流水线中实现了每日约 25,000 篇多语言新闻文章的可扩展处理。
  • 新闻文章中姓名的共现模式能够有效推断跨语言人物之间的关联。
  • 该方法在无需大量双语训练数据的情况下,表现出对多语言姓名变体的强大处理能力。
  • 该方法已集成至可公开访问的 NewsExplorer 应用中,验证了其在真实世界新闻分析中的实际部署效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。