Skip to main content
QUICK REVIEW

[论文解读] Cross-lingual Dataless Classification for Languages with Small Wikipedia Presence

Yangqiu Song, Stephen Mayhew|arXiv (Cornell University)|Nov 13, 2016
Topic Modeling参考文献 31被引用 5
一句话总结

本文提出了一种针对低资源语言(小维基百科存在感)的跨语言无数据文档分类方法,通过词级翻译将目标语言桥接至大维基百科语言(LWLs),实现在无任何标注训练数据的情况下,将文档分类至英语主题标签。该方法利用语言相似性度量自动选择最优LWL作为桥梁,性能接近最佳可能的桥梁语言。

ABSTRACT

This paper presents an approach to classify documents in any language into an English topical label space, without any text categorization training data. The approach, Cross-Lingual Dataless Document Classification (CLDDC) relies on mapping the English labels or short category description into a Wikipedia-based semantic representation, and on the use of the target language Wikipedia. Consequently, performance could suffer when Wikipedia in the target language is small. In this paper, we focus on languages with small Wikipedias, (Small-Wikipedia languages, SWLs). We use a word-level dictionary to convert documents in a SWL to a large-Wikipedia language (LWLs), and then perform CLDDC based on the LWL's Wikipedia. This approach can be applied to thousands of languages, which can be contrasted with machine translation, which is a supervision heavy approach and can be done for about 100 languages. We also develop a ranking algorithm that makes use of language similarity metrics to automatically select a good LWL, and show that this significantly improves classification of SWLs' documents, performing comparably to the best bridge possible.

研究动机与目标

  • 解决在维基百科存在极少或无维基百科内容的语言中进行文档分类的挑战,这限制了现有跨语言无数据分类(CLDDC)方法的应用。
  • 克服传统CLDDC方法的可扩展性瓶颈,后者在目标语言维基百科过小、无法支持可靠语义映射时会失效。
  • 仅使用标签名称或描述,实现对小维基百科语言(SWLs)中文档的英语主题本体分类。
  • 开发一种系统化方法,以选择最有效的大型维基百科语言(LWL)作为翻译与分类的桥梁。
  • 证明通过双语词典实现的词级翻译可优于全文档翻译,并可扩展至数千种语言。

提出的方法

  • 使用词级双语词典(如Panlex)将小维基百科语言(SWL)的文档映射至大型维基百科语言(LWL)。
  • 在翻译后的LWL文档上执行跨语言无数据分类(CLDDC),利用基于维基百科的语义表示。
  • 通过跨语言显式语义分析(CLESA)将英语标签与翻译后的文档嵌入到共享语义空间中,方法是基于维基百科概念。
  • 利用语言相似性度量(如类型学、词汇和句法特征)对候选LWL进行排序,并为每个SWL选择最优桥梁语言。
  • 在现有的SWL-LWL配对上训练排序模型,以将桥梁选择推广至新的语言对。
  • 利用维基百科语言链接与倒排索引数据,基于多语言页面间概念的共现关系计算语义表示。

实验结果

研究问题

  • RQ1词级翻译是否可有效用于在维基百科存在极少的语言中实现跨语言无数据分类?
  • RQ2如何自动选择最佳大型维基百科语言(LWL)作为桥梁语言,以最大化给定小维基百科语言(SWL)的分类性能?
  • RQ3基于语言相似性的排序模型在桥梁语言选择中是否显著提升分类准确率,相较于随机或启发式选择?
  • RQ4在仅使用词级翻译且无标注数据的前提下,CLDDC在SWL上的性能在多大程度上可接近最佳可能的LWL桥梁?
  • RQ5在拥有如Panlex这样的多语言词典的前提下,该方法是否可扩展至数千种语言?

主要发现

  • 所提出的桥梁式CLDDC方法显著提升了小维基百科语言(SWLs)的分类性能,其结果与最佳可能桥梁语言相当。
  • 基于语言相似性的候选LWL排序优于随机选择与启发式方法,且排序模型在未见语言对上具有良好泛化能力。
  • 该方法实现了对超过39种SWL和49种LWL的无数据分类,证明了仅使用词级词典与维基百科即可实现对数千种语言的可扩展性。
  • 在LWL上CLDDC的性能与使用每类100–200个标注文档的监督方法相当,验证了语义空间构建的有效性。
  • 该方法优于全文档翻译与无桥梁选择的词级翻译,证实了智能LWL选择的重要性。
  • 使用Panlex的多语言词典(支持超过11,000种语言变体)使该方法可扩展至机器翻译系统通常支持的100种语言之外。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。