Skip to main content
QUICK REVIEW

[论文解读] Representing human and machine dictionaries in Markup languages

Lothar Lemnitzer, Laurent Romary|ArXiv.org|Dec 15, 2009
Natural Language Processing Techniques参考文献 12被引用 4
一句话总结

本文提出了一种基于XML的标准化表示方法,用于人类可读和机器可读词典,采用文本编码倡议(TEI)指南。它展示了结构化标记如何实现互操作性、可扩展性以及语言元数据的持久保存,其关键贡献在于以计算可访问的格式建模词汇条目、语法特征和语义关系。

ABSTRACT

In this chapter we present the main issues in representing machine readable dictionaries in XML, and in particular according to the Text Encoding Dictionary (TEI) guidelines.

研究动机与目标

  • 解决人类词典和机器词典中词汇数据缺乏一致且机器可处理格式的问题。
  • 使用XML定义词汇条目、语法特征和语义关系的统一表示模型。
  • 针对计算词典学中的词典特定需求,对文本编码倡议(TEI)指南进行适应和扩展。
  • 确保词典数据在语言学研究和自然语言处理应用中的可扩展性和可重用性。

提出的方法

  • 以TEI指南为基础,使用XML对词典内容进行编码。
  • 定义用于表示词汇条目、词头、词性标签、屈折变化和语法特征的模块化模式。
  • 通过语义标记和引用链接来编码语义关系,如同义词、反义词和派生关系。
  • 整合有关来源、出处和编辑状态的元数据,以支持数据溯源和可信度。
  • 使用XML命名空间和DTD/模式定义,确保跨系统验证和互操作性。
  • 将该模型应用于真实词典实例,以展示实际的编码和转换工作流。

实验结果

研究问题

  • RQ1如何使用标记语言在机器可处理的格式中一致地表示人类词典和机器词典?
  • RQ2为了充分建模超出通用文本编码范围的词汇数据,需要对TEI指南进行哪些扩展?
  • RQ3如何在XML中语义化地组织和保留词典中的语法和语义信息?
  • RQ4在标准化词典编码格式中,互操作性和可扩展性的关键需求是什么?
  • RQ5如何系统性地在XML结构中捕获元数据和出处信息,以实现可靠的词汇数据交换?

主要发现

  • 所提出的基于XML的模型成功地在TEI框架内表示了复杂的词汇结构,包括屈折范式和语义关系。
  • 使用TEI作为基础确保了长期可维护性,并与既定的文本编码标准保持一致。
  • 该模型通过单一、可扩展的模式,同时支持人类可读和机器可处理的词典格式。
  • 该方法可利用标准XML工具和XPath/XQuery实现词汇数据的一致转换和查询。
  • 该编码模型通过提供结构化输入,促进了与自然语言处理流水线(如词性标注和语义解析)的集成。
  • 案例研究证明,该模型适用于多种词典类型,包括单语词典、双语词典和专业词汇资源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。