[论文解读] From Submit to Submitted via Submission: On Lexical Rules in Large-Scale Lexicon Acquisition
本文提出了一套框架,用于在使用西班牙语和英语商业/金融语料库进行大规模、半自动词典获取时,发现、表示并应用词汇规则(LRs)。尽管需要手动验证,大规模词汇规则显著减轻了手动构建词典的工作负担,通过自动化形态和句法泛化(例如,通过 'submission' 从 'submit' 衍生出 'submitted'),同时突显了即使在使用规则阻断和优先机制的情况下,后续处理检查的必要性。
This paper deals with the discovery, representation, and use of lexical rules (LRs) during large-scale semi-automatic computational lexicon acquisition. The analysis is based on a set of LRs implemented and tested on the basis of Spanish and English business- and finance-related corpora. We show that, though the use of LRs is justified, they do not come cost-free. Semi-automatic output checking is required, even with blocking and preemtion procedures built in. Nevertheless, large-scope LRs are justified because they facilitate the unavoidable process of large-scale semi-automatic lexical acquisition. We also argue that the place of LRs in the computational process is a complex issue.
研究动机与目标
- 开发一种系统化方法,用于在大规模计算词典获取中发现和表示词汇规则。
- 评估大规模词汇规则在减少词典构建期间人工工作量方面的有效性和成本。
- 研究规则阻断和优先机制在最小化规则应用中误报数量方面的作用。
- 评估在基于规则的词典获取流程中,半自动验证的必要性。
提出的方法
- 从英语和西班牙语的商业及金融相关标注语料库中自动推导出词汇规则。
- 规则旨在捕捉形态和句法模式,例如动词到过去分词的派生(例如,submit → submitted 通过 submission)。
- 规则系统采用阻断和优先机制来解决冲突并优先处理更具体的规则。
- 系统将规则应用于原始语料库以生成候选词汇条目,随后通过半自动验证过滤错误。
- 该方法将基于规则的泛化与人工干预相结合,以在自动化与准确性之间取得平衡。
- 评估基于规则覆盖率、精确率以及人工词典条目工作量的减少。
实验结果
研究问题
- RQ1大规模词汇规则在自动化获取专业领域派生词形方面的有效性如何?
- RQ2阻断和优先机制在多大程度上减少了规则应用中的误报?
- RQ3在基于规则的词典获取中,自动化收益与半自动验证需求之间的权衡是什么?
- RQ4词汇规则能否显著减少在领域特定语料库中大规模词典构建所需的人工工作量?
- RQ5词汇规则在词典获取整体计算流程中扮演何种角色?
主要发现
- 大规模词汇规则通过自动化派生词形的生成,显著减少了词典获取所需的人工工作量。
- 尽管采用了规则阻断和优先机制,半自动验证仍是纠正规则应用引入错误的必要手段。
- 该系统成功地通过中间形式 'submission' 从 'submit' 派生出 'submitted',证明了基于规则的形态派生在形态系统中的可行性。
- 该方法在商业和金融文本中实现了对屈折和派生形式的高覆盖率,尤其适用于规则和半规则范式。
- 将词汇规则与人工监督相结合,证明在该领域比完全手动或纯统计方法更具可扩展性和准确性。
- 本研究证实,当结合验证机制时,词汇规则是大规模、半自动词典获取中合理且高效的组成部分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。