QUICK REVIEW
[论文解读] Man [and Woman] vs. Machine: A Case Study in Base Noun Phrase Learning
Eric Brill, Grace Ngai|ArXiv.org|May 2, 2001
Natural Language Processing Techniques参考文献 14被引用 4
一句话总结
本文比较了人类与机器在从人工标注语料库中学习基础名词短语切分规则时的表现。通过基于规则的系统与人类参与者进行实验,研究发现:虽然机器在低频模式上表现更优,但未经训练的人类在高频模式上的表现接近机器水平(召回率分别为93.5%与93.7%),表明在有效工具和表示语言的辅助下,人类具有强大的学习潜力。
ABSTRACT
A great deal of work has been done demonstrating the ability of machine learning algorithms to automatically extract linguistic knowledge from annotated corpora. Very little work has gone into quantifying the difference in ability at this task between a person and a machine. This paper is a first step in that direction.
研究动机与目标
- 量化人类与机器从标注语料库中提取语言规律的能力差异。
- 探究未经训练的人类是否能以与机器学习算法相当的速度和准确度,学习有效的基于规则的系统来完成基础名词短语切分。
- 探索人类与机器学习在自然语言处理中的互补优势,特别是在从语料库中获取规则方面。
- 评估人类规则编写者是否能够克服在捕捉低频语言模式方面的局限性,这是人工方法已知的弱点。
- 评估结合人类洞察力与机器学习的混合系统在提升语言知识提取方面的潜力。
提出的方法
- 以Ramshaw和Marcus(R&M)的基于转换的机器学习系统作为基准,使用宾夕法尼亚语料库的20万词进行训练。
- 设计了一种面向人类可读的规则语言,基于词和词性标注的正则表达式,支持括号标记、删除、转换和合并基础名词短语等操作。
- 开展了实验,10名未经训练的参与者手动编写规则,从20万词的训练语料库中识别基础名词短语。
- 使用测试集召回率评估性能,将表现最佳的3名人类规则集与机器学习系统在不同词性标注序列频率区间的性能进行对比。
- 分析训练集中词性标注序列频率对性能的影响,绘制召回率与频率的关系图,以识别性能差距。
- 使用自定义可视化工具(图4中展示截图)支持人类规则编写与语料探索。
实验结果
研究问题
- RQ1未经训练的人类能否在性能上与机器学习系统相当,从人工标注的语料库中提取基础名词短语切分规则?
- RQ2与机器相比,人类在不同词性标注序列频率区间的性能表现如何变化?
- RQ3在从语料库中获取语言规则时,人类与机器的学习行为存在哪些关键差异?
- RQ4人类是否能在低频或罕见语言模式上超越机器?如果是,原因是什么?
- RQ5人类规则编写在多大程度上可通过语料分析工具得到增强,从而缩小在罕见模式上的与机器学习的差距?
主要发现
- 对于在训练集中出现6次或以上词性标注序列的基础名词短语,表现最佳的3名人类参与者召回率为93.5%,而机器系统为93.7%,差异在统计上不显著。
- 在低频成分(出现少于6次)上,机器表现优于人类,召回率分别为62.8%与54.8%。
- 一个显著异常现象出现在恰好出现3次的序列上:由于机器将数字序列(如“1 3/8”)误切分为单一名词短语,导致其召回率显著下降,而人类则避免了此类错误。
- 人类表现出对编写针对极低频模式的规则存在抵触或能力不足,而机器可高效学习数百条此类规则。
- 尽管培训极少,人类参与者在常见模式上仍表现出高绩效,表明在合适的表示方式与工具支持下,人类规则编写可接近机器的准确性。
- 本研究挑战了机器学习在可移植性或效率上天然优于人工规则编写的假设,因为人类以约40美元的小型训练集成本,达到了接近最优的结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。