[论文解读] Real-time On-Demand Crowd-powered Entity Extraction
本文提出了一种实时、基于众包的实体抽取系统,利用多人参与的对话ESP游戏从用户语句中抽取实体,无需标注训练数据。通过利用众包工作者之间的共识,该方法在复杂查询上的F1得分比CRF基线分别高出36.5%和27.1%,响应时间约为8秒,证明了其在实时对话系统(如Google Hangouts)中的可行性。
Output-agreement mechanisms such as ESP Game have been widely used in human computation to obtain reliable human-generated labels. In this paper, we argue that a "time-limited" output-agreement mechanism can be used to create a fast and robust crowd-powered component in interactive systems, particularly dialogue systems, to extract key information from user utterances on the fly. Our experiments on Amazon Mechanical Turk using the Airline Travel Information System (ATIS) dataset showed that the proposed approach achieves high-quality results with an average response time shorter than 9 seconds.
研究动机与目标
- 为解决对话系统中因数据稀缺、语言多样性及未登录词导致的自动化实体抽取方法脆弱性问题。
- 开发一种无需标注训练数据的实时、按需实体抽取方法。
- 评估在实时即时通讯环境中众包实体抽取的可行性和性能。
- 探索实时众包中响应时间与抽取准确率之间的权衡。
- 证明即使面对未见过或复杂的查询,众包工作者之间的共识也能可靠地抽取实体。
提出的方法
- 系统采用多人参与的对话ESP游戏界面,工作人员在限定时间内查看对话语句,并被要求识别其中特定的实体。
- 工作人员的答案被聚合,通过多个工作人员之间的匹配结果确定最终抽取的实体,利用共识机制确保质量。
- 界面中设有计时器以强制执行速度要求,系统设计旨在最小化延迟,适用于实时部署。
- 该方法在ATIS数据集上以及通过10名用户的实时Google Hangouts文本聊天进行测试,以评估真实世界性能。
- 识别出MTurk上的任务路由延迟是影响端到端响应时间的关键瓶颈。
- 系统设计支持未来集成自动化组件,以提升可扩展性并减少对人工劳动的依赖。
实验结果
研究问题
- RQ1通过对话ESP游戏实现的实时众包是否能在无需标注训练数据的情况下实现准确的实体抽取?
- RQ2该众包系统的响应时间与自动化基线相比如何?是否适用于实时对话应用?
- RQ3基于共识的方法在应对未登录词和语言多样性输入方面能提升多大程度的鲁棒性?
- RQ4任务路由延迟对端到端系统性能有何影响?如何缓解?
- RQ5众包答案能否有效用于构建自动化实体抽取模型的初始训练?
主要发现
- 在ATIS数据集的Class D查询上,众包方法的F1得分比CRF基线高出36.5%。
- 在Class X查询上,该方法的F1得分相比CRF基线提高了27.1%。
- 平均端到端响应时间约为8秒,首次匹配答案在任务启动后40.95秒内返回。
- 估算即时通讯中用户的理论感知响应时间为10–14秒,快于现实世界消息通信的平均24秒响应时间。
- 识别出MTurk上的任务路由延迟为主要瓶颈,持续时间在5至40秒之间,部分情况下导致任务超时。
- 系统在通过10名用户的Google Hangouts文本聊天进行的真实部署中表现出可行性,证实了其鲁棒性和低延迟性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。