[论文解读] Cicero: Multi-Turn, Contextual Argumentation for Accurate Crowdsourcing
Cicero 提出了一种同步的、多轮的、上下文感知的论证工作流,将众包工作者与持相反答案的对手配对,进行实时的、基于规则的讨论,显著提升了在复杂 NLP 任务上的个体准确率。与单轮论证相比,其准确率提升了 16.7 个百分点,并在 Codenames 等多答案任务上将准确率从 66.7% 提升至 98.8%。
Traditional approaches for ensuring high quality crowdwork have failed to achieve high-accuracy on difficult problems. Aggregating redundant answers often fails on the hardest problems when the majority is confused. Argumentation has been shown to be effective in mitigating these drawbacks. However, existing argumentation systems only support limited interactions and show workers general justifications, not context-specific arguments targeted to their reasoning. This paper presents Cicero, a new workflow that improves crowd accuracy on difficult tasks by engaging workers in multi-turn, contextual discussions through real-time, synchronous argumentation. Our experiments show that compared to previous argumentation systems which only improve the average individual worker accuracy by 6.8 percentage points on the Relation Extraction domain, our workflow achieves 16.7 percentage point improvement. Furthermore, previous argumentation approaches don't apply to tasks with many possible answers; in contrast, Cicero works well in these cases, raising accuracy from 66.7% to 98.8% on the Codenames domain.
研究动机与目标
- 解决传统众包和单轮论证在复杂、困难任务上难以实现高准确率的局限性。
- 克服现有论证系统在存在大量可能答案的任务中应用时面临的可扩展性和实用性问题。
- 通过支持多轮、上下文相关的讨论,纠正误解并优化推理过程,从而提升个体工作者的准确率。
- 开发一种系统,通过培训工作者掌握论证技能(超越特定任务知识),支持高质量、聚焦的辩论。
- 证明同步的、实时讨论工作流在复杂标注任务上可实现接近完美的准确率。
提出的方法
- 实现一种类似即时通讯的同步、实时讨论界面,支持持相反答案的工作者之间进行实时、来回的论证。
- 根据对同一问题的冲突回答配对工作者,确保在具体推理缺陷和任务规则上展开富有成效的辩论。
- 引入受控的指令和一种新型的论证理由训练任务,以提升工作者构建和评估上下文相关论证的能力。
- 允许工作者引用训练规则、识别疏漏并纠正误解,促进更深层次的推理并推动达成正确答案。
- 使用实时系统(Cicero-Sync)收集受控的、高质量的讨论记录,用于分析与评估。
- 将该工作流应用于两个领域:关系抽取(二选一)和改进版的 Codenames 任务(存在大量可能答案),以便与以往的单轮系统进行对比。
实验结果
研究问题
- RQ1与单轮论证相比,多轮、上下文感知的论证是否能显著提升个体工作者在复杂 NLP 标注任务上的准确率?
- RQ2Cicero 工作流在存在大量可能答案的任务中是否有效,使得预先收集的反例变得不切实际?
- RQ3在高质量的多轮论证会话中,会涌现出哪些话语模式?这些模式如何促进准确率的提升?
- RQ4论证训练与系统设计在多大程度上能够提升众包工作者的推理质量,并促进其向正确答案收敛?
- RQ5实时、同步的讨论工作流是否能在传统方法失效的高风险或复杂任务中实现接近完美的准确率?
主要发现
- Cicero 在关系抽取任务上实现了 16.7 个百分点的个体准确率提升,显著优于 MicroTalk 的 6.8 个百分点提升。
- 在存在大量可能答案的 Codenames 领域中,Cicero 将个体准确率从 66.7% 提升至 98.8%,证明了其在单轮论证不切实际的场景下的有效性。
- 传统多数投票和 EM 方法在类似任务上的准确率稳定在约 65%,凸显了 Cicero 论证方法的优越性。
- 对讨论记录的定性分析揭示了重复出现的话语模式,如规则引用、错误识别和误解纠正,这些是准确率提升的关键因素。
- 该系统的效果依赖于对工作者的论证能力培训,表明推理质量不仅取决于任务知识,还取决于论证能力。
- 同步讨论促进了更深层次的推理和错误纠正,多轮交流能够解决单轮系统无法处理的细微误解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。