[论文解读] Capturing Ambiguity in Crowdsourcing Frame Disambiguation
本文提出一种基于多标注者每句的众包框架,将标注者间分歧作为语义模糊性的信号,用于FrameNet框架消歧。实验表明,聚合的众包标注结果与专家标注相比F1值超过0.67,且未解决的分歧反映了句子、框架或任务定义中的真实模糊性,挑战了机器学习训练中假设存在单一正确标签的传统观念。
FrameNet is a computational linguistics resource composed of semantic frames, high-level concepts that represent the meanings of words. In this paper, we present an approach to gather frame disambiguation annotations in sentences using a crowdsourcing approach with multiple workers per sentence to capture inter-annotator disagreement. We perform an experiment over a set of 433 sentences annotated with frames from the FrameNet corpus, and show that the aggregated crowd annotations achieve an F1 score greater than 0.67 as compared to expert linguists. We highlight cases where the crowd annotation was correct even though the expert is in disagreement, arguing for the need to have multiple annotators per sentence. Most importantly, we examine cases in which crowd workers could not agree, and demonstrate that these cases exhibit ambiguity, either in the sentence, frame, or the task itself, and argue that collapsing such cases to a single, discrete truth value (i.e. correct or incorrect) is inappropriate, creating arbitrary targets for machine learning.
研究动机与目标
- 为解决FrameNet单专家标注的局限性,该方法无法捕捉语言多样性与模糊性。
- 探究众包框架消歧中标注者间分歧是否反映真实模糊性,而非标注错误。
- 开发基于分歧的三项新度量:框架-句子一致性(FSS)、句子质量评分(SQS)和框架质量评分(FQS)。
- 挑战将模糊案例强制合并为单一离散标签的做法,因为这会为机器学习创造人为目标。
- 通过保留众包工作者提供的多种解释,构建更稳健、具备模糊性感知能力的数据集。
提出的方法
- 采用CrowdTruth框架收集每句话的多重标注,每句话由15名工作者参与,以确保解释的多样性。
- 定义并计算三项新度量:框架-句子一致性(FSS)、句子质量评分(SQS)和框架质量评分(FQS),用于评估一致性与模糊性。
- 每位工作者采用二值标注(框架适用或不适用),将分歧用作模糊性的代理指标,而非噪声。
- 采用基于共识的聚合方法整合众包标注,生成每句话的单一标签,并与专家标注的黄金标准进行比较。
- 对高分歧案例进行定性分析,以区分任务理解错误、上下文缺失与固有的语义模糊性。
- 复现并扩展了先前关于众包框架消歧的研究,通过显式建模分歧作为信息性信号,改进了早期方法。
实验结果
研究问题
- RQ1使用多标注者的众包能否可靠地捕捉与专家水平相当的框架消歧标注?
- RQ2标注者间分歧在多大程度上反映句子或框架的真实模糊性,而非标注错误?
- RQ3框架定义与句子上下文在多大程度上导致框架消歧任务中的模糊性?
- RQ4将模糊案例强制合并为单一离散标签是否对机器学习造成问题?如果是,原因是什么?
- RQ5分歧度量(FSS、SQS、FQS)能否作为框架语义中句子与框架质量的可靠指标?
主要发现
- 与专家语言学家相比,聚合的众包标注结果F1值超过0.67,表现出与最先进方法相当的强性能。
- 存在众包共识正确而专家意见相左的情况,表明在模糊语境下集体标注可超越个体专家判断。
- 标注者间分歧与句子、框架定义或任务结构中的模糊性密切相关,而非单纯由工作者理解错误导致。
- 框架质量评分(FQS)较低的框架(如抽象或重叠的框架,例如“assistance”、“purpose”、“undergo_change”)表现出更高分歧,表明其模糊性更高。
- 研究发现,“killing”和“food”等框架具有更高的FQS,模糊性更低,表明框架具体性与模糊性降低之间存在相关性。
- 结果表明,强制为模糊案例指定单一真值会为机器学习创造人为目标,损害模型的鲁棒性与公平性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。