[论文解读] Tagger Evaluation Given Hierarchical Tag Sets
本文提出了一种概率评估框架,用于标注系统,通过为子标签分配均匀概率并计算正确标签概率之和,来处理多标签、多正确答案以及树状结构的is-a标签层级。其主要贡献是一种广义评分方法,与Cohen's kappa等标准度量兼容,从而实现对层次化标准答案下人工与自动标注器的公平且细致的评估。
We present methods for evaluating human and automatic taggers that extend current practice in three ways. First, we show how to evaluate taggers that assign multiple tags to each test instance, even if they do not assign probabilities. Second, we show how to accommodate a common property of manually constructed ``gold standards'' that are typically used for objective evaluation, namely that there is often more than one correct answer. Third, we show how to measure performance when the set of possible tags is tree-structured in an IS-A hierarchy. To illustrate how our methods can be used to measure inter-annotator agreement, we show how to compute the kappa coefficient over hierarchical tag sets.
研究动机与目标
- 解决标准评估度量中将所有错误标签视为同等错误的局限性,即使它们在语义上相关。
- 通过将此类输出解释为均匀概率分布,实现对输出多标签或非概率标注器的公平评估。
- 通过将正确标签视为析取关系并求和概率,解决黄金标准中存在多个正确标签时的模糊性。
- 通过将is-a关系建模为具有均匀向下分支的概率层级,将评估扩展至树状结构标签集(如WordNet、hector)。
- 通过调整标签特异性和概率分布,使用kappa系数在层次化标签集上支持标注者间一致性测量。
提出的方法
- 非概率标注器被解释为对其输出集合中的所有标签分配均匀概率,单标签输出的概率为1.0。
- 通过在所有正确标签上求和算法分配的概率,处理多个正确标签,从而实现部分得分。
- 树状结构标签集的评估通过递归地将每个非叶标签的概率质量均等地分配给其直接子节点来实现,遵循最大熵原则。
- 评分函数计算分配给任意正确标签的总概率,使用公式:Score(A) = Σ Pr(正确标签 | 上下文) 对所有正确标签求和。
- 对于标注者间一致性测量,每个标注者的标签通过均匀向下的概率扩展为叶级概率。
- kappa系数通过叶级概率的一致性联合概率计算,机会一致性Pr(E)计算为叶级概率的平方和。
实验结果
研究问题
- RQ1当精确匹配无法捕捉部分正确性时,如何公平评估输出多个非概率标签的标注系统?
- RQ2当黄金标准包含单个实例的多个有效标签时,评估应如何调整?
- RQ3当标签集为树状结构的is-a层级时,特别是当父标签与子标签共现时,性能应如何衡量?
- RQ4在不夸大一般标签重要性的情况下,标准的标注者间一致性统计量(如Cohen's kappa)能否有意义地应用于层次化标签集?
- RQ5将概率评估推广至层次化标签集时,需要哪些假设?这些假设如何影响评估的公平性与可解释性?
主要发现
- 对于输出正确叶标签的标注器,该方法分配得分为1.0;对于输出其父标签的标注器,得分为0.5,这是由于子标签上概率分布均匀。
- 对于一个正确标注为A.1a的词,若标注器输出A.1和A.2,其得分为0.25,反映了分配给正确子义项的概率质量。
- 当两位标注者均使用同一非叶标签(如A)时,一致概率Pr(A)通过叶级概率乘积的和计算,A.1a和A.2a的值均为0.25。
- 对于包含多个正确标签的黄金标准(如A.1a和B.2),得分为分配给每个正确标签的概率之和,例如当算法输出A.1和B.2时,得分为0.5 + 1/3 = 0.833。
- 在叶级概率上计算的kappa系数正确考虑了机会一致性,避免了在使用非叶标签时高估一致性。
- 该方法确保非叶标签的重要性不会被夸大,因为其贡献按比例分配给叶节点,从而在评估中保持公平性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。