[论文解读] Label-Agnostic Sequence Labeling by Copying Nearest Neighbors
该论文提出了一种标签无关的序列标注方法,通过基于相似度的检索框架,从检索到的最近邻中复制词元级别的标签。通过将预测与特定标签的表征解耦,该模型在无需微调的情况下实现了强大的零样本迁移性能,在细粒度标注任务上超越了强基线模型;同时,通过动态规划解码策略进一步提升了准确率与可解释性,最小化了复制段的数量。
Retrieve-and-edit based approaches to structured prediction, where structures associated with retrieved neighbors are edited to form new structures, have recently attracted increased interest. However, much recent work merely conditions on retrieved structures (e.g., in a sequence-to-sequence framework), rather than explicitly manipulating them. We show we can perform accurate sequence labeling by explicitly (and only) copying labels from retrieved neighbors. Moreover, because this copying is label-agnostic, we can achieve impressive performance when transferring to new sequence-labeling tasks without retraining. We additionally consider a dynamic programming approach to sequence labeling in the presence of retrieved neighbors, which allows for controlling the number of distinct (copied) segments used to form a prediction, and leads to both more interpretable and accurate predictions.
研究动机与目标
- 为解决标签依赖型检索-编辑模型在迁移学习与可解释性方面的局限性。
- 开发一种对标签类型无感的序列标注方法,实现无需微调即可在新任务上进行零样本迁移。
- 通过控制从检索到的邻居中复制的独立段落数量,提升预测的可解释性与准确率。
- 仅通过从最近邻复制标签实现有效的序列标注,而无需依赖序列到序列的生成机制。
提出的方法
- 模型使用学习到的相似度函数(如基于 BERT 的句子嵌入)从训练数据库中检索 M 个最近邻。
- 对于每个输入词元,模型通过复制检索到的邻居序列中相似度最高的词元的标签来预测其标签。
- 该方法本质上是标签无关的,因为预测仅依赖于输入相似度,而不依赖于标签类型或标签特定的参数。
- 引入了一种动态规划解码策略,以在保持预测置信度的同时最小化不同复制段落数量。
- 解码目标结合了段落数量(由超参数 c 加权)与预期误标成本,以鼓励生成紧凑且可解释的预测。
- 该方法适用于任何可在推理时检索邻居的模型,甚至包括标准的序列标注器。
实验结果
研究问题
- RQ1仅通过从最近邻复制标签而无需学习标签特定表征的序列标注模型,能否实现具有竞争力的性能?
- RQ2在零样本迁移至新标注任务时,标签无关的复制方法与标准的标签依赖型模型相比表现如何?
- RQ3通过减少独立复制段落数量,动态规划解码策略是否能同时提升准确率与可解释性?
- RQ4最小化段落数是否能带来更好的泛化能力或鲁棒性?
- RQ5该方法能否有效利用 BERT 等预训练表征进行基于相似度的检索?
主要发现
- 在 CoNLL 2003 NER 测试集上,采用最优动态规划解码的模型达到 90.20 的 F1 分数,相比无此策略时的 89.94 显著提升。
- 在零样本迁移设置下,使用动态规划解码(c=0.5)时,F1 分数从 71.74 提升至 73.61。
- 该模型在标准序列标注任务上保持了强大性能(如 CoNLL 2003 上为 89.94 F1),且无需微调,即使在不同任务上进行训练也表现良好。
- 平均而言,每个样本仅使用约 1.5 个独立复制段落,体现出高度的紧凑性与可解释性。
- 在迁移学习场景中,该方法显著优于强基线模型,尤其是在从粗粒度标注迁移到细粒度标注时。
- 动态规划方法实现了预测置信度与段落数量之间的可控权衡,c 值越高,性能越好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。