Skip to main content
QUICK REVIEW

[论文解读] A Neighbourhood Framework for Resource-Lean Content Flagging

Sheikh Muhammad Sarwar, Dimitrina Zlatkova|arXiv (Cornell University)|Mar 31, 2021
Hate Speech and Cyberbullying Detection参考文献 40被引用 5
一句话总结

该论文提出 $k$NN+,一种新颖的、资源轻量级的跨语言内容标记框架,通过基于 Transformer 的 k-近邻学习与查询-邻居交互特征,提升低资源语言中的有害语言检测效果。该方法在引入新标签时无需微调,即可在语义表示空间中学习标签一致性,相较于强基线模型,F1 值最高提升 9.5 个百分点。

ABSTRACT

We propose a novel framework for cross-lingual content flagging with limited target-language data, which significantly outperforms prior work in terms of predictive performance. The framework is based on a nearest-neighbour architecture. It is a modern instantiation of the vanilla k-nearest neighbour model, as we use Transformer representations in all its components. Our framework can adapt to new source-language instances, without the need to be retrained from scratch. Unlike prior work on neighbourhood-based approaches, we encode the neighbourhood information based on query--neighbour interactions. We propose two encoding schemes and we show their effectiveness using both qualitative and quantitative analysis. Our evaluation results on eight languages from two different datasets for abusive language detection show sizable improvements of up to 9.5 F1 points absolute (for Italian) over strong baselines. On average, we achieve 3.6 absolute F1 points of improvement for the three languages in the Jigsaw Multilingual dataset and 2.14 points for the WUL dataset.

研究动机与目标

  • 解决低资源语言中由于标注训练数据有限而导致的有害语言检测挑战。
  • 在不需对模型进行微调的前提下,实现从高资源语言到低资源语言的有效跨语言迁移,尤其在引入新标签时。
  • 比启发式混合或顺序微调方法更系统地建模源数据集与目标数据集之间的关系。
  • 开发一种支持动态标签空间适应的框架,并通过邻域影响提供可解释的预测结果。

提出的方法

  • 该框架采用 k-近邻架构,使用预计算的邻居嵌入,并通过 Transformer 实现运行时查询编码。
  • 通过交叉编码器或双编码器架构,计算查询与邻居表示之间的交互特征,以建模查询-邻居交互关系。
  • 利用自注意力机制聚合所有邻居的交互特征,形成上下文感知的邻域表示,用于分类任务。
  • 采用多任务损失函数进行模型训练,结合对比标签损失 ($\mathcal{L}_{cll}$) 与标签一致性损失 ($\mathcal{L}_{lal}$),以对齐语义相似性与标签相似性。
  • 提出两种变体:CE $k$NN+(查询-邻居输入拼接)与 BE $k$NN+(独立编码),其中 BE $k$NN+ 在保持相近性能的同时具备更优的效率。
  • 该框架利用 XLM-RoBERTa 和 LaBSE 生成句子嵌入,支持在不重新训练的前提下对新标签实现增量适应。

实验结果

研究问题

  • RQ1基于 k-近邻的框架若结合学习到的查询-邻居交互机制,是否能在低资源、跨语言的有害语言检测任务中超越强基线模型?
  • RQ2通过交互特征建模标签一致性,相较于标准微调或数据混合方法,性能提升的机制是什么?
  • RQ3该框架在不重新训练的前提下,对源数据集中新增标签的适应能力有多强?
  • RQ4双编码器变体在多语言设置下是否能在保持性能的同时提升推理效率?
  • RQ5学习到的表示空间在跨语言区分标记内容与非标记内容方面有多有效?

主要发现

  • $k$NN+ 框架在意大利语上的 F1 值相较强基线最高提升 9.5 个百分点,在 Jigsaw 多语言数据集上平均提升 3.6 F1 点,在 WUL 数据集上提升 2.14 F1 点。
  • 在多语言设置下,采用 SRC 预训练的 BE $k$NN+ 变体优于 CE $k$NN+ 变体,可能归因于训练数据量的增加。
  • 使用 BE $k$NN+ 表示空间对邻居进行重排序,可在所有 k 值下超越 LaBSE 嵌入的性能,且 F1 分数持续提升。
  • 模型对标签错误的邻居具有鲁棒性,因为在训练过程中能学会降低或忽略其影响。
  • 标签一致性损失的最优多任务损失权重 $\lambda$ 为 0.7,当该权重超过此值时性能开始下降。
  • 学习到的表示空间能有效分离标记内容与中性内容,对标记样本与中性样本之间的余弦相似度呈负值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。