[论文解读] A New Generation of Perspective API: Efficient Multilingual Character-level Transformers
本文提出统一毒性内容分类(UTC),一种多语言、基于字符的Transformer模型,采用可学习分词器与Charformer架构,实现高效、可投入生产的跨语言及滥用语言模式的毒性内容检测。UTC在多语言基准测试中优于强基线模型(如多语言BERT和mT5),参数效率高出10倍,且对代码切换、伪装处理和表情符号毒性具有更强鲁棒性。
On the world wide web, toxic content detectors are a crucial line of defense against potentially hateful and offensive messages. As such, building highly effective classifiers that enable a safer internet is an important research area. Moreover, the web is a highly multilingual, cross-cultural community that develops its own lingo over time. As such, it is crucial to develop models that are effective across a diverse range of languages, usages, and styles. In this paper, we present the fundamentals behind the next version of the Perspective API from Google Jigsaw. At the heart of the approach is a single multilingual token-free Charformer model that is applicable across a range of languages, domains, and tasks. We demonstrate that by forgoing static vocabularies, we gain flexibility across a variety of settings. We additionally outline the techniques employed to make such a byte-level model efficient and feasible for productionization. Through extensive experiments on multilingual toxic comment classification benchmarks derived from real API traffic and evaluation on an array of code-switching, covert toxicity, emoji-based hate, human-readable obfuscation, distribution shift, and bias evaluation settings, we show that our proposed approach outperforms strong baselines. Finally, we present our findings from deploying this system in production.
研究动机与目标
- 开发一种统一的多语言毒性内容分类器,可在多种语言、领域和滥用语言模式下有效运行。
- 克服单语言及基于子词的模型在处理代码切换、伪装处理和跨语言泛化方面的局限性。
- 通过消除静态词汇表并优化硬件加速,实现在生产环境中高效、低延迟的基于字符的模型推理。
- 通过用单一、语言无关的架构替代多个单语言模型,降低模型维护开销。
- 在保持多语言公平性的同时,提升对隐蔽毒性、拼写错误和表情符号仇恨的鲁棒性。
提出的方法
- 模型采用集成到Charformer架构中的可学习分词器,消除对静态词汇表的依赖,实现端到端可微分的分词。
- 在来自多样化论坛和平台的多语言用户生成内容上,采用序列到序列的去噪预训练目标。
- 架构利用可重构的序列到序列Transformer,采用共享编码器-解码器结构,以优化推理效率。
- 在微调阶段,移除解码器以将序列长度和深度减半,降低计算成本和延迟。
- 模型在字节级别进行训练和推理,无需重新分词即可对拼写错误、表情符号和伪装内容保持鲁棒性。
- 通过Charformer的全局注意力机制提升效率,该机制通过可学习的全局池化减少序列长度,从而在TPU硬件上实现更快的推理速度。
实验结果
研究问题
- RQ1单一的、多语言的、基于字符的Transformer模型是否能在多种语言和滥用语言模式下,优于专用的基于子词的模型进行毒性内容检测?
- RQ2与静态子词分词相比,无词汇表的可学习分词器在应对代码切换、伪装处理和表情符号毒性方面是否显著提升鲁棒性?
- RQ3基于字节的模型在多大程度上可实现高效且可扩展,以满足实时生产环境中低延迟API部署的需求?
- RQ4与单语言或多语言BERT风格模型相比,统一模型是否能减少偏差并提升多语言间的公平性?
- RQ5在无微调条件下,模型是否能在分布偏移和低资源语言设置下仍保持有效的泛化能力?
主要发现
- UTC在CovertToxicity基准测试中取得0.607的AUC-ROC,优于最佳基线模型(mT5 base)0.008 AUC。
- 在HatemojiCheck基准测试中,UTC准确率达到90.8%,F1值达93.3%,较先前最先进模型在准确率上提升3.0个百分点。
- 102M参数的UTC模型在64块TPUv3芯片上微调时达到每秒32.9步,尽管参数量仅为其他大模型的十分之一,但推理速度仍更优。
- 在生产环境中,UTC对10种新语言实现200ms中位延迟和15 QPS吞吐量;在单个TPUv2上批量处理时,中位延迟降至45ms,吞吐量达1K QPS。
- UTC在代码切换、表情符号仇恨和伪装文本方面表现出强大鲁棒性,在这些具有挑战性的场景中,性能持续优于基线模型。
- UTC成功部署于10种新语言(阿拉伯语、中文、捷克语、荷兰语、印度尼西亚语、日语、韩语、波兰语、印地语、印地英语混合语),首次使这些语言达到Perspective API的生产标准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。