[论文解读] Detecting and Classifying Malevolent Dialogue Responses: Taxonomy, Data and Methodology
本文提出了恶意对话回复检测与分类(MDRDC)任务,提出了一种分层分类法(HMDT)以及一个用于分类恶意回复的多人多轮对话数据集。采用基于BERT的模型,实现了最先进性能,对话双方的上下文信息显著提升了分类准确率。
Conversational interfaces are increasingly popular as a way of connecting people to information. Corpus-based conversational interfaces are able to generate more diverse and natural responses than template-based or retrieval-based agents. With their increased generative capacity of corpusbased conversational agents comes the need to classify and filter out malevolent responses that are inappropriate in terms of content and dialogue acts. Previous studies on the topic of recognizing and classifying inappropriate content are mostly focused on a certain category of malevolence or on single sentences instead of an entire dialogue. In this paper, we define the task of Malevolent Dialogue Response Detection and Classification (MDRDC). We make three contributions to advance research on this task. First, we present a Hierarchical Malevolent Dialogue Taxonomy (HMDT). Second, we create a labelled multi-turn dialogue dataset and formulate the MDRDC task as a hierarchical classification task over this taxonomy. Third, we apply stateof-the-art text classification methods to the MDRDC task and report on extensive experiments aimed at assessing the performance of these approaches.
研究动机与目标
- 为解决多轮对话中恶意回复检测与分类缺乏系统性框架的问题。
- 开发一个全面的分层分类法(HMDT),以涵盖仇恨言论或冒犯性语言之外的多种恶意形式。
- 构建一个大规模的多人多轮对话数据集,采用HMDT进行细粒度标注,用于训练和评估恶意行为检测模型。
- 评估最先进NLP方法在MDRDC任务上的表现,并识别影响性能的关键因素,如上下文信息与分层标签结构。
提出的方法
- 提出一种包含三个层级的分层恶意对话分类法(HMDT):广义类别(如“侮辱”)、子类别(如“种族侮辱”)和具体类型(如“种族蔑称”)。
- 通过众包方式构建一个包含1,000段对话的多人多轮对话数据集,每条话语均使用HMDT层级进行标注,以支持分层分类。
- 应用基于BERT的模型(如BERT-base)进行微调,实现多标签、分层文本分类,整合来自双方对话者的上下文信息。
- 通过在分类法不同层级上计算精确率、召回率与F1分数,评估模型性能,并开展关于上下文使用与标签层级结构的消融实验。
- 利用双方对话者(如说话人A与说话人B)的上下文信息提升分类效果,消融实验表明,对方的上下文更具信息量。
- 通过比较第二层级与第三层级的分类性能,分析分层标签结构的影响,结果表明更细粒度的标签可提升F1分数。
实验结果
研究问题
- RQ1如何在现有仇恨言论或冒犯性语言定义之外,系统性地对恶意对话回复进行分类?
- RQ2对话上下文(尤其是对方说话者的信息)对恶意回复检测有何影响?
- RQ3分层标签结构如何影响恶意行为分类模型的性能?
- RQ4当在多轮对话数据上进行微调时,最先进的模型(如BERT)在MDRDC任务上的表现如何?
- RQ5通过重述话语或建模上下文,是否能超越单轮输入的分类性能?
主要发现
- 当使用对方说话者的上下文时,BERT-base模型在MDRDC任务上达到最高性能,F1得分为81.78%。
- 使用双方对话者的上下文信息优于仅使用单方信息,且对方说话者的上下文更具影响力。
- 第三级分类(细粒度类别)在“嫉妒”类别中取得更高的F1分数(80.00),高于第二级分类(72.73),且具有统计显著性(p < 0.05)。
- 来自对方用户的上下文信息优于来自同一用户的信息,表明对话对方的行为是恶意行为检测的更强信号。
- HMDT分类法的分层结构通过允许模型利用广义类别与细粒度类别之间的依赖关系,提升了分类性能。
- 重述话语与上下文建模显示出进一步提升性能的潜力,表明在上下文感知回复过滤方面仍有较大优化空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。