[论文解读] Korean Online Hate Speech Dataset for Multilabel Classification: How Can Social Science Improve Dataset on Hate Speech?
本文提出了一种多标签韩语在线仇恨言论数据集,涵盖七个类别——种族/国籍、宗教、地域主义、年龄歧视、厌女、性少数群体和男性,采用文化与语言背景相融合的方法。该数据集包含35,000个样本,涵盖人工标注与规则生成的数据,经数据增强后,模型的LRAP得分达到0.919,表明社会科学研究洞见可超越以西方为中心的二元框架,显著提升仇恨言论数据集的质量。
We suggest a multilabel Korean online hate speech dataset that covers seven categories of hate speech: (1) Race and Nationality, (2) Religion, (3) Regionalism, (4) Ageism, (5) Misogyny, (6) Sexual Minorities, and (7) Male. Our 35K dataset consists of 24K online comments with Krippendorff's Alpha label accordance of .713, 2.2K neutral sentences from Wikipedia, 1.7K additionally labeled sentences generated by the Human-in-the-Loop procedure and rule-generated 7.1K neutral sentences. The base model with 24K initial dataset achieved the accuracy of LRAP .892, but improved to .919 after being combined with 11K additional data. Unlike the conventional binary hate and non-hate dichotomy approach, we designed a dataset considering both the cultural and linguistic context to overcome the limitations of western culture-based English texts. Thus, this paper is not only limited to presenting a local hate speech dataset but extends as a manual for building a more generalized hate speech dataset with diverse cultural backgrounds based on social science perspectives.
研究动机与目标
- 为解决现有仇恨言论数据集在文化与语言上的局限性,这些数据集大多基于西方、英语语境。
- 开发一个用于韩语在线话语的多标签仇恨言论数据集,以捕捉超越二元分类的仇恨言论复杂性。
- 将社会科学视角融入数据集构建过程,以提升自然语言处理模型的代表性并减少文化偏见。
- 证明在低资源、文化特定的环境下,采用人机协同标注与规则生成方法可有效提升数据质量与模型性能。
提出的方法
- 该数据集包含24,000个经人工标注的在线评论,采用多标签框架在七个仇恨言论类别中进行标注。
- 使用Krippendorff’s Alpha值0.713评估标注者间的一致性,确保标签的可靠性。
- 通过人机协同流程与规则化方法额外生成11,000个样本,以提升数据平衡性与模型泛化能力。
- 在初始24,000个样本数据集上微调基于BERT的基础模型,并在整合11,000个新增样本后重新训练,以评估性能提升。
- 数据集设计融入了韩国特有的社会语言学与文化背景,如地域方言与等级制社会规范,以更准确反映本地仇恨言论的表现形式。
- 采用标签排名平均精度(LRAP)指标评估性能,以衡量多标签分类的有效性。
实验结果
研究问题
- RQ1社会科学研究洞见在非英语、非西方语境下如何改善仇恨言论数据集的设计与标注?
- RQ2在韩语在线话语中,多标签类别在多大程度上提升了仇恨言论检测模型的代表性与性能?
- RQ3结合人机协同标注与规则生成方法,能否有效扩展低资源仇恨言论数据集,同时保持数据质量?
- RQ4标注过程中体现的文化与语言特异性如何影响仇恨言论检测模型的泛化能力与公平性?
- RQ5在多标签设置下,通过上下文相关的新增样本增强核心数据集,可实现多大的性能提升?
主要发现
- 基础模型在初始24,000个样本数据集上的LRAP得分为0.892,表明其具备出色的多标签分类性能。
- 在整合11,000个新增样本(2,200个由人工标注,7,100个由规则生成)后,模型的LRAP提升至0.919,证明了数据增强的价值。
- 该数据集的Krippendorff’s Alpha值为0.713,表明在七个仇恨言论类别中,标注者间达成实质性一致。
- 多标签框架成功捕捉了重叠的仇恨言论类别,例如厌女与地域主义,这些在韩语在线话语中十分常见。
- 在数据集设计中融入社会科学视角,使仇恨言论的呈现更加细致且符合语境,相较于二元分类方法更具准确性。
- 本研究证明,基于文化背景的标注流程可在低资源、非英语语境下生成更可靠且更具泛化能力的仇恨言论数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。