[论文解读] ViHOS: Hate Speech Spans Detection for Vietnamese
本文介紹了ViHOS,一個用於檢測越南語社交媒體評論中仇恨言論片段的數據集與註釋框架。它通過訓練註釋員以情境感知、語義層次的標註方式識別具有攻擊性的片段,來應對非變音符號、隱喻、雙關語、拼寫變異、同音詞、代碼混合以及混淆技術等語言挑戰,顯著提升了低資源環境下檢測的魯棒性。
The rise in hateful and offensive language directed at other users is one of the adverse side effects of the increased use of social networking platforms. This could make it difficult for human moderators to review tagged comments filtered by classification systems. To help address this issue, we present the ViHOS (Vietnamese Hate and Offensive Spans) dataset, the first human-annotated corpus containing 26k spans on 11k comments. We also provide definitions of hateful and offensive spans in Vietnamese comments as well as detailed annotation guidelines. Besides, we conduct experiments with various state-of-the-art models. Specifically, XLM-R$_{Large}$ achieved the best F1-scores in Single span detection and All spans detection, while PhoBERT$_{Large}$ obtained the highest in Multiple spans detection. Finally, our error analysis demonstrates the difficulties in detecting specific types of spans in our data for future research. Disclaimer: This paper contains real comments that could be considered profane, offensive, or abusive.
研究动机与目标
- 彌補越南語仇恨言論檢測缺乏註釋數據集的不足,越南語是一種具有複雜社會語言特徵的低資源語言。
- 應對語言挑戰,如非變音符號、隱喻、借代、雙關語、拼寫錯誤、同音詞、代碼混合以及刻意混淆。
- 開發一種強健的註釋框架,即使在語言混淆與模糊情況下也能精確識別攻擊性片段。
- 透過捕捉越南語網絡言論中的語義意圖而非僅表面文本形式,提升仇恨言論檢測系統的效能。
- 提供標準化、情境感知的標註協議,以確保在多樣化語言形式下識別仇恨言論片段的一致性與可靠性。
提出的方法
- 設計多層次註釋協議,用於識別10種不同語言混淆類型中的攻擊性片段,包括非變音符號、隱喻、雙關語與同音詞。
- 訓練註釋員重新閱讀模糊或標點缺失的評論,以釐清語義,特別是在缺少變音符號或標點不清晰的情況下。
- 實施語義層次註釋:即使詞語被混淆或重排,只要整個短語或子句傳達仇恨或冒犯意圖,即進行標註。
- 處理非詞符號(例如:*刀符號*、()),若其組合後形成明確的冒犯含義,則視為攻擊性。
- 若外來詞或代碼混合(例如英文詞彙如'Vl'、'fake'、'compat')在語境中符合仇恨言論定義,則視為攻擊性片段。
- 實施混淆感知標註:對於被屏蔽的詞語(例如:'l*n'、'c h.ó'),若其組成字元或重建形式構成攻擊性短語,則標註全部字元或重建形式。
实验结果
研究问题
- RQ1當越南語中的攻擊性片段使用非變音符號、標點符號或變音符號替代方式混淆時,如何可靠地識別它們?
- RQ2越南語評論中的隱喻與借代在多大程度上掩蓋仇恨言論?如何透過語義層次標註來檢測它們?
- RQ3拼寫變異與地區性變音符號錯誤如何影響仇恨言論的檢測?何種註釋策略能確保在這些形式間的一致性?
- RQ4同音詞與雙關語(例如:'coin card' 對應 'con cặc')能否在越南語中系統性地被檢測與標註為攻擊性片段?
- RQ5情境感知、語義層次的註釋框架在面對旨在逃避檢測的語言混淆技術時,其捕捉攻擊意圖的有效性如何?
主要发现
- 該註釋框架成功識別出10種不同語言混淆類型中的攻擊性片段,包括非變音符號、隱喻、雙關語與同音詞。
- 非變音符號如 'deo'(代表 'đéo')與 'cai'(代表 'ái')在語境中即使無變音符號,亦被一致標註為攻擊性。
- 隱喻表達如 'cái miệng rộng quá đẻ con ra còn lọt'(嘴巴大到能生出嬰兒)因具有陰道隱喻,被正確標註為攻擊性。
- 經混淆的詞語如 'l*n'(以星號代替)與 'c h.ó'(以空格與句點分隔)在重建為 'pussy' 與 'dog' 後,被正確識別為攻擊性片段。
- 雙關語如 'Bồn Kỳ Lắc'(倒讀為 'Bắc Kỳ Lồn',意為 'pussy north')透過音韻與拼寫分析,被正確識別為攻擊性。
- 代碼混合詞語如 'Vl fake' 與 'đá phò' 在語境中傳達仇恨或侮辱意圖時,即使嵌入非越南語詞彙,亦被標註為攻擊性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。