Skip to main content
QUICK REVIEW

[論文レビュー] ViHOS: Hate Speech Spans Detection for Vietnamese

Phu Gia Hoang, Canh Duc Luu|arXiv (Cornell University)|Jan 24, 2023
Hate Speech and Cyberbullying Detection被引用数 5
ひとこと要約

この論文は、ベトナム語のソーシャルメディアコメントにおける嫌がらせスパンを検出するためのデータセットとアノテーションフレームワークであるViHOSを紹介する。非発音記号、隠喩、ダジャレ、綴りのばらつき、同音異義語、コードミキシング、および隠蔽技術といった言語的課題に対処するため、文脈に配慮した意味論的ラベリングを通じて、アノテーターが攻撃的スパンを識別するように訓練することで、低リソース環境下での検出の頑健性を著しく向上させる。

ABSTRACT

The rise in hateful and offensive language directed at other users is one of the adverse side effects of the increased use of social networking platforms. This could make it difficult for human moderators to review tagged comments filtered by classification systems. To help address this issue, we present the ViHOS (Vietnamese Hate and Offensive Spans) dataset, the first human-annotated corpus containing 26k spans on 11k comments. We also provide definitions of hateful and offensive spans in Vietnamese comments as well as detailed annotation guidelines. Besides, we conduct experiments with various state-of-the-art models. Specifically, XLM-R$_{Large}$ achieved the best F1-scores in Single span detection and All spans detection, while PhoBERT$_{Large}$ obtained the highest in Multiple spans detection. Finally, our error analysis demonstrates the difficulties in detecting specific types of spans in our data for future research. Disclaimer: This paper contains real comments that could be considered profane, offensive, or abusive.

研究の動機と目的

  • ベトナム語における嫌がらせ検出のためのアノテート済みデータセットが不足しているという問題に対処する。これは、複雑な社会的言語的特徴を有する低リソース言語である。
  • 非発音記号、隠喩、隠喩的比喩、ダジャレ、綴りの誤り、同音異義語、コードミキシング、および意図的な隠蔽技術といった言語的課題に取り組む。
  • 言語的隠蔽や曖昧さにもかかわらず、攻撃的スパンの正確な同定を可能にする頑健なアノテーションフレームワークの開発。
  • ベトナム語のオンラインディス course における表面的テキスト形式ではなく、意味的意図を捉えることで、嫌がらせ検出システムの改善。
  • 多様な言語的形態をカバーする上で一貫性と信頼性を確保するための標準化された文脈に配慮したラベリングプロトコルの提供。

提案手法

  • 非発音記号、隠喩、ダジャレ、同音異義語などを含む10種類の異なる言語的隠蔽タイプに対応する多段階のアノテーションプロトコルを設計。
  • 曖昧または句読点のないコメントに対して、アノテーターが意味を解釈できるように再読を促し、特に発音記号が欠落している場合や、句読点が不明瞭な場合に重点を置く。
  • 意味論的ラベリングを適用:単語が隠蔽されたり、並び替えられたりしても、嫌がらせや攻撃的意味を伝えるフレーズや節全体をラベル付ける。
  • 非語彙的記号(例:*ナイフ記号*、())を、組み合わせて一貫した攻撃的意味を形成する場合は攻撃的とみなす。
  • 外国語やコードミキシング(例:'Vl'、'fake'、'compat' などの英語語彙)を、文脈上で嫌がらせの定義に合致する場合は攻撃的スパンとみなす。
  • 隠蔽に配慮したラベリングを実装:遮断された語(例:'l*n'、'c h.ó')に対しては、それらが攻撃的フレーズを形成する場合、すべての文字または再構成された形をラベル付ける。

実験結果

リサーチクエスチョン

  • RQ1非発音記号、句読点、または発音記号の置換によって隠蔽された場合、ベトナム語の攻撃的スパンをどのように信頼性高く同定できるか?
  • RQ2ベトナム語のコメントにおける隠喩や隠喩的比喩は、嫌がらせをどれほど隠蔽するのか。意味論的ラベリングによってどのように検出可能になるか?
  • RQ3綴りのばらつきや地域的発音記号の誤りが、嫌がらせ検出に与える影響は何か。一貫性を保証するアノテーション戦略は何か?
  • RQ4同音異義語やダジャレ(例:'coin card' が 'con cặc' と発音される)は、どのように体系的に検出され、攻撃的スパンとしてラベル付けできるか?
  • RQ5文脈に配慮した意味論的ラベリングフレームワークは、検出を回避するために設計された言語的隠蔽技術に対しても、攻撃的意図を的確に捉えるのにどの程度効果的か?

主な発見

  • アノテーションフレームワークは、非発音記号、隠喩、ダジャレ、同音異義語を含む10種類の異なる言語的隠蔽タイプにおける攻撃的スパンの同定に成功している。
  • 非発音記号としての 'deo'('đéo' の代替) や 'cai'('ái' の代替) は、文脈上、発音記号がなくても攻撃的と一貫してラベル付けされている。
  • 『cái miệng rộng quá đẻ con ra còn lọt』(口が広すぎて子供が通れる)といった隠喩的表現は、陰部を指す隠喩的意味を有するため、正しく攻撃的とラベル付けされている。
  • アスタリスクを用いた 'l*n' や、空白とピリオドを含む 'c h.ó' といった隠蔽語は、それぞれ 'pussy' や 'dog' に再構成された場合、攻撃的スパンとして検出されている。
  • 『Bồn Kỳ Lắc』(逆読みで 'Bắc Kỳ Lồn' となり、'pussy north' を意味する)といったダジャレは、音声的および綴り的分析を通じて、正しく攻撃的と同定されている。
  • 『Vl fake』 や 『đá phò』 といったコードミキシング語彙は、文脈上で嫌がらせや中傷を伝えている場合、非ベトナム語語彙に埋め込まれていても攻撃的とラベル付けされている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。