[論文レビュー] Is ChatGPT better than Human Annotators? Potential and Limitations of ChatGPT in Explaining Implicit Hate Speech
本論文は、黙示的な憎悪発言の検出と自然言語による説明の生成のためにChatGPTを評価し、人間が注釈付けしたデータセットと80%の一致、そしてChatGPTの説明が人間の説明よりも明確で、情報量は同等であると結論付けている。
Recent studies have alarmed that many online hate speeches are implicit. With its subtle nature, the explainability of the detection of such hateful speech has been a challenging problem. In this work, we examine whether ChatGPT can be used for providing natural language explanations (NLEs) for implicit hateful speech detection. We design our prompt to elicit concise ChatGPT-generated NLEs and conduct user studies to evaluate their qualities by comparison with human-written NLEs. We discuss the potential and limitations of ChatGPT in the context of implicit hateful speech research.
研究の動機と目的
- ChatGPT が人間と同等の効果で黙示的な憎悪ツイートを検出できるかを評価する。
- 黙示的な憎悪発言に対する ChatGPT が生成した自然言語による説明の品質を評価する。
- 情報量と明確さの観点で、ChatGPT の説明と人間が作成した説明を比較する。
提案手法
- Latent Hatred データセット(6,358 件の黙示的な憎悪ツイート)をテストベッドとして使用する。
- 各ツイートにつき特定のプロンプトで ChatGPT の3つの応答を生成し、+1/0/-1 のスコアを平均して ChatGPT の憎悪スコアを導く。
- 3つの文脈(投稿のみ、投稿+人間の NLE、投稿+ChatGPT の NLE)で、ChatGPT の分類と NLE を比較するために MTurk を用いた人間評価を実施する。
- NLE の品質を情報量と明確さの指標で7段階スケールで評価する。
- 一致と潜在的な偏りを評価するため、ChatGPT の結果を人間の注釈と比較する。
実験結果
リサーチクエスチョン
- RQ1RQ1: ChatGPT は黙示的な憎悪ツイートを適切に検出できるか?
- RQ2RQ2: ChatGPT は黙示的な憎悪発言に対して質の高い自然言語による説明を生成するか?
主な発見
- ChatGPT は 795 件の黙示的な憎悪ツイートのうち 636 件を正しく識別した(LatentHatred のラベルと80%の一致)。
- ChatGPT は投稿のみ与えられた場合の平均憎悪度スコアが -0.41、ChatGPT が生成した NLE が提示された場合は -0.52 となり、一般の反応はツイートを非憎悪とみなしやすく、NLE が判断に影響を与えることを示している。
- 人間が作成した NLE を提供すると平均スコアは 0.29 の正の値になり、人間の説明は判断を動かすことができるが、全体としては ChatGPT の説明ほど説得力が高くないことを示している。
- ChatGPT が生成した NLE は明確さが高く(平均 5.39)、人間が作成した NLE は平均 4.68 で、情報量には有意差がない。
- ChatGPT の性能は主観的タスクのデータ注釈ツールとして強い可能性を示唆するが、判断が間違っている場合のリスクも存在する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。