[論文レビュー] Chain of Explanation: New Prompting Method to Generate Higher Quality Natural Language Explanation for Implicit Hate Speech
本稿では、ヒューリスティック語、憎しみの意図の提示、標的グループの特定を組み込むことで、暗黙のいじめ発言における自然言語説明(NLE)の質を向上させる、新しい手法であるChain of Explanation (CoE)プロンプトを提案する。この手法により、BLEU-1スコアは44.0から62.3に向上し、人間による評価でも高いスコアを達成。生成されたNLEは情報量(4.48/7)と明確さ(4.34/7)に優れ、ベースラインモデルを上回り、人間が書いた説明と類似している。
Recent studies have exploited advanced generative language models to generate Natural Language Explanations (NLE) for why a certain text could be hateful. We propose the Chain of Explanation (CoE) Prompting method, using the heuristic words and target group, to generate high-quality NLE for implicit hate speech. We improved the BLUE score from 44.0 to 62.3 for NLE generation by providing accurate target information. We then evaluate the quality of generated NLE using various automatic metrics and human annotations of informativeness and clarity scores.
研究の動機と目的
- 暗黙のいじめ発言における高品質な自然言語説明(NLE)の不足に取り組む。暗黙の形態は明示的な形態よりも検出が難しい。
- 事前学習済み言語モデル(PLM)を用いた自然言語説明生成の向上に向けたプロンプト工学の可能性を調査する。
- 標準的な自動評価指標を超えて、情報量と明確さの観点から人間のアノテーションを組み込むことで、NLEの質を包括的に評価する。
- 自動評価指標と人間の判断との間の相関関係を調査する。
- 暗黙のいじめ発言検出におけるNLEの忠実性と解釈可能性を向上させるためのプロンプトフレームワークを提案する。
提案手法
- ヒューリスティック語、憎しみの意図の提示、標的グループの特定を統合した、Chain of Explanation (CoE)プロンプトフレームワークを提案する。
- シーケンス・ツー・シーケンス形式の入力構造を採用:[STR] + H_text + tweet + [SEP] + D_hate + [SEP] + D_target + [SEP] + H_NLE + 生成されたNLE + [END]。
- 構造化されたプロンプトを導入:'与えられたテキスト:'、'このテキストはいじめですか?はい'、'標的グループは:{target}'、'これはいじめであるのはなぜか:'。これらの誘導文によって説明生成を支援する。
- LatentHatredデータセットを用いて、BARTやT5などの複数の生成言語モデルをCoEプロンプトで訓練および評価する。
- 包括的な評価のため、自動指標(BLEU、ROUGE、BERTScore、BLEURT、SARI、NUBIA)と人間評価の両方を用いる。
- 情報量と明確さのアノテーションに、3名の経験豊富な研究アシスタントを用い、曖昧なケースを除外した後の評価者間信頼性(Krippendorff’s alpha)は0.35であった。
実験結果
リサーチクエスチョン
- RQ1プロンプト手法は、暗黙のいじめ発言における自然言語説明(NLE)の質を著しく向上させることができるか?
- RQ2標的グループの情報をプロンプトに組み込むことで、NLEの質と自動指標スコアにどのような影響を与えるか?
- RQ3BLEU、ROUGE、BERTScoreなどの自動指標が、情報量と明確さの観点での人間の判断とどの程度相関しているか?
- RQ4CoEプロンプト手法は、ベースラインの自己回帰的生成手法に比べて、説明の質と忠実性において優れているか?
- RQ5構造化されたプロンプトは、モデルが生成する説明の曖昧さを軽減し、解釈可能性を向上させるか?
主な発見
- CoEプロンプト手法により、BLEU-1スコアはベースラインの44.0から62.3に上昇し、基準説明とのn-gram一致度が著しく向上したことが示された。
- プロンプトから標的グループを削除すると、BLEU-1スコアが15.5ポイント低下する。これは、標的グループ情報が説明品質において極めて重要な役割を果たしていることを確認した。
- 最良のモデルが生成したNLEの、人間による情報量スコアは4.48/7、明確さスコアは4.34/7であり、人間が書いた説明(5.20と4.53)と強く類似していることが示された。
- BLEURT、BERTScore、NUBIAは人間の判断と最も強いスピアマン相関を示した(それぞれr = 0.50、0.34、0.48)。ROUGE-LやSARIに比べて優れた性能を示した。
- SARIは明確さ評価との相関が最も弱く(r = 0.051)、NLE評価において信頼性が低いことが示された。
- 自動指標と人間評価の相関は変動が大きく、BLEU-1とROUGE-Lは情報量(r = 0.31と0.32)に対しては明確さ(r = 0.15と0.18)よりも相関が強い。これは、自動指標が意味的な明確さを十分に捉えていないことを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。