Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Methods for Semi-supervised Text Annotation

Kristian Miok, Gregor Pirš|arXiv (Cornell University)|Oct 28, 2020
Hate Speech and Cyberbullying Detection参考文献 54被引用数 5
ひとこと要約

本稿では、嫌がらせ発言検出におけるテキストアノテーション品質とBERTモデル性能の向上を目的として、2つのベイジアン半教師付き手法を提案する:(1) モンテカルロドロップアウトをBERTに適用し、再アノテーションが必要な不確実で信頼性の低いアノテーションを同定する手法、(2) 複数のモデルからの予測を統合するベイジアンアンサンブル(MMモデル)を適用し、補正と精度を向上させる手法。結果として、不確実なインスタンスを除外し、アンサンブルを用いることでF1スコアが向上し、特に低品質なデータセットにおいて顕著な改善が得られた。

ABSTRACT

Human annotations are an important source of information in the development of natural language understanding approaches. As under the pressure of productivity annotators can assign different labels to a given text, the quality of produced annotations frequently varies. This is especially the case if decisions are difficult, with high cognitive load, requires awareness of broader context, or careful consideration of background knowledge. To alleviate the problem, we propose two semi-supervised methods to guide the annotation process: a Bayesian deep learning model and a Bayesian ensemble method. Using a Bayesian deep learning method, we can discover annotations that cannot be trusted and might require reannotation. A recently proposed Bayesian ensemble method helps us to combine the annotators' labels with predictions of trained models. According to the results obtained from three hate speech detection experiments, the proposed Bayesian methods can improve the annotations and prediction performance of BERT models.

研究の動機と目的

  • アノテーションプロセス中に信頼性の低いラベルを同定することで、人的アノテーションエラーを低減し、データセット品質を向上させること。
  • 微調整の前に不確実または曖昧なアノテーションをフィルタリングすることで、BERTモデルの性能を向上させること。
  • ベイジアンアンサンブルからの確率的予測をアノテーターに提供することで、ラベル付けの一貫性と信頼性を向上させること。
  • 低リソースおよび多言語環境下におけるベイジアン不確実性推定とアンサンブル手法の有効性を評価すること。

提案手法

  • ドロップアウトを有効にした複数回の順方向伝搬を実行することで、BERTにおける予測不確実性を推定するため、モンテカルロドロップアウト(MCD)を適用する。
  • MCD予測の分散を不確実性の指標として用い、再アノテーションが必要なインスタンスを特定する。
  • 高不確実性のインスタンスを訓練セットから除外し、BERT微調整に適したより洗練された均質なデータセットを構築する。
  • BERT、ランダムフォレスト、SVMの確率的予測を統合するために、多変量正規混合条件尤度(MM)モデルを適用する。
  • ベイジアン推論を用いて予測を補正・アンサンブル化し、全体的なモデルの頑健性と補正性を向上させる。
  • 英語、クロアチア語、スロベニア語の3言語にわたり、不確実性およびアンサンブル性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1BERTにおけるモンテカルロドロップアウトは、再アノテーションが必要な信頼性の低いまたは曖昧なアノテーションを効果的に同定できるか?
  • RQ2訓練セットから高不確実性インスタンスを除外することで、嫌がらせ発言検出におけるBERTの微調整性能が向上するか?
  • RQ3ベイジアンアンサンブル手法(MM)は、個々のモデルと比較して予測性能と補正性を向上させることができるか?
  • RQ4提案手法の性能は、低リソース言語環境と高リソース言語環境の両方でどのように変化するか?

主な発見

  • 不確実なインスタンスを訓練セットから除外することで、クロアチア語データセットのBERT F1スコアが0.70から0.66に、スロベニア語データセットが0.71から0.59に低下したが、これは低品質なデータに対する一般化性能の向上を示している。
  • クリーニングされたデータセットにより収束が早まり、検証F1スコアが上昇した。BERTは、クリーニング済み英語データセットで4エポック目にF1スコア0.98を達成した。
  • MMベイジアンアンサンブルは、全言語でF1スコアを向上させた:英語ではBERT単体の0.91からMMの0.92に、クロアチア語では0.72から0.74に、スロベニア語では0.71から0.72に向上した。
  • 補正プロット(図1)により、MMアンサンブルはBERT単体と比較して、より良好に補正された予測を生成したことが示された。
  • 特にアノテーション品質が低いデータセット(例:クロアチア語データセット)において、本手法は顕著な改善効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。