Skip to main content
QUICK REVIEW

[論文レビュー] Fast Approach to Build an Automatic Sentiment Annotator for Legal Domain using Transfer Learning

Viraj Salaka Gamage, Menuka Warushavithana|arXiv (Cornell University)|Oct 3, 2018
Topic Modeling参考文献 16被引用数 5
ひとこと要約

本論文では、映画レビューで事前に訓練されたRNTNモデルを用いて、法律文書の自動感情ラベル付けを構築するトランスファーラーニング手法を提案する。手動でラベル付けされた法律コーパス上でソースモデルをファインチューニングすることで、ネガティブな感情を検出する際、正解率が6%向上(76.80% 対 70.17%)、再現率が10%向上(70.14%)を達成した。

ABSTRACT

This study proposes a novel way of identifying the sentiment of the phrases used in the legal domain. The added complexity of the language used in law, and the inability of the existing systems to accurately predict the sentiments of words in law are the main motivations behind this study. This is a transfer learning approach, which can be used for other domain adaptation tasks as well. The proposed methodology achieves an improvement of over 6\% compared to the source model's accuracy in the legal domain.

研究の動機と目的

  • 言語的に複雑でNLP分野で未だ十分に調査が進んでいない法律文書における感情分析の課題に対処すること。
  • 映画レビューで事前に訓練された感情モデル(例:RNTN)が法律分野の言語に対しては性能が低いという限界を克服すること。
  • 法律分野における大規模な手動ラベル付けを必要とせずに、ドメイン適応型の感情ラベル付けツールを開発すること。
  • 法律フレーズにおけるネガティブな感情の自動特定を可能にし、法的推論や議論分析を支援すること。
  • 本手法の他のNLP分野のドメイン適応タスクへの一般化可能性を示すこと。

提案手法

  • 映画レビューで事前に訓練された再帰的ニューラルテンソルネットワーク(RNTN)モデルを、感情分類のためのファインチューニングにより、法律分野に適応させる。
  • 裁判所の判例文書から抽出した約1,500件の法律フレーズから成る手動ラベル付きテストデータセット(ネガティブまたはノンネガティブ)を用いる。
  • 小規模なドメイン固有のデータセットを用いて、ソースモデルのパラメータを法律分野に適応させるトランスファーラーニングを適用する。
  • ネガティブ感情クラスのスコアリングにしきい値ベースのメカニズムを導入し、精度を著しく低下させることなく再現率を向上させる。
  • 混同行列と標準指標を用いて、ファインチューニング済みターゲットモデルと元のソースモデル(Socher et al., 2013b)の性能を比較する。
  • RNTNの構造的性質を活用し、法律文書内の階層的文法的依存関係を捉えることで、フレーズレベルの感情をモデル化する。

実験結果

リサーチクエスチョン

  • RQ1映画レビューで事前に訓練された感情モデルを、最小限のドメイン固有のラベル付けで、法律分野に効果的に適応できるか?
  • RQ2RNTNモデルをファインチューニングすることで、元のソースモデルと比較して、法律文書における感情分類の正解率と再現率がどの程度向上するか?
  • RQ3ターゲットモデルは、元のソースモデルと比較して、法律フレーズにおけるネガティブな感情の識別でどの程度優れているか?
  • RQ4しきい値ベースの意思決定ルールを導入することで、法律文書の感情分類における再現率と精度にどのような影響を与えるか?
  • RQ5このトランスファーラーニング手法は、法律分野にとどまらず、他のNLP分野のドメイン適応タスクにも一般化可能か?

主な発見

  • ターゲットモデルは、法律フレーズの感情分類において76.80%の全体正解率を達成し、ソースモデルの70.17%と比較して6%の向上を示した。
  • ネガティブな感情を識別する再現率は70.14%に達し、ベースラインモデルの60.43%と比較して10%の向上を示した。
  • ネガティブ感情クラスの精度は、ターゲットモデルで84.41%に上昇し、ベースラインモデルの79.62%から向上した。
  • ソースモデルとターゲットモデルの予測に差が生じたフレーズは全体の9.5%にとどまることから、性能向上はドメイン固有の適応によるものであると示された。
  • モデルの性能はソースモデルの上限に制限されているため、さらなる向上にはソースアーキテクチャ自体の改善が必要であると示唆された。
  • 本手法は一般化可能であり、新たな大規模な手動ラベル付けを必要とせずに、他のドメインへも応用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。