Skip to main content
QUICK REVIEW

[論文レビュー] Legal Case Document Summarization: Extractive and Abstractive Methods and their Evaluation

Abhay Shukla, Paheli Bhattacharya|arXiv (Cornell University)|Oct 14, 2022
Artificial Intelligence in Law被引用数 13
ひとこと要約

本稿は、インドおよび英国の最高裁判所判決から作成された3つの新規データセットを用いて、法的事件文書における抽出的要約と生成的要約手法の評価を実施している。非教師あり抽出的手法(例:DSDR)と教師ありモデル(例:SummaRuNNer)がドメイン特化型手法を上回ること、チャンク分割による微調整が長文要約処理を改善すること、専門家による評価では自動評価指標と人間の判断の間で相関が低かったことが判明した。

ABSTRACT

Summarization of legal case judgement documents is a challenging problem in Legal NLP. However, not much analyses exist on how different families of summarization models (e.g., extractive vs. abstractive) perform when applied to legal case documents. This question is particularly important since many recent transformer-based abstractive summarization models have restrictions on the number of input tokens, and legal documents are known to be very long. Also, it is an open question on how best to evaluate legal case document summarization systems. In this paper, we carry out extensive experiments with several extractive and abstractive summarization methods (both supervised and unsupervised) over three legal summarization datasets that we have developed. Our analyses, that includes evaluation by law practitioners, lead to several interesting insights on legal summarization in specific and long document summarization in general.

研究の動機と目的

  • 長く複雑な法的事件文書における要約モデルの体系的評価の不足に対処すること。
  • ベンチマーク用に、インドおよび英国の最高裁判所判決から3つの新規法的要約データセットを構築すること。
  • 抽出的および生成的手法(教師あり、非教師あり、ドメイン特化型)の性能を比較すること。
  • トランスフォーマーモデルの入力トークン制限を考慮した場合の、長文法的文書の要約処理に有効な戦略を調査すること。
  • 法曹関係者による専門家評価を用いて、要約の質を自動指標と併せて評価すること。

提案手法

  • 法的要約用に3つの新規データセットを構築:IN-Ext(インド抽出的)、IN-Abs(インド生成的)、UK-Abs(英国生成的)、それぞれのゴールドスタンダード要約は法的専門家が作成。
  • 幅広い要約手法を適用:非教師あり抽出的(例:LexRank、DSDR、PacSum)、教師あり抽出的(例:SummaRuNNer、BERTSUM)、生成的(例:BART、Longformer、Legal-Pegasus)。
  • 長文要約処理のための3つの戦略を検討:Longformerを用いた長文コンテキスト処理、短いモデル(例:BART)を用いたチャンク分割、抽出的・生成的を組み合わせたハイブリッドパイプライン。
  • 法的コーパス上でドメイン特化型モデル(例:Legal-Pegasus)を微調整し、法的テキスト処理のパフォーマンスを向上。
  • 法曹関係者による人間評価を実施:5件の文書から抽出した35件の要約を、5つの修辞的セグメント(例:事実、判決、先例)ごとに、リーダビリティおよび全体的な質を5段階リッカート尺度で評価。
  • 自動指標(ROUGE、BERTScore)と専門家評価の相関を計算し、法的NLP分野における指標の信頼性を評価。

実験結果

リサーチクエスチョン

  • RQ1抽出的および生成的要約モデルは、法的事件文書においてどのように性能を発揮するか?
  • RQ2ドメインに依存しないモデルは、ドメイン特化型モデルを上回る性能を示すか?
  • RQ3トランスフォーマーモデルの入力長制限を考慮した場合、長文法的文書の要約処理に最も効果的な戦略は何か?
  • RQ4自動評価指標(例:ROUGE、BERTScore)は、法曹関係者の人間的判断とどの程度相関するか?
  • RQ5要約は、法的判決における主要な修辞的セグメント(例:事実、判決、先例)をどの程度適切に反映しているか?

主な発見

  • 非教師あり抽出的手法(例:DSDR)が法曹関係者からの全体的な満足度スコアで最高を記録し、教師ありおよび生成的モデルを上回った。
  • 教師あり抽出的モデル(例:SummaRuNNer、DSDR)が専門家評価で、重要な情報のカバレッジおよびリーダビリティの観点で最高評価を受けた。
  • チャンク分割ベースのアプローチ(まず要約を抽出し、その後に生成的モデルを適用)は、長文の直接的生成的要約処理よりも優れた性能を示し、微調整を施した場合特に顕著だった。
  • Longformerは、最も長い文書を含むUK-Absデータセットで最高のパフォーマンスを発揮したが、短い法的文書ではチャンク分割ベースの手法に劣った。
  • 自動指標は専門家評価と極めて低い相関を示した:ROUGE-1 F-Score(0.212)、ROUGE-2 F-Score(0.208)、ROUGE-L F-Score(0.132)、BERTScore(0.067)、法的要約評価における指標の信頼性が限定的であることが示された。
  • どのモデルの要約も、全修辞的セグメントにバランスよく対応していなかった。特に、引用された先例(PRE)や主張(ARG)といった重要な要素が、後半部分で欠落する傾向があった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。