Skip to main content
QUICK REVIEW

[論文レビュー] LEXTREME: A Multi-Lingual and Multi-Task Benchmark for the Legal Domain

Joel Niklaus, Veton Matoshi|arXiv (Cornell University)|Jan 30, 2023
Natural Language Processing Techniques参考文献 78被引用数 4
ひとこと要約

LEXTUREME は、24ヶ国語および8つの言語系統にまたがる11のデータセットを含む、法律NLP向けの多言語・多タスクベンチマークである。このベンチマークは、多言語モデルの法的テキスト理解タスクにおける性能を評価し、優れたモデルですら限定的なパフォーマンスにとどまることを明らかにした。これは、専用の法的NLPシステムの必要性を示し、分野における評価基準を新たに高く設定している。

ABSTRACT

Lately, propelled by the phenomenal advances around the transformer architecture, the legal NLP field has enjoyed spectacular growth. To measure progress, well curated and challenging benchmarks are crucial. However, most benchmarks are English only and in legal NLP specifically there is no multilingual benchmark available yet. Additionally, many benchmarks are saturated, with the best models clearly outperforming the best humans and achieving near perfect scores. We survey the legal NLP literature and select 11 datasets covering 24 languages, creating LEXTREME. To provide a fair comparison, we propose two aggregate scores, one based on the datasets and one on the languages. The best baseline (XLM-R large) achieves both a dataset aggregate score a language aggregate score of 61.3. This indicates that LEXTREME is still very challenging and leaves ample room for improvement. To make it easy for researchers and practitioners to use, we release LEXTREME on huggingface together with all the code required to evaluate models and a public Weights and Biases project with all the runs.

研究の動機と目的

  • 英語以外の言語、特に非英語言語における多言語ベンチマークの不足に対処すること。
  • 多様な言語的・法的制度にわたる法的言語の複雑さを反映する、標準的で挑戦的なベンチマークを構築すること。
  • 言語アグリゲートスコアとデータセットアグリゲートスコアの2つの集約スコアを用いて、多言語モデルの公平な比較を可能にすること。
  • Hugging Face統合、パブリックリーダーボード、Weights and Biasesによる完全な再現性を備えた、公開・透明性のある評価プラットフォームをリリースすること。
  • 既存のモデル、特にChatGPTのような大規模言語モデルが法的NLPタスクにおいてどのような限界を示すかを示すこと。

提案手法

  • 著者らは、2010年から2022年までの文献から、8つの言語系統(ゲルマン系、ラテン系、 Slavic系など)にまたがる24ヶ国語をカバーする11の既存の法的NLPデータセットを収集した。
  • 言語アグリゲートスコアとデータセットアグリゲートスコアという2つの集約評価指標を定義し、多様な設定におけるパフォーマンスのバランスを取るために調和平均を用いた。
  • mBERT、XLM-RoBERTa、DeBERTaなどの5つの多言語トランスフォーマー基盤モデルを、すべてのデータセット上で評価し、ベースラインパフォーマンスを確立した。
  • ベンチマークはHugging Faceにリリースされ、パブリックリーダーボードと完全な評価コードが提供され、再現性と透明性が保証された。
  • すべてのモデル実行をログ記録するためのWeights and Biasesプロジェクトを作成し、完全な監査可能性と比較可能性を実現した。
  • データセットのコレクションには、テキスト分類、名前付きエンティティ認識、法的判断予測など、多様な法的タスクが含まれており、入力は短い文から完全な法的文書まで多様である。

実験結果

リサーチクエスチョン

  • RQ1多言語モデルは、多様な法的言語および法的テキストタイプにおいて、どのように性能を発揮するか?
  • RQ2既存の多言語モデル、特にChatGPTのような大規模言語モデル(LLM)は、法的NLPタスクにどの程度一般化できるか?
  • RQ3リソースが豊富な言語とリソースが乏しい言語の設定におけるパフォーマンス格差はどの程度か?
  • RQ4既存のベンチマークは、長距離依存性やドメイン固有の用語を含む法的言語の複雑さを十分に捉えているか?
  • RQ5モデルのサイズとアーキテクチャは、多言語環境下での法的NLPタスクにおけるパフォーマンスにどのように影響するか?

主な発見

  • 最高のベースラインモデルは、XLM-RoBERTa-largeを用いて言語アグリゲートスコア60.0、データセットアグリゲートスコア60.0を達成した。これは、さらなる改善の余地が大きいことを示している。
  • XLM-RoBERTa-large や mDeBERTa-v3-base といった強力なモデルですら、複数のタスクでマイクロ-F1が80%未満にとどまり、法的テキスト理解における継続的な課題が浮き彫りになった。
  • ChatGPT は、特にリソースが乏しい言語において複数のタスクで困難を示し、法的推論能力における限界が明らかになった。
  • モデルサイズとパフォーマンスの間に強い相関関係が観察された。大規模モデルは、すべての言語とタスクで一貫して小規模モデルを上回った。
  • データセット間での入力シーケンス長の分布を分析した結果、多くの法的文書が通常のNLP入力長を超えており、法的NLPにおける長文脈モデリングの必要性が強調された。
  • ベンチマークは、現在の多言語モデルが、特にリソースが乏しい言語において、法的ドメインのズレに対して頑健でないことを明らかにした。これは、ドメイン特化のファインチューニングとデータ収集の必要性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。