Skip to main content
QUICK REVIEW

[論文レビュー] LAiW: A Chinese Legal Large Language Models Benchmark

Y. S. Dai, Duanyu Feng|arXiv (Cornell University)|Oct 9, 2023
Artificial Intelligence in Law被引用数 4
ひとこと要約

本稿では、基本的法的NLP、基本的法的応用、複雑な法的応用の3段階の法的能力に基づき、中国語法的大規模言語モデル(LLM)を評価するための、最初の包括的ベンチマークであるLAiWを紹介する。8体のモデル、法的特化型および一般LMMを含む評価により、一部の法的LLMがそのバックボーンを上回ることは確認されたが、タスク全体で最先端の性能を達成したのはChatGPTのみであり、現在の法的LLMの推論力と正確性に大きなギャップが存在することが示された。

ABSTRACT

General and legal domain LLMs have demonstrated strong performance in various tasks of LegalAI. However, the current evaluations of these LLMs in LegalAI are defined by the experts of computer science, lacking consistency with the logic of legal practice, making it difficult to judge their practical capabilities. To address this challenge, we are the first to build the Chinese legal LLMs benchmark LAiW, based on the logic of legal practice. To align with the thinking process of legal experts and legal practice (syllogism), we divide the legal capabilities of LLMs from easy to difficult into three levels: basic information retrieval, legal foundation inference, and complex legal application. Each level contains multiple tasks to ensure a comprehensive evaluation. Through automated evaluation of current general and legal domain LLMs on our benchmark, we indicate that these LLMs may not align with the logic of legal practice. LLMs seem to be able to directly acquire complex legal application capabilities but perform poorly in some basic tasks, which may pose obstacles to their practical application and acceptance by legal experts. To further confirm the complex legal application capabilities of current LLMs in legal application scenarios, we also incorporate human evaluation with legal experts. The results indicate that while LLMs may demonstrate strong performance, they still require reinforcement of legal logic.

研究の動機と目的

  • 中国語法的LLMのための標準的で包括的な評価フレームワークの欠如に対処すること。
  • 法的能力を3段階に段階的に分類し、定義すること:基本的法的NLP、基本的法的応用、複雑な法的応用。
  • 本ベンチマークの第1フェーズにおいて、基本的法的NLPタスクに焦点を当て、既存の中国語法的および一般LLMを評価すること。
  • 今後のモデル開発およびファインチューニングを支援するため、オープンソースの評価データおよびインstructチューニングデータセットを提供すること。
  • 倫理的整合性を確保するため、個人情報や機密データをマスキングし、法的専門家がデータキュレーションに参加すること。

提案手法

  • ベンチマークは、法的能力の3段階に分類される:基本的法的NLP(例:テキスト分類、エンティティ認識)、基本的法的応用(例:法的条文推薦)、複雑な法的応用(例:司法要約、事例推論)。
  • 法的専門家とAI専門家が共同で、既存のLegalAIタスクを再編成し、各能力レベル内での明確で評価可能なタスクに分類した。
  • 第1評価フェーズは、法的条文推薦、要因認識、司法要約、事例認識を含む基本的法的NLPに焦点を当てる。
  • 評価指標には、正確性、F1スコア、マチュー相関係数(MCC)、および要約タスクのROUGEスコアが含まれる。
  • データセットは倫理的セーフティを確保して構築された:個人名、場所、識別子がマスキングされ、法的専門家が適合性を確認した。
  • 今後のLLMのファインチューニングを支援するため、インstructチューニングデータセットが確保された。

実験結果

リサーチクエスチョン

  • RQ1中国語法的LLMは、一般LLMバックボーンと比較して、基本的法的NLPタスクでどのように異なるか?
  • RQ2法的条文推薦や事例認識といった法的特化型能力において、法的LLMは一般LLMをどの程度上回っているか?
  • RQ3法律データでファインチューニングされていない一般用途LLM、たとえばChatGPTは、法的特化型LLMを上回る性能を示せるか?
  • RQ4構造化された法的能力を評価した際、現在の法的LLMに顕著な性能ギャップが存在するか?
  • RQ5インstructチューニングとリtrieval増強生成(RAG)は、法的推論力と正確性を向上させるのにどの程度有効か?

主な発見

  • ChatGPTは、全基本的法的NLPタスクで最高のパフォーマンスを示し、法的条文推薦で0.988の正確性、事例認識で0.989の正確性を達成した。
  • Baichuan2とZiya-LLaMAは、事例認識でそれぞれ0.970および0.947の正確性を示し、多数の法的LLMを上回った。
  • HanFeiは、法律データで事前学習されているにもかかわらず、法的条文推薦でわずか0.169の正確性にとどまり、ドメイン特化の事前学習だけでは不十分であることが示された。
  • LawGPTは、法的条文推薦でバックボーンのChinese-LLaMA(0.379)よりも低い0.059の正確性を示し、ファインチューニング段階での過学習の可能性が示唆された。
  • Baichuan2 や LLaMA2 といった一般LLMは、要因認識や司法要約のタスクで、一部の法的LLMと同等またはそれ以上の結果を示した。これは、法的特化モデルが一般モデルを常に上回るとの仮定に疑問を呈するものである。
  • ベンチマークの結果、法的LLMの一部にのみ、一般LLMバックボーンを上回る性能が見られた。また、ChatGPTのような最先端モデルと比較して、依然として顕著な性能ギャップが存在することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。