[論文レビュー] Better Transcription of UK Supreme Court Hearings
本稿では、法的テキストおよびゴールドスタンダードトランスクリプトを用いて訓練されたカスタム言語モデル(CLM)と、体系的に選別された法的熟語およびエンティティの語彙を統合することで、UK最高裁判所の聴聞会に特化した自動音声認識(ASR)システムを提案する。この手法により、語誤り率(WER)が最大9%低下し、ケース条項や司法官の肩書などの重要な法的用語の転写精度が顕著に向上する。
Transcription of legal proceedings is very important to enable access to justice. However, speech transcription is an expensive and slow process. In this paper we describe part of a combined research and industrial project for building an automated transcription tool designed specifically for the Justice sector in the UK. We explain the challenges involved in transcribing court room hearings and the Natural Language Processing (NLP) techniques we employ to tackle these challenges. We will show that fine-tuning a generic off-the-shelf pre-trained Automatic Speech Recognition (ASR) system with an in-domain language model as well as infusing common phrases extracted with a collocation detection model can improve not only the Word Error Rate (WER) of the transcribed hearings but avoid critical errors that are specific of the legal jargon and terminology commonly used in British courts.
研究の動機と目的
- 一般ASRシステムでは、ドメイン固有の言語、発音、法的用語のため、UK最高裁判所の聴聞会のトランスクリプトに高い誤り率が生じる問題に対処すること。
- 法的ドメインにおける自動トランスクリプト品質の向上により、手作業による後処理作業の負担を軽減すること。
- カスタム言語モデルと語彙統合が、法的音声のASRパフォーマンスに与える影響を評価すること。
- ケース条項、司法官の肩書、法的根拠など、重要な法的エンティティのトランスクリプト精度を向上させること。
- UK司法制度における自動法的トランスクリプトのスケーラブルでコスト効率の良いソリューションを提供すること。
提案手法
- 139時間分のゴールドスタンダードUK最高裁判所の聴聞会トランスクリプトおよび法的判決文を用いて訓練されたカスタム言語モデル(CLM)で、事前学習済みASRモデルをファインチューニングすること。
- 法的テキストから高頻度の法的熟語および複数語表現を抽出するためのフレーズ検出モデルを訓練すること。
- 推論時に、検出された法的熟語およびエンティティ語彙をASRシステムに統合し、ドメイン固有用語の認識を向上させること。
- WERとエンティティ認識精度を指標として、2つのオフザシェルシステム(AWS TranscribeとOpenAI Whisper)と比較して、適応化されたASRシステムのパフォーマンスを評価すること。
- 大規模なエンドツーエンド再訓練を必要とせず、ドメイン内データとNLP技術の組み合わせによりドメインミスマッチを緩和すること。
- WERと法的エンティティのトランスクリプト比率という定量的指標を用いて、2つの実世界のUK最高裁判所の聴聞会でシステムを評価すること。
実験結果
リサーチクエスチョン
- RQ1法的トランスクリプトを用いて訓練されたドメイン固有の言語モデルで、一般ASRモデルをファインチューニングすることで、UK最高裁判所の聴聞会におけるWERを顕著に低減できるか?
- RQ2体系的に選別された法的熟語およびエンティティ語彙の統合が、重要な法的用語のトランスクリプト精度をどの程度向上させるか?
- RQ3AWS Transcribe や OpenAI Whisper といったオフザシェルシステムと比較して、適応化されたASRシステムのWERおよび法的エンティティ認識性能はどの程度か?
- RQ4ドメイン適応型言語モデルと語彙統合の組み合わせが、手作業による後処理作業の負担を顕著に削減できるか?
- RQ5コロケーション検出などのNLP技術が、法的音声におけるドメイン固有のフレーズを効果的に同定し、認識精度を向上させることができるか?
主な発見
- CLM2モデル(判決文とゴールドスタンダードトランスクリプトの両方でファインチューニング)は、2つのテストケースにおいてAWS Transcribeと比較して9%、Whisperと比較して8%のWER低下を達成した。
- CLM2にカスタム法的熟語語彙を統合したことで、平均してWERがさらに9%低下し、ドメイン固有の語彙適応の価値が裏付けられた。
- CLM2+Vocabシステムは、司法官の肩書(例:'Lord Phillips'、'Lady Hale')の正しくトランスクリプトされた比率が0.84に達したのに対し、AWSとWhisperはそれぞれ0.66および0.69であった。
- 法的条項(例:'section 25(2)(a)-(h)')の正しくトランスクリプトされた比率は0.97を記録し、一般モデルを大きく上回った。
- 最良のパフォーマンスを示したモデルは、AWSに比べてトランスクリプト時間は155%延びたが、依然として顕著な精度向上を達成した。
- 本研究では、カスタム言語モデルと語彙統合によるドメイン適応が、法的音声認識における重大な誤りを低減する有効な手法であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。