[论文解读] Better Transcription of UK Supreme Court Hearings
本文提出了一种针对英国最高法院听证会的领域自适应自动语音识别(ASR)系统,通过使用在法律文本和标准转录稿上训练的自定义语言模型(CLM)对预训练ASR模型进行微调,并注入经过筛选的法律习语和实体词汇表。该方法将词错误率(WER)降低了高达9%,显著提升了对关键法律术语(如案件条款和司法头衔)转录的准确性。
Transcription of legal proceedings is very important to enable access to justice. However, speech transcription is an expensive and slow process. In this paper we describe part of a combined research and industrial project for building an automated transcription tool designed specifically for the Justice sector in the UK. We explain the challenges involved in transcribing court room hearings and the Natural Language Processing (NLP) techniques we employ to tackle these challenges. We will show that fine-tuning a generic off-the-shelf pre-trained Automatic Speech Recognition (ASR) system with an in-domain language model as well as infusing common phrases extracted with a collocation detection model can improve not only the Word Error Rate (WER) of the transcribed hearings but avoid critical errors that are specific of the legal jargon and terminology commonly used in British courts.
研究动机与目标
- 为解决通用ASR系统在转录英国最高法院听证会时因领域特定语言、发音和法律术语导致的高错误率问题。
- 通过提升法律领域自动化转录质量,减少人工后期编辑的工作量。
- 评估自定义语言建模和词汇注入对法律音频ASR性能的影响。
- 提升对关键法律实体(如案件条款、司法头衔和法定引用)转录的准确性。
- 为英国司法系统提供一种可扩展、成本效益高的自动化法律转录解决方案。
提出的方法
- 使用139小时的标准英国最高法院听证会转录稿和法律判决文本训练的自定义语言模型(CLM),对预训练ASR模型进行微调。
- 训练一个短语检测模型,从法律文本中提取高频法律习语和多词表达。
- 在推理阶段将检测到的法律习语和实体词汇表注入ASR系统,以提升对领域特定术语的识别能力。
- 使用WER和实体识别准确率作为指标,将改进后的ASR系统与两个现成系统(AWS Transcribe和OpenAI Whisper)进行比较。
- 结合领域内数据和自然语言处理技术,在无需大规模端到端重训练的情况下缓解领域差异问题。
- 在两个真实英国最高法院听证会案例上评估系统,采用WER和法律实体转录比率等定量指标。
实验结果
研究问题
- RQ1使用基于法律转录稿训练的领域特定语言模型对通用ASR模型进行微调,是否能显著降低英国最高法院听证会的WER?
- RQ2注入经筛选的法律习语和实体词汇表在多大程度上能提升对关键法律术语的转录准确率?
- RQ3与AWS Transcribe和OpenAI Whisper等现成系统相比,该改进ASR系统的WER和法律实体识别性能如何?
- RQ4领域自适应语言建模与词汇注入的结合是否能显著减少人工后期编辑的工作量?
- RQ5诸如习语检测等自然语言处理技术能否有效识别并增强法律音频中领域特定短语的识别能力?
主要发现
- 在两个测试案例中,基于判决文本和标准转录稿联合微调的CLM2模型,相比AWS Transcribe将WER降低了9%,相比Whisper降低了8%。
- 将自定义法律习语词汇表注入CLM2模型后,平均WER额外降低了9%,证明了领域特定词汇适应的价值。
- CLM2+Vocab系统在正确转录司法头衔(如“Lord Phillips”、“Lady Hale”)方面的比例达到0.84,显著优于AWS(0.66)和Whisper(0.69)。
- 该系统在正确转录法律条款(如“section 25(2)(a)-(h)”)方面的比例达到0.97,远超通用模型。
- 性能最佳的模型相比AWS的转录时间增加了155%,但准确率有显著提升。
- 本研究证明,通过自定义语言建模和词汇注入实现的领域自适应,在减少法律语音识别中的关键错误方面是有效的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。