Skip to main content
QUICK REVIEW

[논문 리뷰] Better Transcription of UK Supreme Court Hearings

Hadeel Saadany, Catherine Breslin|arXiv (Cornell University)|2022. 11. 29.
Artificial Intelligence in Law인용 수 4
한 줄 요약

이 논문은 법적 텍스트와 골드스탠다드 전사본을 기반으로 훈련된 맞춤형 언어 모델(CLM)과 정제된 법적 어휘 및 어구를 활용하여 사전 훈련된 ASR 모델을 미세조정하고, 영국 최고법원 청문회에 특화된 자동 음성 인식(ASR) 시스템을 제안한다. 이 방법은 단어 오류률(WER)을 최대 9% 감소시키며, 케이스 규정 및 사법 직위와 같은 핵심 법적 용어의 전사 정확도를 크게 향상시킨다.

ABSTRACT

Transcription of legal proceedings is very important to enable access to justice. However, speech transcription is an expensive and slow process. In this paper we describe part of a combined research and industrial project for building an automated transcription tool designed specifically for the Justice sector in the UK. We explain the challenges involved in transcribing court room hearings and the Natural Language Processing (NLP) techniques we employ to tackle these challenges. We will show that fine-tuning a generic off-the-shelf pre-trained Automatic Speech Recognition (ASR) system with an in-domain language model as well as infusing common phrases extracted with a collocation detection model can improve not only the Word Error Rate (WER) of the transcribed hearings but avoid critical errors that are specific of the legal jargon and terminology commonly used in British courts.

연구 동기 및 목표

  • 일반적인 ASR 시스템이 도메인 특화된 언어, 발음, 법적 용어로 인해 영국 최고법원 청문회 전사 시 높은 오류율을 보이는 문제를 해결하기 위해.
  • 법적 도메인에서 자동 전사 품질을 향상시켜 수동 후처리 작업을 줄이기 위해.
  • 맞춤형 언어 모델링과 어휘 통합이 법적 오디오에 대한 ASR 성능에 미치는 영향을 평가하기 위해.
  • 케이스 규정, 사법 직위, 법령 참조와 같은 핵심 법적 실체의 전사 정확도를 향상시키기 위해.
  • 영국 사법 제도에서 자동 법적 전사에 대해 확장 가능하고 비용 효율적인 솔루션을 제공하기 위해.

제안 방법

  • 139시간의 골드스탠다드 영국 최고법원 청문회 전사본과 법적 판결문을 기반으로 훈련된 맞춤형 언어 모델(CLM)을 사용해 사전 훈련된 ASR 모델을 미세조정한다.
  • 법적 텍스트에서 고빈도 법적 어구와 다단어 표현을 추출하기 위해 어구 탐지 모델을 훈련한다.
  • 추출된 법적 어구와 실체 어휘를 추론 시점에 ASR 시스템에 통합하여 도메인 특화 용어의 인식 성능을 향상시킨다.
  • WER와 실체 인식 정확도를 지표로 하여, AWS Transcribe와 OpenAI Whisper와 같은 오프더쇼프 시스템과 성능을 비교한다.
  • 대규모 엔드 투 엔드 재훈련이 필요 없이 도메인 내 데이터와 NLP 기법의 조합을 통해 도메인 불일치 문제를 완화한다.
  • 실제 영국 최고법원 청문회 두 건에 대해 WER와 법적 실체 전사 비율 등의 정량적 지표를 사용해 시스템을 평가한다.

실험 결과

연구 질문

  • RQ1법적 전사본을 기반으로 훈련된 도메인 특화 언어 모델로 일반 ASR 모델을 미세조정하면 영국 최고법원 청문회에서 WER를 유의미하게 감소시킬 수 있는가?
  • RQ2정제된 법적 어구 및 실체 어휘의 통합이 핵심 법적 용어의 전사 정확도에 어느 정도 기여하는가?
  • RQ3AWS Transcribe와 OpenAI Whisper와 같은 오프더쇼프 시스템과 비교했을 때, 개선된 ASR 시스템의 WER 및 법적 실체 인식 성능은 어떠한가?
  • RQ4도메인 특화 언어 모델링과 어휘 통합의 조합이 수동 후처리 작업을 줄이는 데 실질적인 영향을 미치는가?
  • RQ5NLP 기법 중 어구 탐지 기술이 법적 오디오에서 도메인 특화 어휘를 효과적으로 식별하고 인식 성능을 향상시키는 데 기여하는가?

주요 결과

  • CLM2 모델은 판결문과 골드스탠다드 전사본을 모두 기반으로 훈련하여, 두 테스트 케이스에서 AWS Transcribe 대비 9% WER 감소, Whisper 대비 8% 감소를 기록했다.
  • CLM2에 맞춤형 법적 어구 어휘를 통합함으로써 평균 WER가 추가로 9% 감소하여 도메인 특화 어휘 적응의 가치를 입증했다.
  • CLM2+Vocab 시스템은 사법 직위(예: 'Lord Phillips', 'Lady Hale')의 정확한 전사 비율이 0.84를 기록했으며, AWS와 Whisper는 각각 0.66과 0.69였다.
  • 법적 규정(예: 'section 25(2)(a)-(h)')의 정확한 전사 비율은 0.97로, 일반 모델보다 뚜렷이 뛰어나게 성과를 보였다.
  • 최고 성능을 보인 모델은 AWS 대비 전사 시간을 155% 증가시켰지만, 정확도 향상 측면에서 상당한 개선 효과를 보였다.
  • 이 연구는 맞춤형 언어 모델링과 어휘 통합을 통한 도메인 적응이 법적 음성 인식에서 중요한 오류를 줄이는 데 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.