[논문 리뷰] HyPoradise: An Open Baseline for Generative Speech Recognition with Large Language Models
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 활용한 생성형 음성 인식 오류 보정을 위한 첫 번째 오픈 벤치마크인 HyPoradise를 소개한다. 다양한 음성 도메인에서 334,000개의 N-best 가설-번역 쌍을 포함하는 새로운 데이터셋을 제안하여, LLM이 재순서 정렬이 아닌 직접 보정된 번역을 생성할 수 있도록 한다. 이 방법은 LLM이 맥락적 추론을 통해 누락된 토큰을 복구하고 오류를 수정함으로써 기존의 재순서 정렬 한계를 초월하여 상당한 WER 감소를 달성한다.
Advancements in deep neural networks have allowed automatic speech recognition (ASR) systems to attain human parity on several publicly available clean speech datasets. However, even state-of-the-art ASR systems experience performance degradation when confronted with adverse conditions, as a well-trained acoustic model is sensitive to variations in the speech domain, e.g., background noise. Intuitively, humans address this issue by relying on their linguistic knowledge: the meaning of ambiguous spoken terms is usually inferred from contextual cues thereby reducing the dependency on the auditory system. Inspired by this observation, we introduce the first open-source benchmark to utilize external large language models (LLMs) for ASR error correction, where N-best decoding hypotheses provide informative elements for true transcription prediction. This approach is a paradigm shift from the traditional language model rescoring strategy that can only select one candidate hypothesis as the output transcription. The proposed benchmark contains a novel dataset, HyPoradise (HP), encompassing more than 334,000 pairs of N-best hypotheses and corresponding accurate transcriptions across prevalent speech domains. Given this dataset, we examine three types of error correction techniques based on LLMs with varying amounts of labeled hypotheses-transcription pairs, which gains a significant word error rate (WER) reduction. Experimental evidence demonstrates the proposed technique achieves a breakthrough by surpassing the upper bound of traditional re-ranking based methods. More surprisingly, LLM with reasonable prompt and its generative capability can even correct those tokens that are missing in N-best list. We make our results publicly accessible for reproducible pipelines with released pre-trained models, thus providing a new evaluation paradigm for ASR error correction with LLMs.
연구 동기 및 목표
- 소음, 억양, 발화 스타일 등의 악조건 하에서 자동 음성 인식(ASR)의 내성적 취약성 격차를 해소하기 위해.
- 기존 언어 모델 재순서 정렬 기법의 한계를 극복하기 위해, 상위 후보를 선택한 후 N-best 가설을 기각하는 방식을 피하기 위해.
- LLM을 활용해 N-best 가설에서 보정된 번역을 생성하는 새로운 ASR 오류 보정 패러다임을 제안하기 위해.
- 다양하고 실제 세계적인 음성 도메인을 포함하는 재현 가능하고 오픈소스의 벤치마크를 구축하여 LLM 강화된 ASR 시스템을 평가하기 위해.
- 저자원 또는 도메인 특화 환경에서의 실용적 구현을 위해 영향력 있는, 소수의 예시, 그리고 파라미터 미세조정 설정을 지원하기 위해.
제안 방법
- 저자는 최신 ASR 시스템들에서 유래한 노이즈가 있는, 억양이 있는, 맥락적으로 복잡한 음성 도메인을 아우르는 334,000개 이상의 N-best 가설과 정답 번역 쌍을 포함하는 HyPoradise (HP) 데이터셋을 구축한다.
- 벤치마크는 세 가지 설정을 지원한다: 영향력 있는 설정(라벨이 없는 데이터), 소수의 예시 설정(약간의 도메인 내 데이터 쌍), 파라미터 미세조정 설정(충분한 학습 데이터), 실세계 구현 제약 조건을 시뮬레이션한다.
- LLM은 목록에서 선택하는 대신, N-best 가설로부터 직접 정확한 번역을 생성하도록 프롬프트된다. 이를 위해 소수의 예시를 활용한 맥락 내 학습 또는 파라미터 미세조정을 사용한다.
- 이 방법은 LLM의 생성 능력을 활용하여 N-best 목록에 존재하지 않는 누락되거나 잘못된 토큰을 복구함으로써 재순서 정렬을 초월한 보정을 가능하게 한다.
- 평가에는 단어 오류율(WER)을 사용하며, 더 풍부한 평가를 위해 실체 범위 및 의존성 분석과 같은 구조적 주석으로의 확장을 계획하고 있다.
- 프레임워크는 사전 학습된 모델, 코드, HuggingFace 데이터셋 카드와 함께 공개되어 재현 가능성과 커뮤니티 기여를 보장한다.

실험 결과
연구 질문
- RQ1LLM은 다수의 N-best 가설을 활용하여 기존의 재순서 정렬 기법보다 더 정확한 번역을 생성할 수 있는가?
- RQ2LLM은 맥락적 추론을 통해 N-best 목록에 존재하지 않는 토큰을 얼마나 잘 복구할 수 있는가?
- RQ3저자원 또는 도메인 특화 환경에서 ASR 오류 보정에 대해 영향력 있는 및 소수의 예시 LLM 프롬프팅 전략은 얼마나 효과적인가?
- RQ4제안된 생성 보정 접근법은 기존의 재순서 정렬 방법의 성능 상한선을 초월하는가?
- RQ5LLM 기반 보정은 소음, 억양, 어휘에 없는 단어 등 다양한 음성 도메인에서 얼마나 견고한가?
주요 결과
- 제안된 LLM 기반 생성 보정 방법은 기존의 재순서 정렬 기법보다 상당한 단어 오류율(WER) 감소를 달성한다.
- 기존의 재순서 정렬 방법의 성능 상한선을 초월하여, N-best 목록에 존재하지 않는 누락되거나 잘못된 토큰을 복구함으로써 성능을 향상시킨다.
- 영향력 있는 및 소수의 예시 설정에서 적절한 프롬프팅을 사용한 LLM은 강력한 오류 보정 성능를 달성하며, 다양한 도메인으로의 일반화 능력을 보여준다.
- LLM은 N-best 가설에 전혀 존재하지 않는 단어를 맥락적 및 언어적 지식을 기반으로 정확히 추론하고 생성할 수 있다.
- HyPoradise 벤치마크는 재현 가능한 평가를 가능하게 하며, 소음에 강한 및 다국어 ASR 시나리오를 포함하도록 업데이트되어 활발히 유지되고 있다.
- 데이터셋과 모델은 GitHub 및 HuggingFace를 통해 공개되어 있으며, 커뮤니티의 확장과 장기적 유지보수를 지원한다.
![Figure 2: A scalable evaluation of Task-Activating Prompting [ 100 ] (TAP) based in-context learning. The demonstration in blue box is drawn from the training set, which is optional for LLMs input.](https://ar5iv.labs.arxiv.org/html/2309.15701/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.