[논문 리뷰] Speech Translation with Large Language Models: An Industrial Practice
이 논문은 장기 음성 입력에서 정확하고 타임스탬프가 부여된 번역을 생성하기 위해 대규모 언어 모델(Large Language Model, LLM)과 Whisper 기반 음성 인코더를 통합한 엔드 투 엔드 음성 번역 시스템인 LLM-ST을 제안한다. 다중 작업 지시 훈련—특히 체인 오브 타ught(Chain-of-Thought) 프롬프팅—을 활용하여 LLM-ST는 음성의 유창성, 코드 스위칭, 전문 용어 처리 측면에서 기존 오픈소스 모델과 상용 계단식 시스템을 모두 능가하는 성능을 보이며, 영어↔중국어 음성 번역에서 뛰어난 성능을 발휘한다.
Given the great success of large language models (LLMs) across various tasks, in this paper, we introduce LLM-ST, a novel and effective speech translation model constructed upon a pre-trained LLM. By integrating the large language model (LLM) with a speech encoder and employing multi-task instruction tuning, LLM-ST can produce accurate timestamped transcriptions and translations, even from long audio inputs. Furthermore, our findings indicate that the implementation of Chain-of-Thought (CoT) prompting can yield advantages in the context of LLM-ST. Through rigorous experimentation on English and Chinese datasets, we showcase the exceptional performance of LLM-ST, establishing a new benchmark in the field of speech translation. Demo: https://speechtranslation.github.io/llm-st/.
연구 동기 및 목표
- 복잡한 계단식 파이프라인을 대체하는 단일 모델로 통합형 엔드 투 엔드 음성 번역 시스템을 개발하는 것.
- 사전 훈련된 LLM의 맥락 이해 능력과 음성 표현을 통합하여 장기 음성 입력에 대한 번역 품질을 향상시키는 것.
- 체인 오브 타ught 프롬프팅과 다중 작업 지시 훈련이 번역의 견고성 향상에 기여하는지 평가하는 것.
- 완전히 엔드 투 엔드 음성 번역 시스템의 산업적 구현 가능성을 입증하고, 상용 계단식 모델을 능가하는 것.
- 발음 번역 및 번역 설명 작업이 코드 스위칭 및 고유명사 번역 향상에 기여하는 역할을 탐색하는 것.
제안 방법
- LLM-ST는 16kHz 음성에서 연속적인 음성 표현을 추출하기 위해 Whisper-Large-v2 인코더를 사용하며, 이 과정에서 이산화(discretization)를 수행하지 않는다.
- 음성 표현은 13B 파라미터의 디코더 전용 LLM(same as GPT-3)에 조건부로 제공되어 자연어 지시에 기반한 텍스트 출력을 생성한다.
- 다중 작업 지시 훈련은 음성 인식(ASR), 기계 번역, 발음표기(역기호), 문장 분할, ITN(역기호 처리), 타임스탬프 예측 등 다양한 작업을 동시에 훈련한다.
- 체인 오브 타ught(Chain-of-Thought, CoT) 프롬프팅은 지시 훈련 중에 적용되어 추론 능력과 출력의 투명성을 향상시킨다.
- 모델는 1,300만 개 이상의 번역 쌍과 광범위한 원본 텍스트를 포함한 대규모 영어-중국어 음성 및 텍스트 데이터셋으로 파인튜닝된다.
- Whisper의 30초 제한을 제거함으로써 모델은 임의의 길이의 음성 입력을 처리할 수 있다.
실험 결과
연구 질문
- RQ1통합형 엔드 투 엔드 모델이 계단식 시스템에 비해 음성 번역 성능에서 열등하지 않게 성능을 높일 수 있는가?
- RQ2체인 오브 타ught 프롬프팅을 포함한 다중 작업 지시 훈련이 번역 품질과 견고성 향상에 어떤 영향을 미치는가?
- RQ3연속적인 음성 표현을 갖춘 사전 훈련된 LLM이 음성의 유창성, 코드 스위칭, 영역 전문 용어를 얼마나 잘 처리할 수 있는가?
- RQ4지시 훈련에 발음 번역(IPA/pinyin)을 포함시키면 코드 스위칭 음성 번역 성능이 향상되는가?
- RQ5엔드 투 엔드 모델이 계단식 시스템과 유사한 해석 가능한 중간 출력을 제공할 수 있는가?
주요 결과
- LLM-ST는 영어↔중국어 음성 번역에서 최신 기술 수준의 성능을 달성하여 자동 평가 및 인간 평가 모두에서 오픈소스 모델과 상용 계단식 시스템을 모두 능가한다.
- 인간 평가 결과, LLM-ST는 음성의 유창성, 맥락 의존적 번역, 코드 스위칭 처리 측면에서 상용 계단식 시스템을 뛰어넘는 성능을 보였다.
- 모델는 상용 ASR 모델이 발음 혼동으로 인해 실패하는 브랜드 명(예: Vetements, Balenciaga)과 같은 전문 용어를 정확히 번역한다.
- 다중 작업 훈련에 발음 번역(IPA/pinyin)을 통합함으로써 코드 스위칭 번역 성능이 크게 향상되었다.
- 체인 오브 타ught 프롬프팅은 추론 능력과 출력의 해석 가능성 향상에 기여하였으며, 이는 엔드 투 엔드 모델이 중간 단계를 투명하게 제공할 수 있음을 시사한다.
- 입력 길이 제한 없이 장기 음성 입력에 대해서도 높은 성능을 유지하여 정확한 타임스탬프가 부여된 출력을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.