[논문 리뷰] LLaSM: Large Language and Speech Model
LLaSM은 중국어와 영어 모두에서 말하는 지시어를 직접 이해하고 응답할 수 있도록 설계된 대규모, 엔드 투 엔드로 훈련된 다중모달 음성 및 언어 모델이다. 동결된 Whisper 인코더로부터의 음성 임베딩과 학습 가능한 모odal리티 어댑터를 통한 텍스트 임베딩을 융합함으로써, LLaSM은 음성에서 텍스트로의 변환 없이도 다중모달 지시어 수행을 달성한다. 이는 새로 공개된 508만 건의 음성-텍스트 샘플을 포함한 LLaSM-Audio-Instructions 데이터셋에 의해 뒷받침된다.
Multi-modal large language models have garnered significant interest recently. Though, most of the works focus on vision-language multi-modal models providing strong capabilities in following vision-and-language instructions. However, we claim that speech is also an important modality through which humans interact with the world. Hence, it is crucial for a general-purpose assistant to be able to follow multi-modal speech-and-language instructions. In this work, we propose Large Language and Speech Model (LLaSM). LLaSM is an end-to-end trained large multi-modal speech-language model with cross-modal conversational abilities, capable of following speech-and-language instructions. Our early experiments show that LLaSM demonstrates a more convenient and natural way for humans to interact with artificial intelligence. Specifically, we also release a large Speech Instruction Following dataset LLaSM-Audio-Instructions. Code and demo are available at https://github.com/LinkSoul-AI/LLaSM and https://huggingface.co/spaces/LinkSoul/LLaSM. The LLaSM-Audio-Instructions dataset is available at https://huggingface.co/datasets/LinkSoul/LLaSM-Audio-Instructions.
연구 동기 및 목표
- 자연스럽고 다중모달 대화에서의 말하는 지시어를 이해하고 응답할 수 있는 일반 목적의 AI 어시스턴트 개발
- 특히 다국어 환경에서의 대규모 오픈소스 음성-텍스트 지시어 수행 데이터셋의 부족 문제 해결
- 자동 음성 인식(ASR)을 전처리 단계로 활용하지 않고도 음성 입력을 엔드 투 엔드로 처리할 수 있도록 설계
- 중국어와 영어 모두에서 직접적이고 자연스럽고 효율적인 음성 기반 소통을 지원함으로써 인간-AI 상호작용 향상
- 사전 훈련된 구성요소(Whisper, LLaMA)를 활용하고 최소한의 미세조정을 통해 자원 효율적인 프레임워크 구축
제안 방법
- 동결된 Whisper 인코더로부터의 음성 임베딩과 동결된 LLaMA 모델의 텍스트 임베딩을 정렬하기 위해 모달리티 어댑터를 훈련
- 음성 및 텍스트 임베딩을 번갈아 가며 배열된 시퀀스로 결합하고, LLM에 의해 감독 미세조정 수행
- 훈련은 두 단계로 진행됨: 공개된 ASR 데이터셋을 사용한 모달리티 적응 사전 훈련 → 음성-텍스트 지시어 데이터에 대한 다중모달 지시어 훈련
- LLaSM-Audio-Instructions 데이터셋은 고품질의 언어 전용 지시어 데이터를 필터링하고, 텍스트에서 음성으로 변환하는 TTS 기술을 활용해 생성됨
- 지시어 훈련 동안 음성 인코더는 동결된 채로 유지하고, 모달리티 어댑터 및 LLM 파라미터만 업데이트함으로써 엔드 투 엔드로 미세조정
- 다중모달 시퀀스에서 원시 음성 신호를 직접 처리함으로써 ASR 파이프라인에서 발생하는 정보 손실을 방지
실험 결과
연구 질문
- RQ1음성에서 텍스트로의 변환 없이도 대규모 언어 모델이 말하는 지시어를 효과적으로 이해하고 응답할 수 있는가?
- RQ2모달리티 어댑터는 사전 훈련된 음성 및 텍스트 임베딩을 다중모달 지시어 수행을 위해 얼마나 효과적으로 정렬할 수 있는가?
- RQ3대규모 다국어 음성-텍스트 지시어 데이터셋은 다중모달 LLM의 성능에 어떤 영향을 미치는가?
- RQ4동결된 인코더와 경량 어댑터를 사용한 자원 효율적인 훈련 전략이 음성-언어 지시어 수행에서 강력한 성능을 달성할 수 있는가?
- RQ5특히 자원이 제한된 환경인 중국어와 같은 상황에서 모델의 일반화 능력은 어떠한가?
주요 결과
- LLaSM은 중간 단계로 ASR를 필요로 하지 않고도 직접 음성-언어 지시어 수행을 달성하여 오류 전파와 정보 손실을 줄였다.
- 모델은 뛰어난 双어 능력을 보이며, 높은 유창성과 관련성으로 중국어 및 영어 음성 입력 모두를 지원한다.
- LLaSM-Audio-Instructions 데이터셋은 199만 개의 대화와 508만 개의 샘플을 포함하여, 현재까지 알려진 가장 큰 오픈소스 중국어 및 영어 음성-텍스트 지시어 수행 데이터셋이다.
- 모달리티 적응 사전 훈련과 지시어 훈련을 순차적으로 수행하는 이중 단계 훈련 전략은 최소한의 계산 비용으로 효율적인 파라미터 업데이트를 가능하게 한다.
- 모델는 제로샷 및 패트치샷 설정에서 뛰어난 성능을 보이며, 다양한 음성 및 언어 지시어에 대한 강력한 일반화 능력을 입증한다.
- 동결된 Whisper 인코더와 미세조정된 모달리티 어댑터 및 LLM의 통합은 최소한의 재훈련으로도 고품질의 엔드 투 엔드 다중모달 이해를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.