[논문 리뷰] SwitchGPT: Adapting Large Language Models for Non-Text Outputs
SwitchGPT는 텍스트 기반 대규모 언어 모델(LM)이 이미지 및 오디오와 같은 비텍스트 출력을 생성하도록 적응시키기 위해 최소한의 모odal-일치 지침 튜닝을 통해 의도한 출력 모달리티를 인식하도록 지시하는 새로운 방법을 제안한다. 이는 LLM이 사전 훈련된 모달리티 변환 모델에 지시를 라우팅하는 지능적인 제어기로 작용할 수 있게 하여, 다중 모달 전훈이나 복잡한 미세조정 없이도 높은 정확도와 우수한 프롬프트 품질을 달성하게 한다.
Large Language Models (LLMs), primarily trained on text-based datasets, exhibit exceptional proficiencies in understanding and executing complex linguistic instructions via text outputs. However, they falter when requests to generate non-text ones. Concurrently, modality conversion models, such as text-to-image, despite generating high-quality images, suffer from a lack of extensive textual pretraining. As a result, these models are only capable of accommodating specific image descriptions rather than comprehending more complex instructions. To bridge this gap, we propose a novel approach, \methodname, from a modality conversion perspective that evolves a text-based LLM into a multi-modal one. We specifically employ a minimal dataset to instruct LLMs to recognize the intended output modality as directed by the instructions. Consequently, the adapted LLM can effectively summon various off-the-shelf modality conversion models from the model zoos to generate non-text responses. This circumvents the necessity for complicated pretraining that typically requires immense quantities of paired multi-modal data, while simultaneously inheriting the extensive knowledge of LLMs and the ability of high-quality generative models. To evaluate and compare the adapted multi-modal LLM with its traditional counterparts, we have constructed a multi-modal instruction benchmark that solicits diverse modality outputs. The experiment results reveal that, with minimal training, LLMs can be conveniently adapted to comprehend requests for non-text responses, thus achieving higher flexibility in multi-modal scenarios. Code and data will be made available at https://github.com/xinke-wang/SwitchGPT.
연구 동기 및 목표
- 텍스트 기반 LLM이 이미지 및 오디오와 같은 비텍스트 출력을 생성하는 데에 한계가 있다는 문제를 해결하기 위해.
- LLM의 추론 및 일반 지식 이해 능력에 빈도가 있는 모달리티 변환 모델의 지식 격차를 극복하기 위해.
- 지시의 의도에 따라 적절한 오프더셀프 모달리티 변환 모델을 선택하고 호출할 수 있도록 LLM이 지능적인 조율자로 작동하도록 하기 위해.
- 고지연 및 불안정성 문제를 겪는 기존의 LLM-기반 제어기 프레임워크에 대한 계산적으로 효율적인 대안을 개발하기 위해.
- 다양한 출력 모달리티를 가진 LLM에서의 다중 모달 지시 수행 평가를 위한 벤치마크를 수립하기 위해.
제안 방법
- LLM이 최소한의 데이터셋으로 훈련되어 지시에서 의도한 출력 모달리티를 인식할 수 있도록 하는 모달리티 일치 지시 튜닝 단계를 도입한다.
- 각 지시를 특정 모달리티(텍스트, 이미지, 오디오)에 매핑하고 해당 출력과 쌍을 이루어 LLM이 모달리티별 응답 패턴을 학습할 수 있도록 한다.
- 적응된 LLM을 제어기로 사용하여 예측된 모달리티에 따라 사전 훈련된 오프더셀프 모달리티 변환 모델(예: 이미지의 경우 Stable Diffusion, 오디오의 경우 TTS)을 호출한다.
- LLM의 추론 및 지식 능력을 활용하여 모달리티별 모델에 적합한 고품질 프롬프트를 생성함으로써 생성 품질을 향상시킨다.
- 쌍화된 데이터에 대한 복잡한 다중 모달 전훈 또는 종단 간 미세조정을 피하기 위해 표준 지시 튜닝을 사용해 LLM을 훈련한다.
- 표준 언어 벤치마크에서 성능을 유지함으로써 LLM의 추론 및 텍스트 생성 능력이 그대로 유지되도록 보장한다.

실험 결과
연구 질문
- RQ1비텍스트 데이터에 직접 노출되지 않은 텍스트 기반 LLM이 비텍스트 출력을 효과적으로 이해하고 생성하도록 적응시킬 수 있는가?
- RQ2최소한의 지시 튜닝 접근법이 자연어 지시에서 의도한 출력 모달리티를 정확히 식별하는 데 얼마나 효과적인가?
- RQ3사전 훈련된 모달리티 변환 모델을 제어기로 사용하는 LLM이 직접 프롬프팅이나 블랙박스 LLM 제어 방식보다 모달리티 정확도와 출력 품질 측면에서 뛰어나게 성능을 내는가?
- RQ4모달리티 일치 지시 튜닝이 LLM의 원래 언어 이해 및 추론 능력을 어느 정도 유지하는가?
- RQ5제시된 방법이 훈련 분포를 초월한 다양한, 복잡하고 대화형 지시에도 일반화 가능한가?
주요 결과
- SwitchGPT는 상태의 모달리티 정확도를 기록하여 GPT-3.5-turbo와 동일한 성능을 달성하고, HuggingGPT 및 LLM-grounded Diffusion를 포함한 모든 다른 방법을 능가한다.
- OPT-6.7B는 비텍스트 출력을 생성하지 못하고 텍스트로 대체하는 바람에, 적절한 지시 튜닝의 중요성을 부각시킨다.
- SwitchGPT는 모든 방법 중에서 가장 높은 CLIP 점수를 기록하여 이미지 생성 모델에 대한 프롬프트 품질이 뛰어나다는 것을 시사한다.
- LLM은 표준 언어 벤치마크에서 Llama2-7B와 유사한 정확도를 유지하여 강력한 언어 이해 능력을 유지하고 있음을 보여준다.
- 정성적 결과에서는 SwitchGPT가 다양한 대화형 입력을 정확히 해석하고, 훈련 예제와 다를 경우에도 적절한 다중 모달 응답을 생성하는 것으로 나타났다.
- 이 방법은 다중 모달 생성을 위해 다중 모달 전훈이나 쌍화된 데이터에 대한 접근 없이도 효과적이고 저비용으로 LLM을 적응시킬 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.