[논문 리뷰] Configurable Foundation Models: Building LLMs from a Modular Perspective
이 논문은 사전 훈련 중에 나타나는 기능적 뉴런 분할('브릭'이라 함) 또는 사후 훈련 시 맞춤형으로 설정된 브릭을 사용하여 대규모 언어 모델(Large Language Models, LLMs)을 구성하는 모듈러 프레임워크인 구성 가능한 기초 모델(Configurable Foundation Models, CFMs)을 소개한다. 라우팅, 병합, 업데이트, 확장과 같은 동적 연산을 가능하게 함으로써 CFMs는 계산 효율성, 확장성, 유연성을 달성하며, Llama-3-8B 및 Mistral-7B 모델의 전방향 네트워크(FFN) 레이어에서의 기능 특화 기능이 실증적으로 입증된다.
Advancements in LLMs have recently unveiled challenges tied to computational efficiency and continual scalability due to their requirements of huge parameters, making the applications and evolution of these models on devices with limited computation resources and scenarios requiring various abilities increasingly cumbersome. Inspired by modularity within the human brain, there is a growing tendency to decompose LLMs into numerous functional modules, allowing for inference with part of modules and dynamic assembly of modules to tackle complex tasks, such as mixture-of-experts. To highlight the inherent efficiency and composability of the modular approach, we coin the term brick to represent each functional module, designating the modularized structure as configurable foundation models. In this paper, we offer a comprehensive overview and investigation of the construction, utilization, and limitation of configurable foundation models. We first formalize modules into emergent bricks - functional neuron partitions that emerge during the pre-training phase, and customized bricks - bricks constructed via additional post-training to improve the capabilities and knowledge of LLMs. Based on diverse functional bricks, we further present four brick-oriented operations: retrieval and routing, merging, updating, and growing. These operations allow for dynamic configuration of LLMs based on instructions to handle complex tasks. To verify our perspective, we conduct an empirical analysis on widely-used LLMs. We find that the FFN layers follow modular patterns with functional specialization of neurons and functional neuron partitions. Finally, we highlight several open issues and directions for future research. Overall, this paper aims to offer a fresh modular perspective on existing LLM research and inspire the future creation of more efficient and scalable foundational models.
연구 동기 및 목표
- 자원 제약 조건과 다중 도메인 환경에서 단일 모듈형 대규모 언어 모델(LLMs)의 계산 비효율성과 확장성 문제를 해결한다.
- 엣지 디바이스에 배포하거나 지속적으로 변화하는 다양한 응용 시나리오에 적응하는 데 한계가 있는 정적이고 전체 파rameter를 사용하는 LLMs의 한계를 극복한다.
- 기능적 뉴런 분할(브릭)과 구성 가능한 연산 기반의 모듈러 아키텍처를 통해 효율적이고 동적이고 조합 가능한 LLMs를 가능하게 한다.
- 지속 가능한 모델 진화를 위해 재사용 가능하고 추적 가능하며 업데이트 가능한 기능적 구성 요소로 LLMs를 분해하는 것의 가능성과 이점을 탐색한다.
- 기초 모델에 대한 체계적인 모듈러적 시각을 통해 향후 확장성 있고 효율적이며 상호운용 가능한 인공지능 시스템에 대한 연구 기반을 마련한다.
제안 방법
- 기능적 모듈로 '브릭'을 도입: 사전 훈련 중에 파라미터 차이가 발생함으로써 나타나는 잠재적 브릭과, 사후 훈련을 통해 특정 기능을 향상시키기 위해 만든 맞춤형 브릭을 정의한다.
- 네 가지 핵심 연산 정의: (1) 지시에 기반해 관련 브릭을 라우팅하고 검색하는 것, (2) 파라미터 평균화 또는 스티칭을 통해 병합하여 복합 작업을 수행하는 것, (3) 피지테이닝 또는 주입을 통해 브릭을 업데이트하는 것, (4) 사전 또는 사후 훈련 중에 브릭을 확장하여 모델 용량을 늘리는 것.
- 브릭의 세분성 수준을 다섯 단계로 정형화: 고립 뉴런, 뉴런 그룹, 레이어, 전체 모델, 하이브리드로, 작업 요구에 따라 탄력적인 구성이 가능하도록 한다.
- Llama-3-8B-Instruct 및 Mistral-7B-Instruct-v0.3에 대한 실증 분석을 수행하여, 전방향 네트워크(FFN) 레이어에서의 희박한 활성화, 기능 집중도, 특화 정도를 측정한다.
- 내재 차원 분석을 활용해 LLM의 표현 능력을 평가하고, 기능적 뉴런 분할의 존재를 검증한다.
- 모델 수준의 브릭을 활용한 다중 모델 협업 프레임워크를 제안하며, 통합된 중간 표현 또는 중간 다리 역할을 하는 모델을 통해 효율적인 모델 간 통신을 가능하게 한다.

실험 결과
연구 질문
- RQ1사전 훈련된 LLM의 뉴런 수준 파라미터에서 기능 특화 현상이 관찰될 수 있는가, 특히 FFN 레이어에서?
- RQ2사전 훈련 과정에서 나타나는 잠재적 브릭—기능적으로 특화된 뉴런 분할—는 어떻게 형성되며, 그들의 기능은 후행 작업 능력과 어떤 관계가 있는가?
- RQ3재난적 기억 상실 없이, 맞춤형 브릭을 효과적으로 통합하고 업데이트할 수 있는 정도는 어느 정도인가?
- RQ4복잡하고 다양한 지시를 처리하기 위해 동적으로 모듈러 LLM을 구성하는 데 가장 효과적이고 효율적인 연산(예: 라우팅, 병합, 확장)은 무엇인가?
- RQ5모델 수준의 브릭을 구성 요소로 사용하여 확장성 있고 상호운용적이며 통신 효율적인 다중 모델 시스템을 어떻게 설계할 수 있는가?
주요 결과
- 실증 분석 결과, Llama-3-8B-Instruct 및 Mistral-7B-Instruct-v0.3의 FFN 레이어에서 강력한 기능 특화 현상이 관찰되며, 뉴런들이 고유한 기능 분할로 군집화되어 있음을 확인하였다.
- FFN 레이어의 희박한 활성화 패턴은 입력 당 일부 뉴런만 활성화됨을 시사하며, 이는 모듈러리티 가설을 지지한다.
- 잠재적 브릭은 기능 집중도를 보이며, 특정 뉴런들이 일관되게 특정 작업이나 개념에 대해 활성화됨으로써 사전 훈련된 LLM 내에 내재된 모듈러리티를 시사한다.
- 사용자 지정 브릭—예를 들어 작업 특화, 지식 증강, 다중 모odal 특화 모듈—은 사후 훈련을 통해 효과적으로 생성되며, 모델에 통합될 수 있다.
- 제안된 연산(라우팅, 병합, 업데이트, 확장)을 통해 LLM은 동적으로 구성 가능해지며, 관련 브릭만 조립하여 복잡한 지시에 적응할 수 있다.
- 모듈러 아키텍처는 계산 효율성, 파라미터 재사용성, 추적 가능성을 제공하며, 분산 및 확장 가능한 추론 및 지속적 학습에 잠재적 적용 가능성이 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.