[논문 리뷰] Octopus v2: On-device language model for super agent
Octopus v2는 기능 토큰을 사용한 미세조정을 통해 기능 호출 정확도를 GPT-4 수준으로 끌어올리면서도 지연 시간을 35배 줄이고, 컨텍스트 길이를 95% 감소시킨 2B 파라미터의 디바이스 내 언어 모델을 도입한다. 이 방법은 스마트폰과 같은 엣지 디바이스에서 생산 가능한 저지연 시간 AI 에이전트를 가능하게 하며, RAG를 사용한 GPT-4와 Llama-7B를 모두 성능과 효율성 면에서 능가한다.
Language models have shown effectiveness in a variety of software applications, particularly in tasks related to automatic workflow. These models possess the crucial ability to call functions, which is essential in creating AI agents. Despite the high performance of large-scale language models in cloud environments, they are often associated with concerns over privacy and cost. Current on-device models for function calling face issues with latency and accuracy. Our research presents a new method that empowers an on-device model with 2 billion parameters to surpass the performance of GPT-4 in both accuracy and latency, and decrease the context length by 95\%. When compared to Llama-7B with a RAG-based function calling mechanism, our method enhances latency by 35-fold. This method reduces the latency to levels deemed suitable for deployment across a variety of edge devices in production environments, aligning with the performance requisites for real-world applications.
연구 동기 및 목표
- 작은 디바이스 내 언어 모델을 사용해 고정확도, 저지연 기능 호출을 가능하게 하기 위해.
- GPT-4와 같은 클라우드 기반 LLM의 개인정보 유출 및 비용 문제를 해결하기 위해 스마트폰과 엣지 디바이스에 모델를 로컬로 배포하기 위해.
- 디바이스 내 AI 에이전트의 지연 시간과 컨텍스트 길이를 줄여, 배터리 제약이 있는 실세계 환경에서의 활용 가능성을 높이기 위해.
- 큰 클라우드 기반 모델의 성능을 따라하거나 초월하는 작은 모델을 기능 토큰으로 미세조정할 수 있는 확장 가능한 방법을 개발하기 위해.
- LoRA 어댑터를 통해 응용 프로그램 전용 기능 호출을 가능하게 하되, 전체 재학습 없이도 가능하게 하여 다양한 응용 분야에 효율적으로 배포할 수 있도록 하기 위해.
제안 방법
- Gemma-2B에서 시작하여, 특정 API 또는 기능을 나타내는 특수 토큰인 <nexa_0>에서 <nexa_N-1>까지의 기능 토큰을 사용해 미세조정한다.
- 클래스 불균형 문제를 해결하고 수렴을 향상시키기 위해 특수 기능 토큰에 더 높은 가중치를 적용한 가중치가 부여된 교차 엔트로피 손실 함수를 적용한다.
- 모델 전체의 미세조정과 LoRA(Low-Rank Adaptation)를 비교하였으며, LoRA는 높은 정확도를 유지하면서도 효율적인 응용 프로그램 전용 적응을 가능하게 한다.
- 각 API당 4,000개의 데이터 포인트를 생성하여 병렬적이고 중첩된 기능 호출을 지원함으로써 단일 호출 성능 수준을 유지한다.
- 기능 토큰을 토크나이저와 모델의 어텐션 헤드 양쪽에 통합하여, 자연어 쿼리와 기능 호출 간의 직접적인 매핑을 학습할 수 있도록 한다.
- 긴 기능 설명을 압축된 토큰으로 대체함으로써 컨텍스트 길이를 95% 이상 감소시켜 추론 속도와 효율성을 크게 향상시킨다.
실험 결과
연구 질문
- RQ12B 파라미터의 디바이스 내 언어 모델이 기능 호출 정확도와 지연 시간 면에서 GPT-4 수준에 도달할 수 있는가?
- RQ2기능 토큰을 언어 모델에 효과적으로 통합하여 기능 호출 정확도를 향상시키고 컨텍스트 길이를 줄일 수 있는가?
- RQ3희귀 기능 토큰을 포함한 훈련 시 가중치가 부여된 손실 함수가 수렴과 성능에 미치는 영향은 무엇인가?
- RQ4LoRA 기반의 미세조정이 높은 정확도를 유지하면서도 디바이스 내 AI 에이전트의 효율적이고 응용 프로그램 전용 배포를 가능하게 할 수 있는가?
- RQ5디바이스 내 모델은 RAG 증강 클라우드 모델 대비 추론 지연 시간과 컨텍스트 길이를 얼마나 줄일 수 있는가?
주요 결과
- Octopus v2는 Llama-7B에 RAG를 적용한 경우 대비 지연 시간을 35배 줄이며, GPT-4 수준의 기능 호출 정확도를 달성한다.
- 추론 과정에서 컨텍스트 길이를 95% 이상 감소시켜 스마트폰에서 배터리 충전 한 번에 훨씬 더 많은 기능 호출이 가능해진다.
- iPhone에 배포한 경우, 컨텍스트 길이 감소와 에너지 효율성 덕분에 동일한 7B 모델 대비 37배 더 많은 기능 호출이 가능하다.
- LoRA 미세조정은 정확도를 거의 유지하면서도 전체 재학습 없이도 효율적인 응용 프로그램 전용 적응을 가능하게 한다.
- 가중치가 부여된 교차 엔트로피 손실의 사용은 희귀 기능 토큰을 포함한 훈련 시 수렴을 향상시켜 최종 추론 성능에 영향을 주지 않으면서도 유의미한 개선을 이룬다.
- 이 모델은 이전의 디바이스 내 모델이 지닌 속도와 정확도의 한계를 넘어 생산 가능한 저지연 시간 AI 에이전트를 엣지 디바이스에서 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.