Skip to main content
QUICK REVIEW

[논문 리뷰] Octopus: On-device language model for function calling of software APIs

Wei Chen, Zhiyuan Li|arXiv (Cornell University)|2024. 04. 02.
Business Process Modeling and Analysis인용 수 4
한 줄 요약

이 논문은 30,000개 이상의 소프트웨어 API를 기반으로 흐름 학습, 데이터셋 정제 및 추론 시 새로운 조건부 마스킹 기법을 활용하여 정확도를 향상시킨 온디바이스 2B, 3B, 7B 파라미터 언어 모델인 Octopus를 소개한다. 이로 인해 GPT-4보다도 더 높은 정확도를 달성하면서도 낮은 지연 시간과 형식 정확성을 유지한다.

ABSTRACT

In the rapidly evolving domain of artificial intelligence, Large Language Models (LLMs) play a crucial role due to their advanced text processing and generation abilities. This study introduces a new strategy aimed at harnessing on-device LLMs in invoking software APIs. We meticulously compile a dataset derived from software API documentation and apply fine-tuning to LLMs with capacities of 2B, 3B and 7B parameters, specifically to enhance their proficiency in software API interactions. Our approach concentrates on refining the models' grasp of API structures and syntax, significantly enhancing the accuracy of API function calls. Additionally, we propose extit{conditional masking} techniques to ensure outputs in the desired formats and reduce error rates while maintaining inference speeds. We also propose a novel benchmark designed to evaluate the effectiveness of LLMs in API interactions, establishing a foundation for subsequent research. Octopus, the fine-tuned model, is proved to have better performance than GPT-4 for the software APIs calling. This research aims to advance automated software development and API integration, representing substantial progress in aligning LLM capabilities with the demands of practical software engineering applications.

연구 동기 및 목표

  • GPT-4와 같은 대규모 고비용 모델에 의존하지 않고도, 실시간 소프트웨어 API 호출을 정확히 수행할 수 있는 경량 온디바이스 LLM 개발
  • 특히 매개변수 선택 및 함수 이름 일치 문제에서 발생하는 형식 오류와 환영 현상 문제 해결
  • 조건부 마스킹을 통한 추론 효율성 향상과 출력 신뢰성 확보로 JSON 유사 출력 구조의 정확성 확보
  • 실제 API 상호작용 작업에서 LLM 평가를 위한 새로운 벤치마크 설정
  • 모바일 및 엣지 디바이스에서의 실용적 배포를 가능하게 하기 위해 고도로 정밀한 API 호출 정확도를 갖춘 소형 모델 훈련

제안 방법

  • RapidAPI Hub에서 확보한 30,000개 이상의 소프트웨어 API를 기반으로 한 정제된 데이터셋을 활용해 CodeLlama, Gemma, Stable Code 등의 모델을 2B, 3B, 7B 파라미터로 미세조정
  • 유사한 API 함수 간 혼동을 줄이고 일반화 능력을 향상시키기 위해 흐름 학습 및 음성 샘플링 기법 적용
  • 특히 열거형 매개변수 유형에 대해 구문적 정확성을 확보하기 위해 추론 시 조건부 마스킹 기법 설계
  • 함수 및 매개변수 선택을 안내하기 위해 소수의 예시와 구조화된 입력을 포함한 프롬프트 템플릿 사용
  • 함수 및 인자 예측 정밀도를 극대화하기 위해 추론 시 탐욕적 디코딩 적용
  • 평가를 위해 균형 잡힌 해결 가능/불가능 쿼리와 인간이 애너테이션한 참값을 포함한 새로운 벤치마크 구축

실험 결과

연구 질문

  • RQ1소형 온디바이스 LLM이 실제 소프트웨어 API 함수 호출 작업에서 GPT-4를 능가할 수 있는가?
  • RQ2조건부 마스킹이 LLM 생성 API 호출에서 형식 오류와 환영 현상을 얼마나 효과적으로 줄이는가?
  • RQ3흐름 학습과 데이터셋 정제가 복잡한 API 선택 및 매개변수 생성 작업에서 모델 성능 향상에 얼마나 기여하는가?
  • RQ4소형 LLM이 낮은 추론 지연 시간과 모바일 디바이스에의 구현 가능성을 유지하면서도 고정밀도 API 상호작용을 달성할 수 있는가?
  • RQ5다양하고 실제 세계의 API 데이터셋에 대해 미세조정된 경우, 모델 크기(2B, 3B, 7B)가 API 호출 정확도에 어떤 영향을 미치는가?

주요 결과

  • 제안된 벤치마크에서 Octopus 7B 모델이 GPT-4를 초월해 함수 이름 및 매개변수 예측 정밀도 모두에서 더 높은 정확도를 달성했다.
  • 조건부 마스킹은 특히 열거형 매개변수 유형에서 출력 형식 정확도를 크게 향상시켜 검증 손실은 감소시키면서도 추론 시간은 증가시키지 않았다.
  • 모든 Octopus 모델은 함수 이름 정확도가 거의 완벽했지만, 기준 GPT-4 출력에서는 매개변수 환영 현상이 주요 오류 원인이었다.
  • 조건부 마스킹 기법은 수학적으로 출력 공간을 유효한 형식으로 제약하여 정확도를 증가시킴을 증명했다.
  • Octopus 시리즈의 7B 모델는 GPT-4를 초월하는 높은 정확도를 기록했으며, 더 작은 전용 모델이 더 큰 일반 목적 모델보다 특화된 API 작업에서 승리할 수 있음을 입증했다.
  • 데이터셋과 벤치마크는 오픈소스로 공개되어 향후 온디바이스 LLM의 API 상호작용 연구 기반을 마련했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.