Skip to main content
QUICK REVIEW

[논문 리뷰] Lemur: Harmonizing Natural Language and Code for Language Agents

Yiheng Xu, Hongjin Su|arXiv (Cornell University)|2023. 10. 10.
Topic Modeling인용 수 6
한 줄 요약

Lemur와 Lemur-Chat은 코드 중심의 코퍼스에서 사전 훈련하고 지시어 따르기 위해 미세조정된 오픈소스 언어 모델로, 자연어 및 코드 생성에서 최고 수준의 균형 잡힌 성능을 달성하였다. 이들은 13개의 에이전트 벤치마크에서 기존 오픈소스 모델을 모두 압도하며, 언어와 코드 능력을 조화롭게 통합함으로써 전문가 모델에 가까운 성능을 보이며 에이전트 추론, 도구 사용, 환경 기반 인식 능력에서 격차를 크게 좁혔다.

ABSTRACT

We introduce Lemur and Lemur-Chat, openly accessible language models optimized for both natural language and coding capabilities to serve as the backbone of versatile language agents. The evolution from language chat models to functional language agents demands that models not only master human interaction, reasoning, and planning but also ensure grounding in the relevant environments. This calls for a harmonious blend of language and coding capabilities in the models. Lemur and Lemur-Chat are proposed to address this necessity, demonstrating balanced proficiencies in both domains, unlike existing open-source models that tend to specialize in either. Through meticulous pre-training using a code-intensive corpus and instruction fine-tuning on text and code data, our models achieve state-of-the-art averaged performance across diverse text and coding benchmarks among open-source models. Comprehensive experiments demonstrate Lemur's superiority over existing open-source models and its proficiency across various agent tasks involving human communication, tool usage, and interaction under fully- and partially- observable environments. The harmonization between natural and programming languages enables Lemur-Chat to significantly narrow the gap with proprietary models on agent abilities, providing key insights into developing advanced open-source agents adept at reasoning, planning, and operating seamlessly across environments. https://github.com/OpenLemur/Lemur

연구 동기 및 목표

  • 자연어나 코드에 특화된 오픈소스 LLM의 불균형을 해결하기 위해 언어와 코드 능력이 조화를 이룬 모델을 개발하는 것.
  • 통합된 언어 및 코드 숙련도를 통해 복잡하고 부분 관찰 가능한 환경에서 추론, 계획 수립, 행동 수행이 효과적으로 이루어지도록 언어 에이전트를 지원하는 것.
  • 도구 사용, 환경 피드백, 다단계 계획 수립을 포함한 에이전트 작업에서 오픈소스 모델과 전문가 모델 간의 성능 격차를 줄이는 것.
  • 텍스트 및 코드 벤치마크에서 모두 뛰어난 성능을 보이며 상호작용 가능하고 환경에 기반한 에이전트 행동을 지원하는 기초 모델을 개발하는 것.
  • 웹 상호작용, 로봇공학, 데이터 과학 등 실제 응용 분야에서 활용 가능한 공개 제공 가능한 다용도 언어 모델을 제공하는 것.

제안 방법

  • The Stack에서 유래한 10:1의 텍스트 대 코드 비율을 가진 900억 토큰의 코드 중심 코퍼스에서 사전 훈련하여 코드 생성 능력을 강화하면서도 자연어 품질을 유지하는 것.
  • ~300만 개의 다양한 예제(텍스트 및 코드 작업을 통합)를 활용한 지시어 따르기 미세조정을 통해 지시어 따르기 모델을 구축하고, 이로 인해 Lemur-Chat이 탄생함.
  • 완전 관찰 가능 및 부분 관찰 가능 환경에서 추론, 코드 생성, 도구 사용, 환경 상호작용을 포함하는 포괄적인 에이전트 평가 세트 설계.
  • HumanEval, GSM8K, MMLU, Spider, DS-1000 등 8개의 표준 벤치마크와 WebArena, ALFWorld, InterCode 등을 포함한 13개의 에이전트 전용 벤치마크에서 모델 평가.
  • 공식 벤치마크와 일관된 zero-shot 및 few-shot 프롬프팅 프로토콜을 사용하여 공정하고 재현 가능한 비교 보장.
  • 에이전트 평가에 환경 피드백과 인간 피드백을 통합하여 실제 시나리오에서의 강건성과 적응 능력을 평가하는 것.

실험 결과

연구 질문

  • RQ1단일 오픈소스 언어 모델이 자연어 및 코드 생성 벤치마크에서 모두 최고 수준의 성능을 달성할 수 있는가?
  • RQ2언어와 코드 능력의 조화로움이 복잡한 상호작용 가능한 환경에서의 에이전트 성능을 어떻게 향상시키는가?
  • RQ3오픈소스 모델이 GPT-4와 같은 전문가 모델에 비해 에이전트 추론, 도구 사용, 환경 기반 인식 능력에서 어느 정도 수준까지 따라올 수 있는가?
  • RQ4코드 중심 사전 훈련이 대규모 언어 모델에서 텍스트와 코드 능력의 균형을 어떻게 영향을 미치는가?
  • RQ5균형 잡힌 능력을 지닌 모델은 부분 관찰 가능한 환경에서 반복적인 정보 수집과 계획 수정이 필요한 상황에서 어떻게 대처하는가?

주요 결과

  • Lemur-Chat은 13개의 에이전트 벤치마크 중 12개에서 모든 다른 오픈소스 모델을 압도하며, 실제 시나리오에서 뛰어난 에이전트 능력을 입증하였다.
  • 오픈소스 모델 중에서 8개의 표준 텍스트 및 코드 벤치마크에서 평균 성능이 최고 수준을 기록하여 균형 잡힌 숙련도를 확인하였다.
  • 웹 브라우징 및 OS 상호작용과 같은 도구 사용을 포함한 에이전트 작업에서 Lemur-Chat은 Llama-2-70B-Chat과 같은 모델보다 뚜렷이 뛰어난 성능을 보였으며, 특히 고액션 스페이스 환경에서 두각을 나타냈다.
  • 자연어와 코드 능력의 통합은 Lemur-Chat이 유효하고 실행 가능한 동작을 생성하고 피드백을 통해 오류를 복구할 수 있도록 해주었으며, 프로그래밍 능력이 떨어지는 모델보다 뛰어난 성능을 보였다.
  • Lemur-Chat은 GPT-4와 같은 전문가 모델과의 성능 격차를 에이전트 능력 분야에서, 특히 추론, 계획 수립, 환경 기반 인식에서 크게 줄였다.
  • CTF 및 로봇공학 추론과 같은 다단계 작업에서 모델은 모듈러한 계획 수립과 오류 백트래킹이 필수적인 상황에서 뛰어난 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.