[논문 리뷰] CAMEL: Communicative Agents for "Mind" Exploration of Large Language Model Society
논문은 CAMEL을 소개하며, inception prompting으로 자율적 다중 에이전트 협업을 가능하게 하는 협력적 롤플레이 프레임워크를 제안하고, 대규모 대화형 데이터세트를 생성하며, CAMEL 기반 솔루션이 다수의 평가에서 단일 샷 baselines를 능가함을 보인다.
The rapid advancement of chat-based language models has led to remarkable progress in complex task-solving. However, their success heavily relies on human input to guide the conversation, which can be challenging and time-consuming. This paper explores the potential of building scalable techniques to facilitate autonomous cooperation among communicative agents, and provides insight into their "cognitive" processes. To address the challenges of achieving autonomous cooperation, we propose a novel communicative agent framework named role-playing. Our approach involves using inception prompting to guide chat agents toward task completion while maintaining consistency with human intentions. We showcase how role-playing can be used to generate conversational data for studying the behaviors and capabilities of a society of agents, providing a valuable resource for investigating conversational language models. In particular, we conduct comprehensive studies on instruction-following cooperation in multi-agent settings. Our contributions include introducing a novel communicative agent framework, offering a scalable approach for studying the cooperative behaviors and capabilities of multi-agent systems, and open-sourcing our library to support research on communicative agents and beyond: https://github.com/camel-ai/camel.
연구 동기 및 목표
- 소통 가능한 에이전트들 간의 자율적 협력을 위한 확장 가능한 프레임워크를 개발하여 최소한의 인간 입력으로 복합 과제를 완수한다.
- 역할 놀이 및 데이터 생성을 통해 에이전트 사회의 행동과 능력을 연구한다.
- 협력형 AI, 정렬, 다에이전트 시스템 연구를 가능하게 하는 데이터세트와 오픈 소스 도구를 제공한다.
- 프레임워크가 생성한 데이터세트 스트림으로 모델을 미세조정할 때 LLM의 능력 발현이 어떻게 나타나는지 조사한다.
제안 방법
- AI 어시스턴트와 사용자가 서로 구별되는 역할을 부여받고 특정 작업을 완수하기 위해 협업하는 롤플레이 프레임워크를 도입한다.
- 초기에는 작업 명세와 롤 프롬프트를 생성하기 위해 Inception Prompting을 사용하고, 그 후 자율적인 AI–AI 대화를 수행한다.
- 제안에 대한 비판자-루프를 도입하여 제안을 안내하고 트리 탐색과 같은 의사결정을 시뮬레이션한다.
- 대규모 대화형 데이터세트(AI Society, Code)와 단일 턴 QA 데이터세트(Math, Science)를 생성하여 분석 및 정렬 연구에 활용한다.
- 휴먼 및 GPT-4 평가를 사용하여 단일 샷 baselines에 대한 에이전트 성능을 평가한다.
- 생성된 데이터세트에 대해 LLaMA-7B를 점진적으로 미세조정하여 도메인 간 지식 등장 여부를 연구한다.
실험 결과
연구 질문
- RQ1자동 협력 에이전트가 롤플레이 프레임워크를 사용하여 최소한의 인간 입력으로 복합 과제를 완수할 수 있는가?
- RQ2다중 에이전트 협력에서 발생하는 도전과제(예: 역할 뒤집힘, 반복, flaky 응답, 무한 루프)는 무엇이며 어떻게 완화할 수 있는가?
- RQ3CAMEL이 생성한 데이터세트가 이후 모델의 미세조정에서 도메인 지식의 발현을 촉진하는가?
- RQ4협력적 다에이전트 솔루션이 지시 준수 과제에서 단일 샷 LLM baselines를 능가하는가?
- RQ5자율적 커뮤니케이션 에이전트가 사회적 맥락에서 직면하는 윤리적·정렬 고려사항은 무엇인가?
주요 결과
- CAMEL이 생성한 솔루션은 AI Society 과제에서 사람 평가 및 GPT-4 평가 모두에서 단일 샷 솔루션보다 우수함.
- 프레임워크는 대규모 데이터 생성(AI Society, Code)과 다도메인 발현(Math, Science)을 가능하게 하며, 이를 통해 LLaMA-7B를 미세조정할 때 지식을 확산시킨다.
- 사람 평가자와 GPT-4 평가가 CAMEL의 단일 샷 baselines에 대한 우월성에 대체로 일치한다.
- 다양한 데이터세트가 도메인 간 지식 발현과 진전된 성능을 촉진하며, 점진적 미세조정 과정에서 이를 강화한다.
- 이 접근법은 협력적 AI 연구를 지원하기 위한 모듈형 에이전트, 프롬프트, 데이터 탐색기를 포함한 공개 라이브러리를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.