[논문 리뷰] Adapting LLM Agents with Universal Feedback in Communication
이 논문은 LLM 에이전트가 환경 및 다른 에이전트와의 반복적 상호작용을 통해 새로운 작업에 지속적으로 적응할 수 있도록 하는 새로운 훈련 패러다임인 학습을 통한 의사소통(Learning through Communication, LTC)을 제안한다. 구조화된 의사소통 패턴—단일화자, 대화, 유사성—을 활용하고 수집된 궤적을 기반으로 PPO로 미세조정함으로써, 결정 내리기, 지식 집약적 추론, 수치 추론 등 다양한 작업에서 성능을 향상시킨다. 이는 지시 미세조정 기반 베이스라인 대비 성공률에서 최대 12% 향상되고 추론 프롬프트 길이가 85% 이상 감소함으로써 기록한다.
Recent advances in large language models (LLMs) have demonstrated potential for LLM agents. To facilitate the training for these agents with both linguistic feedback and non-linguistic reward signals, we introduce Learning through Communication (LTC). We design a universal buffer to store all the feedback, and an iterative pipeline to enable an LLM agent to explore and update its policy in an given environment. To optimize agent interactions for task-specific learning with our universal buffer and pipeline, we introduce diverse communication patterns tailored for both single-agent and multi-agent environments. We evaluate the efficacy of our LTC approach on four diverse datasets: ALFWorld (single-agent), HotpotQA (multi-agent collaboration), Chameleon (multi-agent competition), and GSM8k (multi-agent teacher-student). On these data sets, LTC outperforms the supervised instruction fine-tuning baselines by 3.6% to 12%. These results highlight the versatility and efficiency of LTC in facilitating online adaptation for LLM agents.
연구 동기 및 목표
- 최소한의 인간 감독으로 LLM 에이전트를 새로운 작업에 적응시키는 데 도전하는 것.
- 반복적 상호작용과 피드백을 통해 지속적이고 자기 향상되는 적응을 가능하게 하는 것.
- 추론 중에 장기간 수작업으로 작성된 few-shot 프롬프트에 의존도를 줄이는 것.
- 효과적인 훈련을 위해 다양한 구조화된 피드백을 생성하는 작업별 의사소통 패턴을 설계하는 것.
- 다양한 추론 및 의사결정 작업 전반에 걸쳐 LTC 패러다임의 효과성과 효율성을 입증하는 것.
제안 방법
- LTC 패러다임은 탐색 단계와 훈련 단계를 번갈아 가며 수행하는 반복적 파이프라인을 사용한다.
- 탐색 단계 동안 에이전트는 세 가지 구조화된 의사소통 패턴을 사용하여 환경 및 다른 에이전트와 상호작용한다: 단일화자(자기 대화), 대화(다중 에이전트 상호작용), 유사성(선생 모델이 생성한 예시로부터 학습).
- 상호작용 궤적과 피드백(예: 보상, 오류 메시지)은 통합된 리PLAY 버퍼에 저장되며, 토큰 수준의 마스크를 통해 시스템, 에이전트, 다른 에이전트의 출력을 구분한다.
- 훈련 단계에서는 언어 모델링 손실(유창성 확보)과 PPO 손실(보상 기반 정책 최적화)을 조합한 손실을 사용하여 PPO를 적용한다.
- 각 탐색 단계 이후 리PLAY 버퍼가 업데이트되고, 일부 샘플이 훈련에 사용되어 지속적 학습이 가능하다.
- 프레임워크는 각 생성된 토큰을 RL 설정에서 행동으로 간주함으로써 상호작용에서부터 엔드 투 엔드 정책 학습을 가능하게 한다.

실험 결과
연구 질문
- RQ1정적 미세조정 대비 지속적이고 의사소통 기반 학습을 통해 LLM 에이전트가 더 높은 작업 성능을 달성할 수 있는가?
- RQ2다른 의사소통 패턴—단일화자, 대화, 유사성—이 다양한 추론 작업 전반에서 학습 효율성과 성능에 어떤 영향을 미치는가?
- RQ3LTC는 추론 중에 장기간 수작업으로 작성된 few-shot 프롬프트의 필요성을 어느 정도 줄일 수 있는가?
- RQ4LLaMA-7B와 같은 작은 LLM이 LTC를 통해 훈련을 거치면, 지시 미세조정된 더 큰 모델(PaLM-62B 등)을 능가할 수 있는가?
- RQ5환경과 선생 에이전트(GPT-4 등)로부터 온 피드백을 통합할 경우, 에이전트가 복잡한 추론 패턴을 학습하는 데 어떤 영향을 미치는가?
주요 결과
- ALFWorld에서 LTC는 지시 미세조정 기반 베이스라인 대비 성공률에서 최대 12% 향상되었으며, 특히 Pick 2 작업에서 도전적인 성과를 기록했다.
- HotpotQA에서 LTC는 지시 미세조정된 LLaMA-7B 에이전트보다 EM 점수에서 5.1% 향상되었고, 지시 미세조정된 PaLM-62B 모델보다 0.6% 높은 성능을 기록했다.
- GSM8k에서 LTC는 CoT-Tuning 기반 베이스라인 대비 정확도에서 3.6% 향상되었다.
- LTC는 ICL 방법 대비 입력 프롬프트 토큰 수를 85~90% 감소시켰으며, few-shot 프롬프팅에 필요한 토큰의 12.8%에서 10.8%만 사용했다.
- 제거 실험 결과, 구조화된 의사소통 패턴과 PPO 손실을 긍정 및 부정 샘플에 별도로 적용할 경우, 단순한 데이터 샘플링보다 더 빠르고 뚜렷한 성능 향상이 이루어졌다.
- 사례 연구 결과, LTC는 에이전트가 피드백에서 학습하고 선생 모델(GPT-4 등)이 사용하는 간편한 방법을 피할 수 있도록 해, 단순 모방을 넘어서는 강건한 학습이 가능함을 시사했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.