[논문 리뷰] CharacterGLM: Customizing Chinese Conversational AI Characters with Large Language Models
CharacterGLM는 ChatGLM 기반으로 구축된 중국어 대화형 AI 모델 패밀리(6B에서 66B 파라미터)를 소개하며, 캐릭터 속성과 행동을 설정하여 맞춤형, 성격 기반 대화를 가능하게 한다. 이는 장기 대화에서 특히 일관성, 인간다움, 참여도 면에서 주요 비공개 모델인 GPT-3.5를 능가하며, 연구 커뮤니티가 사용할 수 있도록 6B 모델과 훈련 데이터를 공개한다.
In this paper, we present CharacterGLM, a series of models built upon ChatGLM, with model sizes ranging from 6B to 66B parameters. Our CharacterGLM is designed for generating Character-based Dialogues (CharacterDial), which aims to equip a conversational AI system with character customization for satisfying people's inherent social desires and emotional needs. On top of CharacterGLM, we can customize various AI characters or social agents by configuring their attributes (identities, interests, viewpoints, experiences, achievements, social relationships, etc.) and behaviors (linguistic features, emotional expressions, interaction patterns, etc.). Our model outperforms most mainstream close-source large langauge models, including the GPT series, especially in terms of consistency, human-likeness, and engagement according to manual evaluations. We will release our 6B version of CharacterGLM and a subset of training data to facilitate further research development in the direction of character-based dialogue generation.
연구 동기 및 목표
- 기존 LLM이 사회적 상호작용에서 장기적 일관성과 정서적 깊이가 부족한 문제를 해결하기 위해.
- 개인정보(정체성, 관심사, 견해 등)와 행동(언어 스타일, 정서 표현 방식 등)을 설정 가능한 방식으로 AI 캐릭터를 세밀하게 커스터마이징할 수 있도록 하기 위해.
- 개인화된 AI 캐릭터와 지속적이고 매력적이며 인간다운 다중 라운드 대화를 지원하는 시스템을 개발하기 위해.
- 복잡하고 다차원적인 캐릭터 성격을 포괄하기 위해 프롬프트 튜닝과 성격 기반 대화의 한계를 극복하기 위해.
- 향후 연구를 촉진하기 위해 커뮤니티가 접근할 수 있는 6B 파라미터 모델과 훈련 데이터를 공개하기 위해.
제안 방법
- ChatGLM 기반으로 6B에서 66B 파라미터까지 다양한 대규모 언어 모델을 미세조정하여 캐릭터 기반 대화(CharacterDial)를 지원한다.
- 정체성, 관심사, 경험, 업적, 사회적 관계 등 캐릭터 속성을 인코딩하는 구조화된 프로필 시스템을 설계한다.
- 응답 생성 시 언어적 특징, 정서 표현 패tern, 상호작용 스타일을 통한 행동 제어를 통합한다.
- 모델 훈련을 위해 프로필이 주석 처리된 다양한 캐릭터를 포함한 대규모 다중 라운드 대화 데이터셋을 구축한다.
- 지시 훈련과 선호도 최적화 기법을 적용하여 모델 출력이 원하는 캐릭터 행동과 사용자 참여도에 부합하도록 정렬한다.
- 10명의 평가자들이 참여한 인간 평가를 통해 CharacterGLM를 GPT-3.5 및 MiniMax와 비교하여 일관성, 인간다움, 참여도를 평가한다.

실험 결과
연구 질문
- RQ1주류 비공개 모델 대비 미세조정된 LLM 패밀리가 장기적, 캐릭터 기반 대화에서 더 뛰어난 일관성과 참여도를 달성할 수 있는가?
- RQ2프로필 기반 커스터마이징이 장기적인 대화 동안 일관되고 고유한 캐릭터 목소리를 유지하는 데 얼마나 효과적인가?
- RQ3설정 가능한 속성과 행동 패턴이 AI 응답의 인간다움과 정서적 진실성에 얼마나 기여하는가?
- RQ4사람들이 일반적으로 더 긴 응답을 선호하는 바이어스가 있음에도 불구하고, 모델이 짧은 응답을 생성할 때 성능을 유지하는가?
- RQ5공개된 6B 파라미터 모델이 향후 캐릭터 기반 대화 분야 연구의 강력한 기초 모델이 될 수 있는가?
주요 결과
- CharacterGLM-66B는 일관성, 인간다움, 참여도의 세 가지 평가 차원에서 GPT-3.5를 모두 능가하며, 10명의 평가자 평균 기준으로 전체 선호도에서 평균 5%의 우위를 확보했다.
- 사람들이 일반적으로 더 긴 응답을 선호하는 바이어스가 있음에도 불구하고, 짧은 응답 생성 시에도 강건한 성능 유지를 보이며 길이 변화에 대한 저항력을 입증했다.
- 쌍대 비교 평가에서 CharacterGLM-66B는 일관성 분야에서 49%, 인간다움에서 48%, 참여도에서 49%의 승률을 기록했으며, 전체 선호도에서 +5%의 순우도를 확보했다.
- 6B 버전의 CharacterGLM와 일부 훈련 데이터가 공개되어 캐릭터 기반 대화 분야의 오픈 연구 및 모델 미세조정를 지원한다.
- MiniMax는 평균적으로 더 긴 응답을 생성했지만, CharacterGLM-66B는 여전히 유사하거나 더 높은 선호도 점수를 확보하여 단위 토큰당 높은 품질을 입증했다.
- 본 연구는 장기 기억, 자기 인식, 캐릭터 사회 상호작용, 인지 과정 모델링를 향후 AI 캐릭터 개발의 핵심 과제로 규명했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.