[논문 리뷰] SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
이 논문은 개인 및 그룹 수준에서 역할 수행 대화형 에이전트의 사회지능을 체계적으로 평가할 수 있는 최초의 벤치마크인 RoleInteract를 소개한다. 개인 상호작용에 능숙한 에이전트들이 복잡한 그룹 역학 하에서 성능이 떨어지며, 사회적 선호도의 이탈과 기억 성능 저하가 발생함을 드러낸다.
Large language models (LLMs) have advanced the development of various AI conversational agents, including role-playing conversational agents that mimic diverse characters and human behaviors. While prior research has predominantly focused on enhancing the conversational capability, role-specific knowledge, and stylistic attributes of these agents, there has been a noticeable gap in assessing their social intelligence. In this paper, we introduce SocialBench, the first benchmark designed to systematically evaluate the sociality of role-playing conversational agents at both individual and group levels of social interactions. The benchmark is constructed from a variety of sources and covers a wide range of 500 characters and over 6,000 question prompts and 30,800 multi-turn role-playing utterances. We conduct comprehensive evaluations on this benchmark using mainstream open-source and closed-source LLMs. We find that agents excelling in individual level does not imply their proficiency in group level. Moreover, the behavior of individuals may drift as a result of the influence exerted by other agents within the group. Experimental results on SocialBench confirm its significance as a testbed for assessing the social interaction of role-playing conversational agents. The benchmark is publicly accessible at https://github.com/X-PLUG/SocialBench.
연구 동기 및 목표
- 역할 수행 대화형 에이전트의 사회지능에 대한 체계적인 평가 부족 문제를 해결하기 위해.
- 개인 및 그룹 수준의 사회적 상호작용 능력을 모두 반영하는 벤치마크를 설계하기 위해.
- LLM 기반 에이전트가 동적인 그룹 영향을 받는 상황에서 사회적 선호도와 기억을 어떻게 유지하는지 측정하기 위해.
- LLM 기반 에이전트에서 개인 수준과 그룹 수준의 사회적 행동 간 성능 격차를 규명하기 위해.
제안 방법
- 영문 및 중문 서적, 영화, 소설 등 다양한 출처에서 데이터를 수집하여 RoleInteract를 구축하였으며, 총 500자 및 6,000개의 질문 프롬프트를 포함한다.
- 3단계 파이프라인을 활용: (1) 웹 자료에서 역할 프로필을 수집하고, (2) GPT-4를 활용해 대화 장면과 다중 선택 질문을 추출하며, (3) 품질 제어를 위해 사전 처리 및 인간 검증을 수행한다.
- 개인 수준의 사회성 평가를 위한 평가 과제를 설계: 역할 기술서에 대한 자기 인식, 환경의 감정 인식, 장기 기억, 그룹 역학 속의 사회적 선호도.
- 자동화된 메트릭과 인간 애너테이션 검증을 통해 10종의 주요 오픈소스 및 클로즈드소스 LLM을 개인 및 그룹 수준의 과제에서 평가한다.
- 그룹 복잡성(멤버 수)과 극성(긍정, 중립, 부정)에 따른 성능 추세를 분석한다.
- 장기 대화(80턴 이상) 동안 기억 퇴화를 추적하고, 그룹 역학에 따른 선호도 이탈을 측정한다.

실험 결과
연구 질문
- RQ1역할 수행 에이전트는 자아 인식, 감정 인식, 장기 기억 등의 개인 수준 사회 과제에서 어떻게 성과를 내는가?
- RQ2그룹 역학이 역할 수행 에이전트의 사회적 행동과 일관성에 어느 정도 영향을 미치는가?
- RQ3간단한 그룹 상호작용에서의 전문성은 복잡한 그룹 설정에서의 성능을 예측할 수 있는가?
- RQ4다양한 사회적 선호도(긍정, 중립, 부정)가 그룹 극성에 따라 에이전트 행동에 어떤 영향을 미치는가?
- RQ5장기적이거나 복잡한 사회적 상호작용에서 에이전트가 선호도 이탈 또는 기억 저하를 얼마나 겪는가?
주요 결과
- 개인 수준 사회 과제에서 뛰어난 성능을 보이는 에이전트가 반드시 그룹 수준 상호작용에서도 뛰어나지 않으며, 이는 집단적 사회지능 격차를 시사한다.
- 긴 대화에서 성능 저하가 심각하게 발생함: 기억 능력이 80턴 이상을 넘어서면著저하되며, 특히 GPT-3.5-Turbo 및 CharGLM-3와 같은 모델에서 두드러진다.
- 그룹 복잡성이 증가할수록(멤버 수 증가) 모든 에이전트가 성능 저하를 보이며, 이는 복잡한 그룹 역학을 다루는 것이 여전히 주요 과제임을 시사한다.
- 중립 또는 부정적 사회적 선호도를 가진 에이전트는 극성이 반대되는 그룹에 배치될 경우 선호도 이탈이 발생하여 설계된 행동에서 벗어나기 쉬운 경향이 있다.
- 긍정적 사회적 선호도를 가진 에이전트는 그룹 극성 변화에 강건하며, 특히 부정적 극성 그룹에서도 일관된 성능을 보이며, 사회적 촉진 효과를 보임을 시사한다.
- Xingchen-Plus 및 Minimax-abab6-chat과 같은 모델은 다단계 역할 수행 데이터로 미세조정된 덕분에 일반 목적 모델 대비 복잡한 그룹 역학에서 더 강건한 성능을 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.