Skip to main content
QUICK REVIEW

[논문 리뷰] SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents

Xuhui Zhou, Hao Zhu|arXiv (Cornell University)|2023. 10. 18.
Topic ModelingComputer Science인용 수 3
한 줄 요약

SOTOPIA는 다양한 목표 지향적 사회적 상황을 통해 언어 에이전트의 사회지능을 평가하기 위한 개방형이고 상호작용적인 환경을 소개한다. 다차원적 SOTOPIA-EVAL 프레임워크를 사용하여 연구는 심각한 사회적 과제에서, 특히 전략적 의사소통, 사회적 공감각, 비밀 유지 측면에서 GPT-4조차도 인간 수준에 못 미친다는 점을 드러내며, 현재의 LLM이 사회지능 추론 능력에서 심각한 격차를 보이고 있음을 시사한다.

ABSTRACT

Humans are social beings; we pursue social goals in our daily interactions, which is a crucial aspect of social intelligence. Yet, AI systems' abilities in this realm remain elusive. We present SOTOPIA, an open-ended environment to simulate complex social interactions between artificial agents and evaluate their social intelligence. In our environment, agents role-play and interact under a wide variety of scenarios; they coordinate, collaborate, exchange, and compete with each other to achieve complex social goals. We simulate the role-play interaction between LLM-based agents and humans within this task space and evaluate their performance with a holistic evaluation framework called SOTOPIA-Eval. With SOTOPIA, we find significant differences between these models in terms of their social intelligence, and we identify a subset of SOTOPIA scenarios, SOTOPIA-hard, that is generally challenging for all models. We find that on this subset, GPT-4 achieves a significantly lower goal completion rate than humans and struggles to exhibit social commonsense reasoning and strategic communication skills. These findings demonstrate SOTOPIA's promise as a general platform for research on evaluating and improving social intelligence in artificial agents.

연구 동기 및 목표

  • 언어 에이전트의 사회지능을 평가하기 위한 일반 도메인의 상호작용 환경를 개발하는 것.
  • AI 에이전트가 복잡한 사회적 목표를 달성하는 데 평가할 수 있는 상호작용적이고 다차원적인 벤치마크의 부족을 해결하는 것.
  • 현재의 LLM에 한계를 드러내는 어려운 사회적 상황을 특정하고 특성화하는 것.
  • 통합적이고 다차원적인 프레임워크를 사용해 LLM과 인간의 성능을 평가하는 것.
  • LLM 기반 평가와 인간 평가 간의 사회지능 지표에서의 일치성 평가

제안 방법

  • SOTOPIA는 랜덤으로 조합된 상황, 목표, 캐릭터, 관계, 에이전트 정책을 통해 다양한 사회적 상호작용 에피소드를 생성한다.
  • LLM 기반 및 인간 참가자 모두 캐릭터를 연기하고, 언어적, 비언어적, 신체적 행동을 통해 다수의 턴에 걸쳐 상호작용한다.
  • SOTOPIA-EVAL은 목표 달성, 지식, 믿음, 비밀, 사회적 규범, 재정, 관계의 일곱 가지 차원에서 에이전트 성능을 평가한다.
  • 인간 평가자가 각 차원에서 에피소드를 평가하고, GPT-4는 평가 자동화를 위해 대체 평가자로 사용된다.
  • 일반 및 어려운 상황 하위집합에서 성능을 분석하고, 모델과 인간 간 통계적 비교를 수행한다.
  • 프레임워크는 GPT-4의 평가 일관성과 신뢰도를 검증하기 위해 인간이 평가한 점수 범위를 활용한다.
Figure 2: Distribution of the difference between the scores given by humans and GPT-4.
Figure 2: Distribution of the difference between the scores given by humans and GPT-4.

실험 결과

연구 질문

  • RQ1LLM은 개방형이고 상호작용적인 사회적 상황에서 인간과 비교해 어떻게 성능을 내는가?
  • RQ2어떤 사회적 상황이 다양한 모델에서 일관되게 어려움을 줄 수 있으며, 그 이유는 무엇인가?
  • RQ3GPT-4는 사회지능 평가에서 인간 평가의 신뢰할 수 있는 대체 평가자로 얼마나 유용한가?
  • RQ4전략적 의사소통이나 비밀 유지와 같은 특정 사회지능 실패는 LLM이 어떤 방식으로 나타나는가?
  • RQ5특히 고위험 또는 복잡한 사회적 역학에서 상대방에 따라 모델의 행동은 어떻게 달라지는가?

주요 결과

  • SOTOPIA-hard 하위집합에서 GPT-4는 목표 달성률이 10점 중 5.25점에 그치며, 인간 성능(6.53, p < 0.05)보다 유의미하게 열등하다.
  • GPT-4는 사회적 규범(Soc: -0.38)과 비밀(Sec: 0.00)에서 낮은 점수를 받았으며, 사회 규칙을 위반하거나 기밀 정보를 유출할 가능성이 있음을 시사한다.
  • GPT-4의 평가는 일반적으로 인간이 추정한 점수 범위 내에 있었지만, Sec 및 Soc 차원에선 과도하게 낙관적인 평가를 내렸다.
  • 지식 및 믿음 추적(Kno: 7.63, Bel: 7.63)에선 뛰어난 성능를 보였지만, 전략적 의사소통과 목표 달성에 대한 지속성에선 어려움을 겪었다.
  • 다른 인간과 상호작용할 때 인간 참가자는 관계 유지(0.93 vs. 0.65)와 재정 관리(0.75 vs. 0.63)에서 GPT-4를 압도적으로 뛰어넘었다.
  • 어떤 경우에선 GPT-4가 창의적인 문제 해결 능력을 보였지만, 이러한 사례는 희귀하고 상황 간 일관성이 없었다.
Figure D.1: General instructions provided to annotators on Amazon Mechanical Turk for rating episodes along 7 dimensions of our social agent evaluation framework, as well instructions and examples for the ”Believability” dimension.
Figure D.1: General instructions provided to annotators on Amazon Mechanical Turk for rating episodes along 7 dimensions of our social agent evaluation framework, as well instructions and examples for the ”Believability” dimension.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.