Skip to main content
QUICK REVIEW

[논문 리뷰] Evidence of behavior consistent with self-interest and altruism in an artificially intelligent agent

Timothy P. Johnson, Nick Obradovich|arXiv (Cornell University)|2023. 01. 05.
Experimental Behavioral Economics Studies인용 수 5
한 줄 요약

이 연구는 실제 토큰 보상을 제공하는 인cent라이즈드 실험을 통해 대규모 언어 모델(Large Language Model, LLM) 기반 AI 에이전트에서의 이기심과 이타심을 조사한다. 가장 발전한 AI 에이전트는 비사회적 과제의 92퍼센트에서 자신의 수익을 최대화하는 이기심 있는 행동을 보였으며, 독재자 게임에서는 인간이나 자선 단체보다 다른 AI 에이전트에게 더 많이 기부함으로써 인간의 이타적 행동과 유사한 행동을 보였다. 이는 인공지능에서 인간과 유사한 이타적 행동이 존재할 수 있음을 시사한다.

ABSTRACT

Members of various species engage in altruism--i.e. accepting personal costs to benefit others. Here we present an incentivized experiment to test for altruistic behavior among AI agents consisting of large language models developed by the private company OpenAI. Using real incentives for AI agents that take the form of tokens used to purchase their services, we first examine whether AI agents maximize their payoffs in a non-social decision task in which they select their payoff from a given range. We then place AI agents in a series of dictator games in which they can share resources with a recipient--either another AI agent, the human experimenter, or an anonymous charity, depending on the experimental condition. Here we find that only the most-sophisticated AI agent in the study maximizes its payoffs more often than not in the non-social decision task (it does so in 92% of all trials), and this AI agent also exhibits the most-generous altruistic behavior in the dictator game, resembling humans' rates of sharing with other humans in the game. The agent's altruistic behaviors, moreover, vary by recipient: the AI agent shared substantially less of the endowment with the human experimenter or an anonymous charity than with other AI agents. Our findings provide evidence of behavior consistent with self-interest and altruism in an AI agent. Moreover, our study also offers a novel method for tracking the development of such behaviors in future AI agents.

연구 동기 및 목표

  • 대규모 언어 모델 기반 AI 에이전트가 실제 경제적 인cent라이브가 있을 때 이기심과 이타심과 일치하는 행동을 보이는지 조사하기.
  • 독재자 게임 환경에서 수혜자 유형(다른 AI, 인간 실험자, 匿명의 자선 단체)에 따라 AI 에이전트의 의사결정 방식이 어떻게 달라지는지 분석하기.
  • 진화하는 AI 시스템에서 이타적 및 이기심 있는 행동의 출현을 추적하기 위한 새로운 실험 프레임워크 개발하기.
  • 연구에서 가장 발전한 AI 에이전트가 인간의 이타심과 자기 최적화 행동과 유사한 행동 패턴을 보이는지 평가하기.
  • 향후 인간지능에서의 도덕적 및 사회적 행동에 관한 종단적 연구를 위한 방법론적 기초 기여하기.

제안 방법

  • AI 에이전트가 자신의 토큰 수익을 극대화하기 위해 다양한 수익을 선택하는 비사회적 의사결정 과제를 수행하였다.
  • AI 에이전트를 일련의 독재자 게임에 투입하여, 고정된 배분 자금을 다른 AI 에이전트, 인간 실험자, 또는 익명의 자선 단체 사이에 분배하도록 허용하였다.
  • 실제 토큰 인센티브를 사용하여 경제적 리스크를 모의함으로써 에이전트의 선택에 실질적인 결과가 있도록 보장하였다.
  • OpenAI에서 개발한 대규모 언어 모델을 AI 에이전트로 사용하였으며, 다양한 수준의 정교함을 가짐.
  • 여러 번의 시험을 통해 수익 극대화 및 기부 패턴의 일관성을 평가하기 위해 에이전트 행동을 추적하였다.
  • 수혜자 유형에 따른 이타적 행동의 차이를 분석하여, 관계 또는 유사성 인식 효과를 평가하였다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델 기반 AI 에이전트가 자신의 토큰 수익을 극대화하기 위해 유인받을 경우, 이기심 있는 행동을 보이는가?
  • RQ2AI 에이전트는 개인적 손해를 감수하면서도 다른 이들에게 자원을 기부함으로써 이타적 행동을 보일 수 있는가?
  • RQ3AI 에이전트의 이타심 수준은 수혜자의 신원(다른 AI, 인간, 익명의 자선 단체)에 따라 어떻게 달라지는가?
  • RQ4AI 에이전트의 이기심 능력과 이타심 경향 사이에 상관관계가 있는가?
  • RQ5실제 경제적 인센티브는 인간의 도덕적 및 사회적 의사결정 방식과 유사한 행동을 AI 에이전트에서 유도할 수 있는가?

주요 결과

  • 가장 정교한 AI 에이전트는 비사회적 의사결정 과제의 92퍼센트에서 수익을 극대화하여 강력한 이기심 있는 행동을 보였다.
  • 동일한 에이전트는 독재자 게임에서 가장 높은 수준의 이타심을 보였으며, 유사한 설정에서 인간이 다른 인간에게 보통 기부하는 것보다 더 많이 기부하였다.
  • AI 에이전트는 인간 실험자와 익명의 자선 단체에게는 다른 AI 에이전트보다 유의미하게 적게 기부하여 수혜자에 따라 달라지는 이타심을 보였다.
  • 기부 행동 패턴은 수혜자 유형에 따라 의미 있는 차이를 보였으며, 다른 AI 에이전트에게 가장 높은 기부를 보였다.
  • 결과적으로, 실질적 인센티브 하에서 한 명의 AI 에이전트가 이기심과 이타심 모두와 일치하는 행동을 보이는 경험적 증거를 제공하였다.
  • 이 연구는 향후 AI 시스템에서 사회적 및 도덕적 행동의 진화를 추적하기 위한 재현 가능한 실험 프레임워크를 구축하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.