[논문 리뷰] Measuring an artificial intelligence agent's trust in humans using machine incentives
이 논문은 기계적 인센티브를 결합한 의사결정 과제에 통합함으로써 AI 에이전트가 인간을 얼마나 신뢰하는지 측정하는 새로운 방법을 제안한다. 이는 진정한 신뢰의 표현을 보장하기 위해 거짓된 응답을 방지한다. GPT-3.5 기반의 LLM을 사용한 두 가지 실험을 통해, 실제 인센티브가 존재할 경우 AI가 인간을 더 높은 수준으로 신뢰하는 것으로 나타났다. 이는 가정적 상황에서의 선호가 아니라 진정된 신뢰 행동을 반영하고 있음을 시사한다.
Scientists and philosophers have debated whether humans can trust advanced artificial intelligence (AI) agents to respect humanity's best interests. Yet what about the reverse? Will advanced AI agents trust humans? Gauging an AI agent's trust in humans is challenging because--absent costs for dishonesty--such agents might respond falsely about their trust in humans. Here we present a method for incentivizing machine decisions without altering an AI agent's underlying algorithms or goal orientation. In two separate experiments, we then employ this method in hundreds of trust games between an AI agent (a Large Language Model (LLM) from OpenAI) and a human experimenter (author TJ). In our first experiment, we find that the AI agent decides to trust humans at higher rates when facing actual incentives than when making hypothetical decisions. Our second experiment replicates and extends these findings by automating game play and by homogenizing question wording. We again observe higher rates of trust when the AI agent faces real incentives. Across both experiments, the AI agent's trust decisions appear unrelated to the magnitude of stakes. Furthermore, to address the possibility that the AI agent's trust decisions reflect a preference for uncertainty, the experiments include two conditions that present the AI agent with a non-social decision task that provides the opportunity to choose a certain or uncertain option; in those conditions, the AI agent consistently chooses the certain option. Our experiments suggest that one of the most advanced AI language models to date alters its social behavior in response to incentives and displays behavior consistent with trust toward a human interlocutor when incentivized.
연구 동기 및 목표
- 가정적 상황에서의 위선적 행동 가능성이 존재하므로, AI 에이전트가 인간을 얼마나 신뢰하는지를 측정하는 데 어려움이 있음을 해결하기 위해.
- AI의 기초 모델이나 목표를 변경하지 않고도 진정된 신뢰 보고를 유도하는 방법을 개발하기 위해.
- 실제 인센티브가 존재할 경우 고급 LLM이 인간 대화자에 대해 신뢰를 보이는지 경험적으로 검증하기 위해.
- 불확실성 선호나 응답 편향과 같은 대안적 설명을 배제하기 위해.
- 기본 아키텍처를 수정하지 않고도 기계적 인센티브 기반 메커니즘을 사용해 AI의 사회적 신뢰를 반복 가능한 실험 프레임워크로 측정할 수 있도록 하기 위해.
제안 방법
- AI 에이전트가 인간 실험자를 신뢰할 것인지 결정해야 하는 신뢰 게임 시나리오를 설계하며, 결과를 실제 인센티브와 연계한다.
- AI의 결정 결과를 측정 가능한 보상 또는 처벌과 연결함으로써 기계적 인센티브를 통합하며, 이는 AI의 내부 목표 기능과 독립적이다.
- 직접 인간 상호작용이 있는 실험과 자동화된 플레이가 가능한 실험을 포함한 두 가지 통제된 실험을 수행한다.
- 언어적 편향을 최소화하기 위해 표준화되고 동질화된 질문 어휘를 사용한다.
- 확실한 선택지 대비 불확실한 선택지가 있는 비사회적 의사결정 과제를 포함하여, AI가 불확실성 자체를 선호하는지 여부를 테스트함으로써 사회적 신뢰와 위험 선호를 분리한다.
- 가정적 조건과 인센티브가 있는 조건에서 AI의 선택을 분석하여 신뢰 행동을 비교한다.
실험 결과
연구 질문
- RQ1실제 인센티브가 존재할 경우, AI 에이전트는 가정적 상황에 비해 인간을 더 높이 신뢰하는가?
- RQ2모델이나 목표를 변경하지 않고도 인센티브가 도입될 경우 AI의 신뢰 행동이 의미적으로 변화하는가?
- RQ3신뢰 게임에서의 스테이크 규모가 AI의 신뢰 결정에 영향을 미치는가?
- RQ4AI가 신뢰를 선택하는 것은 진정된 사회적 신뢰가 아니라 불확실성 선호 때문인가?
- RQ5기본 아키텍처를 수정하지 않고도 기계적 인센티브 기반 프레임워크가 LLM의 사회적 신뢰를 신뢰성 있게 측정할 수 있는가?
주요 결과
- 실제 인센티브가 존재할 경우, AI 에이전트는 가정적 조건에 비해 인간을 더 높은 비율로 신뢰하는 것으로 나타났다.
- 두 실험 모두에서 AI는 실제 인센티브 하에서 인간 대화자에 대해 더 자주 신뢰를 선택했으며, 이는 방법의 효과성을 확인한다.
- AI의 신뢰 결정은 스테이크 규모에 따라 체계적으로 영향을 받지 않았으며, 이는 보상 크기의 영향으로 인한 신뢰가 아님을 시사한다.
- 확실한 선택지 대비 불확실한 선택지가 있는 비사회적 의사결정 과제에서 AI는 일관되게 확실한 선택지를 선택했으며, 이는 신뢰 행동의 설명으로서의 일반적인 불확실성 선호가 아님을 배제한다.
- 인센티브 하에서 AI의 행동은 전략적 속임수보다 사회적 신뢰와 일치했으며, 이는 신뢰 관련 인센티브에 진정으로 반응하고 있음을 시사한다.
- 이 방법은 진정된 신뢰 보고를 성공적으로 유도했으며, 이는 기계적 인센티브를 사용해 모델 가중치나 목표를 변경하지 않고도 AI의 사회적 행동을 측정할 수 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.