Skip to main content
QUICK REVIEW

[논문 리뷰] Does ChatGPT Have a Mind?

Simon Goldstein, Benjamin A. Levinstein|arXiv (Cornell University)|2024. 06. 27.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 논문은 챗지피티와 같은 대규모 언어 모델(Large Language Models, LLMs)이 민간 심리학(folk psychology)을 갖는지, 즉 믿음, 욕망, 의도를 포함하는지를 분석함으로써 내부 표현과 행동 성향을 조사한다. 해석 가능성 연구와 표현 이론의 철학적 이론을 바탕으로, 강력한 내부 표현의 증거는 발견했지만, 안정적이고 목표 지향적인 행동 성향에 대한 증거는 확실하지 않으며, 기존의 LLM 민간 심리학에 대한 회의적 도전들이 철학적으로 힘을 잃는다는 결론을 내린다.

ABSTRACT

This paper examines the question of whether Large Language Models (LLMs) like ChatGPT possess minds, focusing specifically on whether they have a genuine folk psychology encompassing beliefs, desires, and intentions. We approach this question by investigating two key aspects: internal representations and dispositions to act. First, we survey various philosophical theories of representation, including informational, causal, structural, and teleosemantic accounts, arguing that LLMs satisfy key conditions proposed by each. We draw on recent interpretability research in machine learning to support these claims. Second, we explore whether LLMs exhibit robust dispositions to perform actions, a necessary component of folk psychology. We consider two prominent philosophical traditions, interpretationism and representationalism, to assess LLM action dispositions. While we find evidence suggesting LLMs may satisfy some criteria for having a mind, particularly in game-theoretic environments, we conclude that the data remains inconclusive. Additionally, we reply to several skeptical challenges to LLM folk psychology, including issues of sensory grounding, the "stochastic parrots" argument, and concerns about memorization. Our paper has three main upshots. First, LLMs do have robust internal representations. Second, there is an open question to answer about whether LLMs have robust action dispositions. Third, existing skeptical challenges to LLM representation do not survive philosophical scrutiny.

연구 동기 및 목표

  • LLMs가 믿음, 욕망, 의도를 포함하는 민간 심리학을 갖는지 확인하는 것.
  • 다양한 표현 이론에 따라 LLMs가 강력한 내부 표현을 갖는지 평가하는 것.
  • LLMs가 목표 지향적 행동 성향을 안정적으로 보이는지 평가하는 것.
  • 주요 회의적 도전, 즉 '확률적 패럿' 논거와 감각 기반성 및 기억 저장 문제를 반박하는 것.
  • 미래의 LLM 인지 및 도덕적 지위 연구를 위한 열린 경험적 및 철학적 질문을 규명하는 것.

제안 방법

  • 정보적, 인과적, 구조적, 목적론적 표현 이론을 포함한 다양한 철학적 표현 이론을 조사하여 LLMs가 정신적 표현을 위한 핵심 조건을 충족하는지 평가하는 것.
  • 기계 학습의 해석 가능성 연구를 적용하여 LLMs가 세계에 대한 정보를 담고 있으며 행동과 인과적으로 연결된 내부 상태를 보여주는 것을 입증하는 것.
  • 게임 이론 환경에서의 LLM 행동을 분석하여 출력이 일관되고 안정된 계획과 목표 지향적 행동 성향을 반영하는지 평가하는 것.
  • 해석주의와 표현주의 두 철학적 전통을 활용하여 LLMs에 믿음과 욕망을 부여하는 기준을 평가하는 것.
  • 세 가지 주요 회의적 도전—감각 기반성, '확률적 패럿' 비판, 기억 저장 가설—을 철학적 논리로 비판적으로 평가하여 그 약점을 드러내는 것.
  • 다양한 프롬프팅 조건에서의 출력 안정성 측정과 LLM 인지에서 내부 표현의 功能적 역할을 탐구하는 향후 연구 방향을 제안하는 것.
(a) Othello board state and model predictions before and after intervention
(a) Othello board state and model predictions before and after intervention

실험 결과

연구 질문

  • RQ1LLMs는 정보적, 인과적, 구조적, 목적론적 표현 이론의 핵심 조건을 충족하는 내부 표현을 갖는가?
  • RQ2LLMs는 믿음과 욕망으로 설명될 수 있는 정도로 안정적이고 목표 지향적인 행동 성향을 보이는가?
  • RQ3해석 가능성 연구 결과와 복잡한 과제에서의 행동 일관성 고려 시, '확률적 패럿' 비판이 철학적으로 지속 가능한가?
  • RQ4단지 텍스트 입력만 처리하는 LLMs에게 감각 기반성 문제는 어떻게 적용되며, 여전히 세계를 표현한다고 볼 수 있는가?
  • RQ5LLMs의 행동은 얼마나 많은 기억 저장과 얕은 단서에 의해 설명될 수 있으며, 진정한 내부 계획과 목표 표현을 반영하는가?

주요 결과

  • LLMs는 해석 가능성 연구의 지원을 받아 정보적, 인과적, 구조적, 목적론적 표현 이론의 핵심 조건을 충족한다.
  • 강력한 증거가 LLMs가 진리 조건을 지닌 진정한 세계 표현을 담고 있으며 행동을 이끄는 데 사용될 수 있는 구조적 내부 상태를 형성한다는 것을 보여준다.
  • 게임 이론 환경에서의 LLM 행동은 일관되고 목표 지향적인 계획의 존재를 암시하지만, 프롬프팅 세션 간의 불안정성으로 인해 여전히 결론적으로 확정되지 않았다.
  • '확률적 패럿' 논거는 해석 가능성 연구 결과와 복잡한 과제에서의 행동 일관성 고려 시 철학적 검토를 견디지 못하며, 단순한 다음 단어 예측을 넘어서 체계적인 추론과 표현을 보여준다.
  • LLMs가 기억 저장과 얕은 단서에 의존한다는 도전은 내부적으로 참과 거짓 진술 간의 구분이 있다는 증거로 약화되지만, 이는 여전히 경험적으로 열린 문제이다.
  • 다양한 프롬프팅 조건에서 LLM 출력의 안정성은 핵심적인 열린 문제이며, 불안정성은 거짓말이나 믿음-행동 불일치를 반영할 수 있으므로 믿음의 부재를 의미하지는 않는다.
(b) Activation patching process across model layers
(b) Activation patching process across model layers

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.