Skip to main content
QUICK REVIEW

[논문 리뷰] The Debate Over Understanding in AI's Large Language Models

Melanie Mitchell, David C. Krakauer|arXiv (Cornell University)|2022. 10. 14.
Topic Modeling인용 수 12
한 줄 요약

이 논문은 대규모 언어 모델(LLM)이 인간과 유사한 진정한 이해를 지니는지에 대한 AI 연구 분야의 끊임없는 논쟁을 다루며, 현재의 모델들이 몸체적 인식이 아닌 거대 규모의 통계적 상관관계에 기반한 비인간적 형태의 이해를 보여주고 있음을 주장한다. 저자들은 다양한 형태의 이해를 분석할 수 있는 보다 넓은 지능 과학이 필요하다고 제안하며, 이는 LLM에서 나타나는 새로운 형태의 인지, 즉 고유한 강점과 한계를 지닌 새로운 종류의 지능을 포함한다.

ABSTRACT

We survey a current, heated debate in the AI research community on whether large pre-trained language models can be said to "understand" language -- and the physical and social situations language encodes -- in any important sense. We describe arguments that have been made for and against such understanding, and key questions for the broader sciences of intelligence that have arisen in light of these arguments. We contend that a new science of intelligence can be developed that will provide insight into distinct modes of understanding, their strengths and limitations, and the challenge of integrating diverse forms of cognition.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)이 언어를 이해할 수 있는지 여부에 대한 AI 분야의 뜨거운 논쟁을 분석하고, 언어가 암시하는 물리적 및 사회적 맥락을 이해하는지 여부를 다룬다.
  • LLM의 언어 능력과 추론 능력이 진정한 이해에서 비롯되는지, 아니면 단지 통계적 패턴 매칭에서 비롯되는지 조사한다.
  • 비인간적 형태의 이해, 특히 LLM에서 나타나는 형태를 포함한 다양한 형태의 인지 분석이 가능한 확장된 지능 과학의 개발을 주장한다.
  • 기존의 인지 과학 평가 기준이 인간의 인지에 뿌리를 두고 있어 LLM의 이해를 평가하는 데 부적절하다는 점을 도전한다.
  • 신체가 없음에도 불구하고 LLM의 행동이 인간의 정신 모델과는 다를 바 있는 새로운 기능적 형태의 이해가 될 수 있는지 탐구한다.

제안 방법

  • LLM 이해 논쟁의 양측 주장을 검토하며 철학, 인지 과학, AI 연구의 시각을 종합한다.
  • LLM의 아키텍처와 학습 과정 분석 — 특히 마스크된 토큰을 예측하기 위해 거대한 텍스트 코퍼스에서 자기지도 학습을 수행하는 방식.
  • 인간 중심의 심리적 테스트(예: 이성적 사고나 추론 평가)가 LLM에 적용되었을 때의 한계 평가.
  • 비인간 지능 시스템에서의 이해 메커니즘을 드러내기 위해 특화된 새로운 과학적 평가 기준과 탐사 방법의 필요성 제안.
  • AlphaZero나 AlphaFold와 같은 시스템을 비유하여 통계적 지능이 특정 영역에서 초인적 성능을 낼 수 있음을 설명한다.
  • 신체가 없는, 상관관계 기반의 인지가 타당한, 비록 이질적이지만 지능의 한 형태로 인정할 수 있는 이해의 재개념화를 주장한다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델(LLM)은 인간의 이해 방식과 유사하게 언어와 그가 묘사하는 물리적·사회적 상황을 이해할 수 있는가?
  • RQ2LLM이 유창하고 지능적으로 보이는 응답을 생성할 때, 원인이 인과적 또는 개념적 모델이 아니라 통계적 상관관계에 기반하는 정도는 어느 정도인가?
  • RQ3신체적 존재나 경험적 기반 없이도 기능적 또는 새로운 형태의 이해를 달성할 수 있는가?
  • RQ4현재의 심리적 테스트는 LLM의 이해를 평가하는 타당한 대체 지표인가, 아니면 인간의 인지에 대한 가정 때문에 오해를 낳는가?
  • RQ5다양한 형태의 지능, 특히 대규모 AI 시스템에서 나타나는 형태를 연구하고 비교하기 위해 어떤 새로운 과학적 방법이 필요한가?

주요 결과

  • LLM은 명시적으로 훈련받지 않았음에도 불구하고 인간과 유사한 텍스트를 생성하고 추론 유사 행동을 보이며, 이는 스케일의 증가에서 기인한 잠재적 능력의 기인을 시사한다.
  • 유창성에도 불구하고 LLM은 여전히 취약하고 인간답지 않은 오류를 범하기 쉬우며, 이는 탄탄하고 기반된 이해의 부족을 나타낸다.
  • LLM의 성공은 정신 모델이나 인과적 이해를 구축하기보다는 텍스트 간 광범위한 통계적 상관관계를 학습한 데 기인한다.
  • 일부 연구자들은 LLM이 일반 지능이나 심지어 의식에 가까워지고 있다고 주장하지만, 다른 이들은 LLM이 본질적으로 '얕은' 이해에 국한되어 있다고 주장한다.
  • 기존의 심리적 테스트를 LLM에 적용하면 인간과 유사한 응답이 나오지만, 이러한 결과는 개념적 추론이 아닌 패턴 매칭에 의존하기 때문에 오해의 소지가 있다.
  • 점점 더 많은 증거가 LLM이 비인간적, 상관관계 기반이며 특정 영역에선 초인적일 수 있는 새로운 종류의 지능을 나타내고 있으며, 이는 인공 시스템에서 이해의 의미를 재고할 필요성을 제기한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.