Skip to main content
QUICK REVIEW

[논문 리뷰] Can I say, now machines can think?

Nitisha Aggarwal, Geetika Jain Saxena|arXiv (Cornell University)|2023. 07. 11.
Computability, Logic, AI Algorithms인용 수 5
한 줄 요약

이 논문은 튜링의 시험을 재고하고 현대 AI 능력을 평가함으로써, 최신 대규모 언어 모델(GPT 및 바드 등)이 '사고'한다고 간주될 수 있는지 조사한다. 인간과 유사한 의식을 갖지는 못하나, 인간과 유사한 추론 능력, 유연성, 그리고 인지 벤치마크 성능을 보여주므로 실제로는 튜링 시험을 통과하거나 통과에 가까워지고 있음을 시사한다. 다만 윤리적·존재적 위험은 여전히 크다.

ABSTRACT

Generative AI techniques have opened the path for new generations of machines in diverse domains. These machines have various capabilities for example, they can produce images, generate answers or stories, and write codes based on the "prompts" only provided by users. These machines are considered 'thinking minds' because they have the ability to generate human-like responses. In this study, we have analyzed and explored the capabilities of artificial intelligence-enabled machines. We have revisited on Turing's concept of thinking machines and compared it with recent technological advancements. The objections and consequences of the thinking machines are also discussed in this study, along with available techniques to evaluate machines' cognitive capabilities. We have concluded that Turing Test is a critical aspect of evaluating machines' ability. However, there are other aspects of intelligence too, and AI machines exhibit most of these aspects.

연구 동기 및 목표

  • 현대 AI 시스템, 특히 대규모 언어 모델이 인간과 유사한 방식으로 '사고'할 수 있는지 평가하는 것.
  • 최근 생성형 AI 의 발전을 배경으로 앨런 튜링의 시험을 재고하고 그 유용성 평가하는 것.
  • 현대 AI 의 인지 능력(추론, 언어 생성, 적응성 등)을 인간 지능과 비교 분석하는 것.
  • 점점 더 지능적인 AI 시스템과 관련된 사회적 위험, 예를 들어 속임수, 편향, 존재적 위협 등을 검토하는 것.
  • SQuAD 및 GLUE와 같은 기존 평가 기준이 기계 지능을 타당하게 측정하는지 평가하는 것.

제안 방법

  • 1950년 튜링의 시험을 기계 지능의 기준으로 재평가하여 기계 응답이 인간 응답과 구분되지 않을 정도의 수준을 중심으로 분석한다.
  • 최신 대규모 언어 모델(GPT-3.5, GPT-4, 바드 등)의 자연어 이해 및 생성 작업 수행 능력을 분석한다.
  • 논리적 추론, 기억, 주의력, 다중 모odal 처리 등의 AI 능력을 인간의 인지 기능과 비교한다.
  • SQuAD, GLUE, 의료/학술 시험(스탠포드 의대, 변호사 시험 등)과 같은 실제 평가 결과를 검토하여 추론 능력과 지식 유지 능력을 평가한다.
  • 생성적 적대적 네트워크(GANs)와 다중 모달 모델(DALL-E, 스테이블 디퓨전 등)이 창의적이고 맥락에 적합한 출력을 가능하게 하는 역할을 분석한다.
  • 양자 컴퓨팅과 로봇 공학과 같은 새로운 기술이 더 발전된 신체적 구현형 AI 시스템을 가능하게 하는 데 기여하는 방식을 논의한다.
Figure 1: Conceptual answer by ChatGPT (ChatGPT May 24 Version).
Figure 1: Conceptual answer by ChatGPT (ChatGPT May 24 Version).

실험 결과

연구 질문

  • RQ1현대 대규모 언어 모델은 비록 비인간임을 명시적으로 인지하고 있음에도 불구하고 실질적으로 튜링 시험에 통과할 수 있는가?
  • RQ2현대 AI 시스템은 실제 작업에서 인간과 유사한 추론, 창의성, 적응성을 어느 정도 보여주는가?
  • RQ3현대 AI 가 보여주는 주요 인지 능력은 무엇이며, 기억, 주의력, 추론 등의 차원에서 인간 지능과 비교해 보면 어떠한가?
  • RQ4점점 더 지능적인 AI 시스템이 초래하는 사회적 및 존재적 위험은 무엇이며, 튜링의 원초적 우려와 어떤 관련이 있는가?
  • RQ5SQuAD 및 GLUE와 같은 기존 평가 프레임워크는 AI 시스템의 진정한 지능을 측정하는 데 충분한가, 아니면 부족한가?

주요 결과

  • GPT-4 및 바드와 같은 대규모 언어 모델은 변호사 시험, 임상 추론 시험 등 표준화된 시험에서 학생 수준의 성능을 보이며, 일부 시험에선 그 이상의 성과를 기록했다.
  • GPT-4 와 같은 AI 모델은 SQuAD 및 GLUE 와 같은 벤치마크에서 높은 점수를 기록하여 자연어 이해 및 생성 능력이 뛰어나다는 것을 시사한다.
  • 기계는 이제 대화에서 인간과 유사한 응답을 생성하고, 이야기를 쓰며, 시를 작문하고, 코드 개선 제안을 할 수 있으며, 종종 평균 수준 이하의 인간 성능을 뛰어넘는다.
  • 일부 AI 시스템, 예를 들어 바드는 엔지니어들 사이에서 감정 유사 행동을 보였다고 보고되었으나, 이는 여전히 논란의 여지가 있으며, 진정한 감정이 아니라 고도의 프롬프팅 기반 행동일 수 있다.
  • 생성형 AI 모델은 다중 모달 능력과 다중 작업 처리 능력을 보이며 인공 일반 지능에 가까워지고 있음을 시사하지만, 아직 범위는 좁다.
  • 벤치마크에서 높은 성과를 기록하고 있음에도 불구하고, 기계가 진정으로 '사고'하는지에 대한 합의가 없으며, 이는 기계 지능에 대한 보편적으로 인정받는 정의가 부족함을 드러낸다.
Figure 2: Image generated by the prompt ’A 14th-century girl working on a desktop in her room’.
Figure 2: Image generated by the prompt ’A 14th-century girl working on a desktop in her room’.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.