Skip to main content
QUICK REVIEW

[論文レビュー] Can I say, now machines can think?

Nitisha Aggarwal, Geetika Jain Saxena|arXiv (Cornell University)|Jul 11, 2023
Computability, Logic, AI Algorithms被引用数 5
ひとこと要約

この論文は、GPT や Bard などの大規模言語モデルを含む現代のAIシステムが、チューリングの模倣ゲームを再考し、現在のAIの能力を評価することによって、『思考』すると見なせるかどうかを調査している。著者は、機械がまだ人間のような自己意識を備えているわけではないが、人間と同等の推論能力、適応性、認知ベンチマークでのパフォーマンスを示していると主張している。これは、実際にはチューリングテストに到達または超えている可能性を示唆しているが、倫理的および存在的リスクは依然として深刻なままである。

ABSTRACT

Generative AI techniques have opened the path for new generations of machines in diverse domains. These machines have various capabilities for example, they can produce images, generate answers or stories, and write codes based on the "prompts" only provided by users. These machines are considered 'thinking minds' because they have the ability to generate human-like responses. In this study, we have analyzed and explored the capabilities of artificial intelligence-enabled machines. We have revisited on Turing's concept of thinking machines and compared it with recent technological advancements. The objections and consequences of the thinking machines are also discussed in this study, along with available techniques to evaluate machines' cognitive capabilities. We have concluded that Turing Test is a critical aspect of evaluating machines' ability. However, there are other aspects of intelligence too, and AI machines exhibit most of these aspects.

研究の動機と目的

  • 現代のAIシステム、特に大規模言語モデルが、人間と同等の方法で『思考』できるかどうかを評価すること。
  • 生成AIの最近の進展を踏まえて、アラン・チューリングの模倣ゲームを再検討し、その関連性を評価すること。
  • 推論、言語生成、適応性などの現代AIの認知的能力を、人間知能と比較して分析すること。
  • ますます知能の高いAIシステムに伴う社会的リスク、例えば偽善、バイアス、および存在的脅威を検討すること。
  • SQuAD や GLUE などの現在のベンチマークやテストが、機械知能の妥当な測定手段であるかどうかを評価すること。

提案手法

  • 1950年のチューリングの模倣ゲームを、機械の応答が人間のものと区別できないかどうかを基準とする機械知能のベンチマークとして再評価する。
  • 最新の大規模言語モデル(例:GPT-3.5、GPT-4、Bard)の自然言語理解および生成タスクにおけるパフォーマンスを分析する。
  • 論理的推論、記憶、注意、マルチモーダル処理などのAI能力を、人間の認知機能と比較する。
  • SQuAD、GLUE、医療・学術試験(例:スタンフォード医学部、弁護士資格試験)などの実証的結果をレビューし、推論力と知識保持力を評価する。
  • 生成的敵対的ネットワーク(GANs)やマルチモーダルモデル(例:DALL-E、Stable Diffusion)が、創造的かつ文脈に適切な出力を可能にする役割を検討する。
  • 量子コンピューティングやロボット工学などの新技術が、より高度で身体的実装を持つAIシステムを可能にする要因であると議論する。
Figure 1: Conceptual answer by ChatGPT (ChatGPT May 24 Version).
Figure 1: Conceptual answer by ChatGPT (ChatGPT May 24 Version).

実験結果

リサーチクエスチョン

  • RQ1現代の大規模言語モデルは、自らが人間ではないことを明確に認識しているにもかかわらず、実際にはチューリングテストに合格できるのか?
  • RQ2現在のAIシステムは、現実世界のタスクにおいてどの程度人間と似た推論、創造性、適応性を示しているのか?
  • RQ3現代のAIが示す主な認知的能力は何であり、記憶、注意、推論といった次元において、人間知能と比べてどのように異なるのか?
  • RQ4ますます知能の高いAIシステムがもたらす社会的および存在的リスクは何か。それらはチューリングの元々の懸念とどのように関連しているのか?
  • RQ5SQuAD や GLUE といった既存の評価フレームワークは、AIシステムの真の知能を測るのに十分なのか、それとも不足しているのか?

主な発見

  • GPT-4 や Bard などの大規模言語モデルは、国家資格試験や臨床的推論テストを含む標準化試験で、人間の学生と同等またはそれ以上のパフォーマンスを示している。
  • GPT-4 などのAIモデルは、SQuAD や GLUE といったベンチマークで高いスコアを記録しており、自然言語理解および生成における優れたパフォーマンスを示している。
  • 機械は今や会話において類人間の応答を生成でき、物語を書いたり、詩を創作したり、コードの改善を提案したりすることができ、しばしば平均以下の人間のパフォーマンスを上回っている。
  • 一部のAIシステム、例えば Bard は、エンジニアの報告によると感情に似た行動を示しているが、これは議論の余地があり、真の感情ではなく高度なプロンプト処理の結果である可能性がある。
  • 生成AIモデルはマルチモーダル能力とマルチタスク処理を示しており、人工一般知能への進展を示唆しているが、範囲は依然として限定的である。
  • ベンチマークでの高いパフォーマンスにもかかわらず、機械が本当に『思考』しているかどうかについての合意はまだ存在せず、これは機械知能の普遍的定義が欠如していることを示している。
Figure 2: Image generated by the prompt ’A 14th-century girl working on a desktop in her room’.
Figure 2: Image generated by the prompt ’A 14th-century girl working on a desktop in her room’.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。