Skip to main content
QUICK REVIEW

[論文レビュー] Are Deep Neural Networks SMARTer than Second Graders?

Anoop Cherian, Kuan–Chuan Peng|arXiv (Cornell University)|Dec 20, 2022
Multimodal Machine Learning Applications被引用数 8
ひとこと要約

本論文は、算術、空間的推論、代数的推論を要する101の乳児向けパズルから成る視覚言語的データセットSMART-101を紹介し、教師あり学習を超えた深層ニューラルネットワークの一般化および推論能力を評価する。訓練データでは優れた性能を示すが、モデルは一般化に失敗し、GPT-3.5やGPT-4ですら妥当な推論を示しながらも誤った答えを導くため、真の抽象化およびアルゴリズム的推論における限界が明らかになった。

ABSTRACT

Recent times have witnessed an increasing number of applications of deep neural networks towards solving tasks that require superior cognitive abilities, e.g., playing Go, generating art, ChatGPT, etc. Such a dramatic progress raises the question: how generalizable are neural networks in solving problems that demand broad skills? To answer this question, we propose SMART: a Simple Multimodal Algorithmic Reasoning Task and the associated SMART-101 dataset, for evaluating the abstraction, deduction, and generalization abilities of neural networks in solving visuo-linguistic puzzles designed specifically for children in the 6--8 age group. Our dataset consists of 101 unique puzzles; each puzzle comprises a picture and a question, and their solution needs a mix of several elementary skills, including arithmetic, algebra, and spatial reasoning, among others. To scale our dataset towards training deep neural networks, we programmatically generate entirely new instances for each puzzle, while retaining their solution algorithm. To benchmark performances on SMART-101, we propose a vision and language meta-learning model using varied state-of-the-art backbones. Our experiments reveal that while powerful deep models offer reasonable performances on puzzles in a supervised setting, they are not better than random accuracy when analyzed for generalization. We also evaluate the recent ChatGPT and other large language models on a subset of SMART-101 and find that while these models show convincing reasoning abilities, the answers are often incorrect.

研究の動機と目的

  • 最先端の深層ニューラルネットワークが、6〜8歳児と同等の推論能力を一般化できるかどうかを評価すること。
  • 視覚的根拠に基づく問題において、算術、空間的推論、パターンマッチング、代数的推論といった広範なマルチモーダル推論スキルをテストするベンチマークデータセットを開発すること。
  • 現在のビジョン・アンド・ランゲージモデルおよび大規模言語モデル(例:GPT-3.5、GPT-4)が、抽象化と一般化を要するアルゴリズム的推論タスクを解く際の限界を評価すること。
  • 従来のビジョン・アンド・ランゲージベンチマークに見られるインダクティブバイアスを避ける、心理学的制御が施されたオープンワールドのデータセットを構築すること。

提案手法

  • 6〜8歳児を対象にした101のユニークな視覚言語的パズルで構成されるSMART-101を提案。各パズルは視覚的情報と自然言語の質問を組み合わせており、アルゴリズム的推論を要する。
  • プログラムによるデータ拡張を用いて、元のパズル1つあたり数千の新しいパズルインスタンスを生成。これにより、元の解法アルゴリズムを保持したまま、一般化評価を強化できる。
  • 多様な最先端のバックボーン(例:ViT、CLIP)を搭載したビジョン・アンド・ランゲージのメタラーニングモデルを用い、未学習のパズル変種における一般化性能を訓練および評価。
  • ゼロショットおよびフェイントショットの一般化を評価。訓練中に見られなかった拡張パズルインスタンスをモデルに提示し、ランダムベースラインと比較して正答率を測定。
  • GPT-3.5やGPT-4などの大規模言語モデルを、SMART-101のサブセットに対してベンチマーク化し、微調整なしで推論能力を評価。
  • モデル出力の論理的整合性と正しさを分析。推論トレースを正解の解法アルゴリズムと比較。

実験結果

リサーチクエスチョン

  • RQ1SMART-101ベンチマークで教師あり学習に用いた深層ニューラルネットワークは、同じパズルタイプの未学習インスタンスに一般化できるか?
  • RQ2最先端のビジョン・アンド・ランゲージモデルは、マルチモーダルなアルゴリズム的パズルにおいて、小学校2年生と同等の推論能力を示すか?
  • RQ3GPT-3.5 や GPT-4 といった大規模言語モデルは、微調整なしで視覚言語的パズルに対して正しい推論を示せるか、その程度はいかほどか?
  • RQ4従来のベンチマークに見られるインダクティブバイアスはモデル性能にどのように影響するか?SMART-101は、タスクの多様性とオープンワールドの複雑さを高めることで、これらのバイアスを軽減できるか?
  • RQ5構造化された推論タスクにおいて、大規模言語モデルが「聞き取りやすい推論」を示す一方で、実際の正答とは一致しないギャップはどの程度か?

主な発見

  • ビジョン・アンド・ランゲージモデルはSMART-101の教師あり学習インスタンスでは妥当な正答率を達成するが、未学習の拡張インスタンスではランダムな選択と同程度の性能にとどまり、一般化に失敗する。
  • 強力なアーキテクチャ的バックボーンを備えても、メタラーニングモデルは一般化に必要な根本的なアルゴリズム的構造を学習できず、抽象化および転送における根本的限界を示している。
  • GPT-3.5 や GPT-4 は妥当な推論トレースを生成するが、頻繁に誤った答えを導く。これは、流暢な推論が正しさを保証しないことを示している。
  • ある例では、GPT-4 は正解の18 kmではなく11 kmと誤って結論づけたが、推論経路は論理的に一貫していた。
  • 本研究では、現在のLLMおよびビジョン・ランゲージモデルが、単純で決定論的な解法経路であっても、しばしば幻覚的または一貫性のない推論を生成することが明らかになった。
  • 結果として、現在の深層学習モデルは、多段階かつマルチモーダルな推論を要するタスクにおいて、幼児の認知的能力に比べて抽象化およびアルゴリズム的推論が不十分であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。