Skip to main content
QUICK REVIEW

[論文レビュー] Solving Raven's Progressive Matrices with Neural Networks

Tao Zhuo, Mohan Kankanhalli|arXiv (Cornell University)|Feb 5, 2020
Neural Networks and Applications参考文献 30被引用数 17
ひとこと要約

本稿では、事前学習済みResNet-50と、新しい非教師あり手法であるマルチラベル分類における仮のターゲット(MCPT)を用いた教師あり深層学習アプローチを提案し、レイヴァンのプログレッシブ・マトリクス(RPM)を解く。教師あり手法は86.26%の正確度を達成し、人間水準の性能(84.41%)を上回った。一方、MCPTは教師なしデータを用いてランダム推測の正確度を2倍の28.50%まで向上させ、人工知能における人間らしい推論への進展を示した。

ABSTRACT

Raven's Progressive Matrices (RPM) have been widely used for Intelligence Quotient (IQ) test of humans. In this paper, we aim to solve RPM with neural networks in both supervised and unsupervised manners. First, we investigate strategies to reduce over-fitting in supervised learning. We suggest the use of a neural network with deep layers and pre-training on large-scale datasets to improve model generalization. Experiments on the RAVEN dataset show that the overall accuracy of our supervised approach surpasses human-level performance. Second, as an intelligent agent requires to automatically learn new skills to solve new problems, we propose the first unsupervised method, Multilabel Classification with Pseudo Target (MCPT), for RPM problems. Based on the design of the pseudo target, MCPT converts the unsupervised learning problem to a supervised task. Experiments show that MCPT doubles the testing accuracy of random guessing e.g. 28.50% vs. 12.5%. Finally, we discuss the problem of solving RPM with unsupervised and explainable strategies in the future.

研究の動機と目的

  • ImageNet事前学習を用いた深層ニューラルネットワークと深層構造を活用し、過学習を低減するとともに、教師ありRPM解法における一般化性能を向上させること。
  • 教師なし学習手法を開発し、ラベルなしデータからも抽象的ルールを学習可能にすることで、人間らしい推論を模倣すること。
  • 抽象的視覚推論タスクにおける機械の性能と人間水準の推論のギャップを埋めること。
  • AIにおける視覚推論のための教師なしで説明可能な表現学習の可能性を検討すること。

提案手法

  • ImageNet事前学習を用いた深層残差ネットワーク(ResNet-50)を用い、教師ありRPM分類における一般化性能の向上と過学習の低減を図る。
  • 仮のターゲットベクトルを用いた多クラス分類を適用し、非教師ありRPM解法を教師ありマルチラベル学習タスクに変換する。
  • 10次元の2ホット仮のターゲットベクトルを設計し、最初の2つの要素が正しいルール一致行(第1行および第2行)と正解行に対応するようにする。
  • 各候補となる正解に対して、モデルは完全なマトリクス行を生成し、仮のターゲットを用いて正解行が最初の2行と同じラベルに分類されるように学習する。
  • 同じ論理的ルールを共有する行間で一貫した表現を学習するよう、コントラスト学習戦略を採用する。
  • 評価にはRAVENデータセットを用い、複数の図形構成におけるテストセットのトップ1正確度を性能指標として用いる。

実験結果

リサーチクエスチョン

  • RQ1ImageNet事前学習と深層構造を有する深層ニューラルネットワークは、過学習を低減しつつ、従来の手法を上回る性能でRPMを解くことができるか?
  • RQ2教師なし手法は、ラベルなしデータのみで意味のある性能を達成でき、人間らしい推論に近づけるか?
  • RQ3非教師あり手法の性能は、抽象的視覚推論タスクにおけるランダム推測と人間水準の性能と比べてどのように異なるか?
  • RQ4非教師ありモデルは、視覚推論においてどの程度、解釈可能でルールに基づいた表現を学習できるか?

主な発見

  • ImageNet事前学習を用いた教師ありアプローチ(ResNet-50)は、RAVENデータセットで86.26%の正確度を達成し、人間水準の84.41%を上回った。
  • 提案された非教師あり手法MCPTは、テスト正確度28.50%を達成し、ランダム推測の12.5%を2倍に上回った。
  • L-RおよびO-ICなどの特定の図形構成において、教師あり手法は人間を10ポイント以上上回った。
  • 一般化性能は依然として限定的である:単純な構成で学習したモデルは、複雑な構成では性能を発揮できないが、人間はより効果的に一般化できる。
  • 非教師ありMCPT手法は、CenterおよびO-IC構成において特に優れた性能を示し、33%を超える正確度を達成した。
  • 高い正確度にもかかわらず、現在のモデルは説明可能性に欠ける:人間とは異なり、予測の背後にある論理的ルールを説明できない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。