Skip to main content
QUICK REVIEW

[論文レビュー] Visual analogy: Deep learning versus compositional models

Nicholas Ichien, Qing Liu|arXiv (Cornell University)|May 14, 2021
Multimodal Machine Learning Applications参考文献 25被引用数 7
ひとこと要約

この論文は、AIにおける視覚的類似性の解決が、エンド・トゥ・エンドのディープラーニングに依存するのか、構造的な部分表現に基づく構成的モデルに依存するのかを調査している。視覚的類似性問題における人間のパフォーマンスを、ディープラーニングモデル(シアン・ネットワーク、リレーション・ネットワーク)と、部分ベースの関係的類似性に基づく構成的モデルとで比較した。その結果、構成的モデルが、エンド・トゥ・エンドのディープラーニングモデルとは異なり、人間と類似したパフォーマンスパターンを再現した。これは、類似性推論が、純粋なデータ駆動型学習よりも、構造的で構成的な表現に依存している可能性を示唆している。

ABSTRACT

Is analogical reasoning a task that must be learned to solve from scratch by applying deep learning models to massive numbers of reasoning problems? Or are analogies solved by computing similarities between structured representations of analogs? We address this question by comparing human performance on visual analogies created using images of familiar three-dimensional objects (cars and their subregions) with the performance of alternative computational models. Human reasoners achieved above-chance accuracy for all problem types, but made more errors in several conditions (e.g., when relevant subregions were occluded). We compared human performance to that of two recent deep learning models (Siamese Network and Relation Network) directly trained to solve these analogy problems, as well as to that of a compositional model that assesses relational similarity between part-based representations. The compositional model based on part representations, but not the deep learning models, generated qualitative performance similar to that of human reasoners.

研究の動機と目的

  • AIにおける視覚的類似性推論が、巨視的でエンド・トゥ・エンドの学習を必要とするのか、それとも構造的で構成的な表現によって達成可能かどうかを特定すること。
  • シアン・ネットワークとリレーション・ネットワークというディープラーニングモデルが、視覚的類似性タスクにおいて人間の推論と比べてどの程度のパフォーマンスを示すかを評価すること。
  • 部分ベースの表現に基づく構成的モデルが、視覚的類似性解決において人間と類似したパフォーマンスパターンを再現できるかどうかを検証すること。
  • 構造的な部分間の関係的類似性が、ディープネットワークが学習する生の特徴類似性よりも、類似性推論の基盤としてより効果的かどうかを調査すること。

提案手法

  • 被験者に3Dオブジェクト(例:車やその部分領域)の画像を用いた視覚的類似性問題を解いてもらい、オクルージョンや視点変化などの制御された変化を加えた。
  • 同じ類似性データセット上でエンド・トゥ・エンドに訓練された2つのディープラーニングモデル(シアン・ネットワーク、リレーション・ネットワーク)を用意し、正しい類似性を予測するようにした。
  • オブジェクトを部分領域に分解する構造的分解を用いて、画像の部分ベース表現間の関係的類似性を計算する構成的モデルを開発した。
  • オクルージョンや視点変化などの条件を複数設定し、モデルの耐性と人間らしさを評価した。
  • 定量的および定性的に、人間のパフォーマンスと比較して、エラーのパターンと各条件下での正確性に注目して評価した。
  • 構成的モデルは、生の画像ピクセルに対するエンド・トゥ・エンドの訓練を避け、明示的な部分レベルの表現と関係的マッチングを用いた。

実験結果

リサーチクエスチョン

  • RQ1大規模な視覚的類似性データセットで訓練されたディープラーニングモデルは、人間のパフォーマンスパターンを再現できるか?
  • RQ2部分ベースの表現に基づく構成的モデルは、エンド・トゥ・エンドのディープラーニングモデルと比較して、人間の推論をよりよく模倣できるか?
  • RQ3オクルージョンや視点変化は、人間とモデルのパフォーマンスにどのように影響するか?
  • RQ4構造的な部分間の関係的類似性は、ディープネットワークが学習する特徴ベースの類似性よりも、類似性推論の基盤としてより効果的か?

主な発見

  • 被験者は全問題タイプで予想を上回る正確性を示したが、関連する部分領域がオクルージョンされた場合にはエラーが増加した。
  • シアン・ネットワークとリレーション・ネットワークの両モデルは、一般化能力に欠け、特にオクルージョン下で人間のエラーのパターンを再現できなかった。
  • 部分表現に基づく構成的モデルは、特に条件ごとのエラー分布において、人間の推論者と定性的に類似したパフォーマンスパターンを示した。
  • 部分的オクルージョンのような困難な条件下でも、構成的モデルはディープラーニングモデルよりも人間らしさのある推論を捉えていた。
  • 結果から、視覚における類似性推論が、純粋なエンド・トゥ・エンド学習よりも、構造的で構成的な表現に依存している可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。