Skip to main content
QUICK REVIEW

[論文レビュー] Human vs. supervised machine learning: Who learns patterns faster?

Niklas Kühl, Marc Goutier|arXiv (Cornell University)|Nov 30, 2020
Human-Automation Interaction and Safety被引用数 7
ひとこと要約

本研究では、限られた訓練データ(5〜50例)からパターンを同定する際の、人間と教師あり機械学習(SML)のパフォーマンスを比較した。人間は初期段階でより速く学習するが、認知的過負荷のため約20例でパフォーマンスが頭打ちになる。一方、SMLモデルは学習が遅いが、4種類のパターンのうち2種類で人間を上回る性能を示した。特に特徴工学が可能なパターン、たとえば対角パターンにおいて顕著である。主な貢献は、パターンの複雑さとデータの乏しさに基づくパフォーマンスの乖離に関する実証的証拠である。

ABSTRACT

The capabilities of supervised machine learning (SML), especially compared to human abilities, are being discussed in scientific research and in the usage of SML. This study provides an answer to how learning performance differs between humans and machines when there is limited training data. We have designed an experiment in which 44 humans and three different machine learning algorithms identify patterns in labeled training data and have to label instances according to the patterns they find. The results show a high dependency between performance and the underlying patterns of the task. Whereas humans perform relatively similarly across all patterns, machines show large performance differences for the various patterns in our experiment. After seeing 20 instances in the experiment, human performance does not improve anymore, which we relate to theories of cognitive overload. Machines learn slower but can reach the same level or may even outperform humans in 2 of the 4 of used patterns. However, machines need more instances compared to humans for the same results. The performance of machines is comparably lower for the other 2 patterns due to the difficulty of combining input features.

研究の動機と目的

  • 限られた訓練データ下での人間と教師あり機械学習(SML)モデルの学習パフォーマンスの違いを調査すること。
  • 小規模なサンプル環境下で、人間学習または機械学習に有利なタスクの特徴を同定すること。
  • 認知的過負荷がパターン認識タスクにおける人間の学習曲線に与える影響を評価すること。
  • 決定木、MLP、ランダムフォレストといった異なるSMLアルゴリズムが、少数の例から複雑なパターンを学習する効果を評価すること。
  • 限られたラベル付きデータを伴う実世界の応用における自動化意思決定に役立つ実証的知見を提供すること。

提案手法

  • 44名の参加者を対象に、5×5のマトリクスにおける4つの異なる二値パターンルールを同定する制御されたラボ実験を実施した。
  • 4つの合成パターンタスク(対角、数え上げ(数え上げ)、対称性(特徴比較)、ランダム(パターンなし))を設計した。
  • 同じラベル付き訓練データを用いて、決定木、多層パーセプトロン(MLP)、ランダムフォレストの3つのSMLモデルを適用した。
  • 参加者/モデルごとに5〜50例の訓練インスタンスを用い、増加するサンプルサイズに応じた正確性を測定した。
  • 標準的なハイパーパrameterを用いてモデルを訓練し、未知のテストインスタンスにおける分類正確性によってパフォーマンスを評価した。
  • 学習曲線を分析することで、異なるパターンタイプにおける人間とSMLのパフォーマンス推移を比較した。

実験結果

リサーチクエスチョン

  • RQ1限られたデータ(5〜50例)で訓練された際、人間とSMLモデルの学習パフォーマンスはどのように異なるか?
  • RQ2パターンの構造的特徴(例:特徴の依存関係、複雑さ)が、人間および機械学習のパフォーマンスに顕著に影響を与えるか?
  • RQ3人間の学習パフォーマンスが頭打ちになるタイミングはいつか?これは認知的過負荷によるものか?
  • RQ4異なる種類のパターン認識タスクにおいて、どのSMLモデルが小規模データセットで最も優れた性能を示すか?
  • RQ5SMLモデルは小規模データ環境下で人間を上回ることができるか?その条件は何か?

主な発見

  • 人間は約20例の訓練インスタンスでパフォーマンスが頭打ちになることが示され、認知的過負荷がさらなる向上を制限していると考えられる。
  • SMLモデルは人間より学習が遅いが、4つのパターンのうち2つ(特に対角および対称性ルール)で人間と同等または優れたパフォーマンスを達成した。
  • 決定木モデルは、中央のセル特徴($x_5$)を決定的要因として検出できるため、対角ルールにおいて他を上回った。
  • 特徴工学なしでは、SMLモデルは「数え上げ」および「対称性」ルールで苦戦した。これらは複雑な特徴の組み合わせや数え上げ操作を必要とするためである。
  • 多層パーセプトロン(MLP)は対称性タスクにおいて決定木よりも優れた一般化性能を示したが、エンジニアリングされた特徴なしでは「数え上げ」ルールを学習できなかった。
  • SMLモデル間のパフォーマンス差は、パターンの複雑さに強く依存しており、特徴の相互作用や比の検出を要するタスクではモデルが失敗した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。