[論文レビュー] Anytime Prediction as a Model of Human Reaction Time
本稿では、オブジェクト認識における人間の反応時間のモデルとして、早期退出を伴うニューラルネットワークによるいつでも予測(anytime prediction)を提案する。ノイズがかかるCIFAR-10画像上で人間とMSDNetの性能を比較した結果、正確性を同等にした条件下で、両者ともほぼ同一の速度-正確性トレードオフを示し、これは anytime 分類が人間の知覚的意思決定プロセスの強力な候補モデルであることを示唆している。
Neural networks today often recognize objects as well as people do, and thus might serve as models of the human recognition process. However, most such networks provide their answer after a fixed computational effort, whereas human reaction time varies, e.g. from 0.2 to 10 s, depending on the properties of stimulus and task. To model the effect of difficulty on human reaction time, we considered a classification network that uses early-exit classifiers to make anytime predictions. Comparing human and MSDNet accuracy in classifying CIFAR-10 images in added Gaussian noise, we find that the network equivalent input noise SD is 15 times higher than human, and that human efficiency is only 0.6\% that of the network. When appropriate amounts of noise are present to bring the two observers (human and network) into the same accuracy range, they show very similar dependence on duration or FLOPS, i.e. very similar speed-accuracy tradeoff. We conclude that Anytime classification (i.e. early exits) is a promising model for human reaction time in recognition tasks.
研究の動機と目的
- 深層ニューラルネットワークにおける anytime 予測を用いて、オブジェクト認識タスクにおける人間の反応時間のモデル化を目的とする。
- MSDNet のような早期退出アーキテクチャが、知覚的意思決定で観察される人間の速度-正確性トレードオフを再現できるかどうかを調査すること。
- さまざまなノイズ条件下でのオブジェクト認識において、人間とニューラルネットワークの効率的差を定量すること。
- 読み書き障害を視覚処理におけるタイミング障害としてモデル化するための計算フレームワークを提供すること。
- 人間の反応時間とネットワークのFLOPsを線形変換により一致させ、異なるモダリティ間での性能比較を可能とすること。
提案手法
- 中間分類器を備えたマルチスケールで密接に接続されたネットワークであるMSDNetを用い、信頼度スコアに基づく早期退出を可能にする。
- CIFAR-10テスト画像に白色ガウスノイズ(標準偏差0.0から1.0まで変化)を適用し、タスクの難易度を調整した。
- 各退出ポイントにおけるネットワークの正確性とFLOPsを測定し、さまざまなノイズレベルにおける速度-正確性曲線を生成した。
- ブロックデザインパラダイムを用いて人間実験を実施し、被験者が固定された遅延(200〜1000 ms)で反応するように訓練した。各ブロックにおける正確性を記録した。
- ネットワークのFLOPsと時間の間の線形マッピング(F = (11/600)(T - 400))を確立し、ネットワークのFLOPs消費を人間の反応時間(ミリ秒単位)に一致させた。
- 人間とネットワークの両者に対して、性能に影響を及ぼさない入力ノイズの等価レベル(EIN)を推定した。
実験結果
リサーチクエスチョン
- RQ1ニューラルネットワークにおける anytime 予測は、オブジェクト認識における人間の速度-正確性トレードオフを再現できるか?
- RQ2ノイズが増加する条件下で、深層ニューラルネットワークと人間観察者との間で、オブジェクト認識の効率性にどのような差が生じるか?
- RQ3ネットワークの性能を人間の性能と一致させるために必要なノイズレベルは何か? これは相対的処理効率について何を示唆するか?
- RQ4人間とネットワークの両者が同等の条件下でテストされた場合、人間の速度-正確性トレードオフ曲線は anytime ネットワークの曲線と一致するか?
- RQ5anytime 予測メカニズムは、読み書き障害におけるタイミング障害の理解に有効な計算モデルとして成立するか?
主な発見
- ネットワークの等価入力ノイズ(EIN)は人間観察者よりも15倍高い。EINはネットワークで0.6 SD、人間で0.04 SDであった。
- 人間の認識効率はネットワークの0.6%にとどまり、これは同じ正確性レベルでネットワークがはるかにノイズに強いことを示している。
- 人間とネットワークの正確性を同等にしたノイズレベルに調整した場合、両者の処理時間またはFLOPsにおける速度-正確性トレードオフ曲線はほぼ同一であった。
- 両観察者とも、それぞれのEIN閾値未満のノイズでは性能にほとんど変化がなく、EIN推定値の妥当性が裏付けられた。
- 人間観察者の正確性は反応時間の延長に伴い向上し、ノイズの増加に伴い低下するが、同等条件下ではネットワークの曲線と非常に類似した形状を示した。
- 線形スケーリング係数 F = (11/600)(T - 400) は、ネットワークのFLOPsを人間の反応時間に適切に一致させることができ、性能ダイナミクスの直接比較を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。