[论文解读] Anytime Prediction as a Model of Human Reaction Time
本文提出通过早期退出神经网络实现任意时间预测,作为物体识别中人类反应时间的模型。通过比较人类与MSDNet在含噪CIFAR-10图像上的表现,发现当噪声水平调整至使准确率相等时,两类观察者均表现出几乎相同的速度-准确率权衡,表明任意时间分类是人类感知决策过程的强有力候选模型。
Neural networks today often recognize objects as well as people do, and thus might serve as models of the human recognition process. However, most such networks provide their answer after a fixed computational effort, whereas human reaction time varies, e.g. from 0.2 to 10 s, depending on the properties of stimulus and task. To model the effect of difficulty on human reaction time, we considered a classification network that uses early-exit classifiers to make anytime predictions. Comparing human and MSDNet accuracy in classifying CIFAR-10 images in added Gaussian noise, we find that the network equivalent input noise SD is 15 times higher than human, and that human efficiency is only 0.6\% that of the network. When appropriate amounts of noise are present to bring the two observers (human and network) into the same accuracy range, they show very similar dependence on duration or FLOPS, i.e. very similar speed-accuracy tradeoff. We conclude that Anytime classification (i.e. early exits) is a promising model for human reaction time in recognition tasks.
研究动机与目标
- 使用深度神经网络中的任意时间预测建模人类在物体识别任务中的反应时间。
- 研究如MSDNet等早期退出架构是否能复现人类在感知决策中观察到的速度-准确率权衡。
- 量化在不同噪声条件下,人类与神经网络在物体识别中的效率差距。
- 为将阅读障碍建模为视觉处理中的时间缺陷提供计算框架。
- 通过线性变换将人类反应时间与网络FLOPs对齐,以跨模态比较性能。
提出的方法
- 使用MSDNet,一种多尺度、密集连接的网络,其具有中间分类器,可根据置信度分数实现早期退出。
- 对CIFAR-10测试图像施加不同水平的白高斯噪声(标准差从0.0到1.0),以调节任务难度。
- 在每个退出点测量网络的准确率与FLOPs,生成不同噪声水平下的速度-准确率曲线。
- 通过块设计范式开展人类实验,受试者被训练在固定潜伏期(200–1000 ms)内作出反应,每组块记录准确率。
- 建立FLOPs与时间之间的线性映射关系:F = (11/600)(T - 400),以将网络FLOP消耗与人类反应时间(毫秒)对齐。
- 通过识别性能不受影响的噪声水平,估算人类与网络的等效输入噪声(EIN)。
实验结果
研究问题
- RQ1神经网络中的任意时间预测能否复现人类在物体识别中的速度-准确率权衡?
- RQ2在噪声逐渐增加的条件下,深度神经网络与人类观察者在物体识别中的效率如何比较?
- RQ3需要多高的噪声水平才能使网络性能与人类性能对齐?这反映了何种处理效率的相对差异?
- RQ4当人类与任意时间网络在相同条件下测试时,其速度-准确率权衡曲线是否一致?
- RQ5任意时间预测机制能否作为理解阅读障碍中时间缺陷的可行计算模型?
主要发现
- 网络的等效输入噪声(EIN)为0.6标准差,是人类观察者的15倍(人类EIN = 0.04标准差)。
- 人类识别效率仅为网络的0.6%,表明在相同准确率水平下,网络对噪声的鲁棒性显著更强。
- 当噪声水平调整至使人类与网络达到相似准确率时,两者在处理时间或FLOPs上的速度-准确率权衡曲线几乎完全一致。
- 当噪声低于各自EIN阈值时,两类观察者的性能均无明显变化,证实了EIN估计的有效性。
- 人类观察者的准确率随反应时间增加而提高,随噪声增加而下降,其曲线形状在匹配条件下与网络高度一致。
- 线性缩放因子F = (11/600)(T - 400)成功将网络FLOPs与人类反应时间对齐,实现了性能动态的直接比较。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。