[论文解读] Levels of Analysis for Machine Learning
本文主张在机器学习研究中采用Marr的分析层次框架——计算层、算法层与实现层,作为统一的概念框架。通过将该框架应用于Deep Q-Networks和医疗机器学习系统等案例研究,作者展示了该框架如何澄清假设、解决争议,并提升不同研究层次之间的批判性讨论。
Machine learning is currently involved in some of the most vigorous debates it has ever seen. Such debates often seem to go around in circles, reaching no conclusion or resolution. This is perhaps unsurprising given that researchers in machine learning come to these discussions with very different frames of reference, making it challenging for them to align perspectives and find common ground. As a remedy for this dilemma, we advocate for the adoption of a common conceptual framework which can be used to understand, analyze, and discuss research. We present one such framework which is popular in cognitive science and neuroscience and which we believe has great utility in machine learning as well: Marr's levels of analysis. Through a series of case studies, we demonstrate how the levels facilitate an understanding and dissection of several methods from machine learning. By adopting the levels of analysis in one's own work, we argue that researchers can be better equipped to engage in the debates necessary to drive forward progress in our field.
研究动机与目标
- 通过提供一个共享的概念框架,解决机器学习中反复出现且尚未解决的争议。
- 解决因研究人员视角差异导致的研究讨论错位问题。
- 展示Marr的分析层次框架在结构化和比较机器学习方法方面的实用性。
- 鼓励研究人员在自身工作中应用该框架,以揭示隐藏假设并提升批判性参与。
- 将Marr的分析层次定位为未来机器学习概念发展的基础视角,尤其是在可解释性与偏见等新兴问题日益突出的背景下。
提出的方法
- 采用Marr的三层次框架:计算层(系统的功能目标)、算法层(表征与算法)和实现层(物理或软件实现)。
- 将该框架应用于真实世界的机器学习系统,包括Deep Q-Networks、变分自编码器以及医疗机器学习应用。
- 利用各层次剖析和比较不同的算法选择(如Q-learning与SARSA)以及实现细节(如目标网络、回放缓冲区)。
- 强调某一层次的假设(如计算层目标)如何约束或塑造其他层次(如算法层表征)的选择。
- 通过使隐含假设显性化,揭示其影响,例如DQN中的对象理解假设或医疗机器学习中数据收集时间点的假设。
- 将Marr的框架与替代性概念模型(如架构-损失、算法-软件-硬件)进行比较,论证其更广泛的适用范围和实用性。
实验结果
研究问题
- RQ1Marr的分析层次如何有助于解决当前尚未解决的机器学习领域持续争议?
- RQ2不同分析层次在澄清机器学习系统目标、表征与实现方面的假设中发挥什么作用?
- RQ3应用分析层次如何改善对DQN或VAE等机器学习方法的批判性评估?
- RQ4算法层或实现层的设计选择如何反映或制约系统的计算层目标?
- RQ5分析层次能否帮助识别现实应用(如医疗机器学习系统)中的偏见来源或失效模式?
主要发现
- 应用Marr的分析层次框架有助于揭示机器学习研究中的隐含假设,例如DQN中以最大化标量奖励为目标的计算目标,可能与人类对物体的理解不一致。
- 对深度强化学习的批评(如Breakout游戏中智能体缺乏对象理解)可更精确地定位在计算层,即目标可能需要重新定义为包含对象发现。
- 在医疗机器学习中,算法层上六小时数据分桶的选择对模型性能和部署具有可测量影响,凸显了跨层次审视的必要性。
- 该框架揭示,训练数据中的偏见可能源于计算层的约束(如临床数据收集实践),而不仅仅是算法选择。
- 该框架通过区分不同层次上的分歧(如语言的目的究竟是结构化思维还是促进交流),促进了更结构化和富有成效的讨论。
- 应用该框架的研究人员常能发现被忽视的假设,从而获得更深层次的洞察并改进研究设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。