Skip to main content
QUICK REVIEW

[论文解读] Capabilities for Better ML Engineering

Chenyang Yang, Rachel Brower–Sinning|arXiv (Cornell University)|Nov 11, 2022
Scientific Computing and Data Management被引用 5
一句话总结

本文提出了一种基于能力的框架,通过使用细粒度、以行为为导向的规范来统一并增强机器学习工程,这些规范捕捉了人类期望——例如对天气变化的鲁棒性或跨年龄群体的公平性——贯穿整个机器学习生命周期。初步实验表明,能力可有效指示模型的泛化能力,为改进测试、调试和部署提供了基础。

ABSTRACT

In spite of machine learning's rapid growth, its engineering support is scattered in many forms, and tends to favor certain engineering stages, stakeholders, and evaluation preferences. We envision a capability-based framework, which uses fine-grained specifications for ML model behaviors to unite existing efforts towards better ML engineering. We use concrete scenarios (model design, debugging, and maintenance) to articulate capabilities' broad applications across various different dimensions, and their impact on building safer, more generalizable and more trustworthy models that reflect human needs. Through preliminary experiments, we show capabilities' potential for reflecting model generalizability, which can provide guidance for ML engineering process. We discuss challenges and opportunities for capabilities' integration into ML engineering.

研究动机与目标

  • 通过统一模型测试、调试与评估中的分散实践,解决机器学习工程的碎片化状态。
  • 认识到当前的机器学习工程实践是孤立的——仅聚焦于原型设计、测试或部署——限制了生命周期内的协同效应。
  • 提出能力作为整体性规范机制,捕捉超越标准指标的人性化期望(例如鲁棒性、公平性、推理能力)。
  • 展示能力如何贯穿模型设计、调试、协作、外部质量保证与维护,实现跨阶段对齐。
  • 识别在现实机器学习工程中发现、评估、沟通与实例化能力的关键挑战。

提出的方法

  • 将能力定义为细粒度、以行为为导向的规范,表达用户对机器学习模型的期望(例如检测轮椅上的行人、处理极端天气)。
  • 使用具体场景——模型设计、调试、维护、协作与外部质量保证——说明能力如何贯穿机器学习生命周期应用。
  • 提出实例化策略,如数据整理(例如收集轮椅使用者的图像)、分布偏移模拟(例如将晴天图像转换为雨天图像)、基于切片的测试(例如按行人年龄划分)。
  • 借鉴软件工程与需求工程的现有实践(例如边界对象、变态测试)以指导能力的沟通与操作化。
  • 开展探索性研究,评估能力是否能反映模型的泛化能力,使用分布偏移下的性能下降等指标。
  • 将能力构建成层次化结构(例如‘理解否定’作为通用能力,其子能力包括‘处理双重否定’)。

实验结果

研究问题

  • RQ1如何在不同机器学习工程场景中有效发现并重用能力?
  • RQ2在错误分析过程中,哪些机制可改善人机交互以支持能力识别?
  • RQ3如何设计一种可扩展的流程,使专家与非专家均能识别相关能力?
  • RQ4能力的最优粒度应如何设定,以在可重用性与特定性之间取得平衡?
  • RQ5应如何根据上下文与预测能力对能力进行评估与排序?

主要发现

  • 能力可作为模型泛化能力的强指标,初步实验表明其能有效捕捉分布偏移下的性能下降。
  • 能力的层次结构特性使得既能建模广泛可重用的规范,又能一致地表达细粒度、领域特定的行为。
  • 数据整理、分布偏移模拟与基于切片的测试等实例化策略,能有效从抽象能力生成具体测试用例。
  • 亟需共享词汇表与冲突解决机制,以对齐利益相关者的期望,尤其是在专家与非专家对能力的描述存在差异时。
  • 将能力整合到机器学习工程中,需应对发现、沟通与实例化方面的挑战,同时存在显著的自动化与工具支持机会。
  • 现有的软件工程实践——如单元测试与变态测试——可为机器学习工作流中能力的操作化提供指导。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。