Skip to main content
QUICK REVIEW

[论文解读] Deep Submodular Functions

Jeffrey A. Bilmes, Wenruo Bai|arXiv (Cornell University)|Jan 31, 2017
Machine Learning and Algorithms参考文献 27被引用 20
一句话总结

本文提出了深度子模函数(DSFs),一种受深度神经网络启发的灵活且分层的子模函数族。DSFs 广义化了 SCMM,其表达能力随深度严格增加,并可通过可微架构实现子模函数的端到端学习,为机器学习中的表征学习与优化提供了新类别。

ABSTRACT

We start with an overview of a class of submodular functions called SCMMs (sums of concave composed with non-negative modular functions plus a final arbitrary modular). We then define a new class of submodular functions we call {\em deep submodular functions} or DSFs. We show that DSFs are a flexible parametric family of submodular functions that share many of the properties and advantages of deep neural networks (DNNs). DSFs can be motivated by considering a hierarchy of descriptive concepts over ground elements and where one wishes to allow submodular interaction throughout this hierarchy. Results in this paper show that DSFs constitute a strictly larger class of submodular functions than SCMMs. We show that, for any integer $k>0$, there are $k$-layer DSFs that cannot be represented by a $k'$-layer DSF for any $k'

研究动机与目标

  • 开发一种新型子模函数族,继承深度神经网络的分层、分布式表征特性。
  • 解决在具有 $2^n$ 自由度的高维复杂数据空间中选择或学习合适子模函数的挑战。
  • 建立一个正式的深度子模函数框架,支持机器学习中的表征学习、优化与泛化。
  • 证明 DSFs 严格广义化 SCMM,且其表达能力随深度严格增加,与浅层网络不同。
  • 通过可微架构实现子模函数的端到端学习,包括特征映射与子模函数的联合学习。

提出的方法

  • 将 DSFs 定义为通过多层递归组合而成的函数,其中每一层对非负模函数应用一个凹函数,形成深层结构。
  • 使用 Lovász 扩展使 DSFs 可微,从而兼容在连续域上的基于梯度的优化。
  • 引入反单调超微分的概念以表征子模函数,并将其与负的二阶偏导数及连续子模性联系起来。
  • 提出一种参数化畸变度量 $d_{w, heta}(x_i, x_j) = \breve{f}_w(\tilde{h}_\theta(x_i) + \tilde{h}_\theta(x_j) - 2\tilde{h}_\theta(x_i) \otimes \tilde{h}_\theta(x_j))$,结合深度神经网络特征映射 $\tilde{h}_\theta$ 与子模函数 $f_w$。
  • 制定联合学习目标 $J(w, \theta) = \sum_{i,j} \|d(x_i,x_j) - d_{w,\theta}(x_i,x_j)\|$,以同时训练特征编码器 $\tilde{h}_\theta$ 与子模函数参数 $w$。
  • 利用拟阵理论(特别是层状拟阵)建立理论基础,分析 DSF 的表达能力,并与秩函数进行比较。

实验结果

研究问题

  • RQ1能否形式化定义一种分层的、深度的子模函数架构,并证明其广义化了如 SCMM 等现有家族?
  • RQ2增加 DSF 的层数是否严格提升其表达能力?这种依赖于深度的容量是否与浅层模型有本质区别?
  • RQ3DSFs 能否表示所有子模函数?其表达能力是否存在根本性限制?
  • RQ4当没有标注的子模函数值时,如何从数据中有效学习 DSFs?
  • RQ5DSFs 与其他子模家族(如熵函数或拟阵秩函数)之间存在何种关系?

主要发现

  • DSFs 严格广义化 SCMM,构成一个更大且更具表达力的子模函数族。
  • 对于任意 $k > 0$,均存在无法由任何 $k'$ 层 DSF(其中 $k' < k$)表示的 $k$ 层 DSF,证明深度提供了严格递增的表达能力。
  • 所有子模函数的集合严格大于 DSF 的集合,通过类似反向传播的矛盾论证假设 DSFs 具有通用性,从而得出此结论。
  • DSFs 通过 Lovász 扩展支持可微优化,从而实现特征表示与子模函数的端到端训练。
  • 联合学习目标 $J(w, \theta)$ 允许同时训练深度神经网络特征映射 $\tilde{h}_\theta$ 与子模函数 $f_w$,以保持原始数据间的距离。
  • 该框架支持诸如哈希函数与子模函数的联合学习,并为下游任务提供参数化畸变度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。