Skip to main content
QUICK REVIEW

[论文解读] Domain-Aware Dynamic Networks

Tianyuan Zhang, BoRui Wu|arXiv (Cornell University)|Nov 26, 2019
Domain Adaptation and Few-Shot Learning参考文献 51被引用 7
一句话总结

本文提出领域感知动态网络(DDN),一种在推理时根据输入领域动态调整权重的动态神经网络,可在不增加FLOPs或延迟的情况下提升模型容量。通过利用数据局部性——即输入数据在短时间内保持在单一领域内——DDN动态地将多个专家权重组合为每个领域专用的低复杂度模型,在BDD100K数据集上相比静态网络最高实现2.6%的AP50提升。

ABSTRACT

Deep neural networks with more parameters and FLOPs have higher capacity and generalize better to diverse domains. But to be deployed on edge devices, the model's complexity has to be constrained due to limited compute resource. In this work, we propose a method to improve the model capacity without increasing inference-time complexity. Our method is based on an assumption of data locality: for an edge device, within a short period of time, the input data to the device are sampled from a single domain with relatively low diversity. Therefore, it is possible to utilize a specialized, low-complexity model to achieve good performance in that input domain. To leverage this, we propose Domain-aware Dynamic Network (DDN), which is a high-capacity dynamic network in which each layer contains multiple weights. During inference, based on the input domain, DDN dynamically combines those weights into one single weight that specializes in the given domain. This way, DDN can keep the inference-time complexity low but still maintain a high capacity. Experiments show that without increasing the parameters, FLOPs, and actual latency, DDN achieves up to 2.6\% higher AP50 than a static network on the BDD100K object-detection benchmark.

研究动机与目标

  • 解决边缘部署中模型容量与计算复杂度之间的权衡问题。
  • 利用数据局部性——即输入数据在短时间内保持在单一领域内——以提升泛化能力。
  • 设计一种在保持低推理时复杂度的同时,可在多样化领域中实现更高准确率的动态网络。
  • 在不增加参数量、FLOPs或边缘设备实际延迟的前提下,实现高容量模型的性能表现。

提出的方法

  • 提出一种动态网络架构,其中每一层包含多组权重(专家)。
  • 使用控制器网络基于从输入数据中提取的领域表征计算动态融合权重。
  • 通过专家权重的可学习线性组合,将最终层权重与输入领域关联。
  • 使用主干网络提取领域表征,并将其输入控制器以生成特定于领域的融合系数。
  • 只要输入领域保持不变,就复用相同的融合权重配置,从而保持低推理成本。
  • 采用端到端训练方式,损失函数旨在提升各领域内的预测准确性,同时保持低计算开销。

实验结果

研究问题

  • RQ1通过利用数据局部性,能否在不增加推理时复杂度的前提下提升模型容量?
  • RQ2动态网络在保持低计算成本的同时,能否有效适应不同输入领域?
  • RQ3控制器是否能泛化到不同的领域划分策略,还是对训练时的领域划分方式敏感?
  • RQ4领域感知的动态加权在BDD100K等多样化真实世界基准上,能在多大程度上提升性能?

主要发现

  • DDN在BDD100K目标检测基准上,相比静态网络最高实现2.6%的AP50提升,且未增加参数量、FLOPs或实际延迟。
  • 当评估时的领域划分策略与训练时不匹配时,性能显著下降(例如,AP50从39.6%降至38.52%),表明控制器对领域划分方式敏感。
  • t-SNE可视化结果表明,同一领域的图像在权重因子空间中被聚类在一起,证实控制器学习到了有意义的领域特定表征。
  • 权重因子可视化显示,即使在直观预期相反的领域之间,也获得了不同的融合系数,证明模型具备学习非平凡领域特定适应能力。
  • 即使在领域划分不匹配的情况下,DDN仍优于单一静态网络(38.08% vs. 37.4% AP50),表明其对分布偏移具有鲁棒性。
  • 若未在新领域划分上进行显式训练,控制器无法泛化到新的领域划分,表明领域表征必须与训练策略对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。