[论文解读] Unsupervised Domain Adaptation for Training Event-Based Networks Using Contrastive Learning and Uncorrelated Conditioning
本文提出了一种新颖的无监督域自适应(UDA)方法,用于基于对比学习和不相关条件化的事件神经网络训练。通过利用未配对的帧数据作为源域,该方法通过增强不变表示学习提升特征泛化能力,并在事件特征与帧特征之间强制实现不相关表示,分别在Caltech101→N-Caltech101和CIFAR10→CIFAR10-DVS基准上实现了2.0%和3.7%的准确率提升,超越了当前最先进方法。
Event-based cameras offer reliable measurements for preforming computer vision tasks in high-dynamic range environments and during fast motion maneuvers. However, adopting deep learning in event-based vision faces the challenge of annotated data scarcity due to recency of event cameras. Transferring the knowledge that can be obtained from conventional camera annotated data offers a practical solution to this challenge. We develop an unsupervised domain adaptation algorithm for training a deep network for event-based data image classification using contrastive learning and uncorrelated conditioning of data. Our solution outperforms the existing algorithms for this purpose.
研究动机与目标
- 通过利用未配对的帧数据集实现域自适应,解决事件数据标注稀缺的挑战。
- 在无需配对事件-帧数据的情况下,提升事件神经网络的表示学习能力。
- 通过新颖的损失约束,减少帧数据与事件数据分布之间的域偏移。
- 利用对比学习与不相关条件化,增强模型泛化能力与特征解耦。
- 仅使用源域标注,实现与监督学习相当的目标事件数据集性能。
提出的方法
- 通过将同一物体的不同增强版本映射到共享潜在空间,应用对比学习以学习增强不变表示。
- 引入不相关条件化损失,确保事件相机下物体的潜在表示与帧相机下其外观之间互不相关。
- 为帧和事件输入使用共享编码器,对比学习与不相关条件化分别使用独立的投影头。
- 通过结合对比损失(基于余弦相似度)与不相关条件化损失联合优化模型,两者均作用于同一模态输入。
- 采用动量编码器与多层感知机(MLP)作为投影头,但发现额外的MLP或动量组件无法提升性能。
- 对损失权重进行超参数调优,发现对比损失与不相关条件化损失采用相等权重(1.0)时性能最优。
实验结果
研究问题
- RQ1在事件视觉的无监督域自适应中,结合数据增强的对比学习能否提升泛化能力?
- RQ2在帧特征与事件特征之间强制实现不相关表示,是否能带来更好的解耦与性能提升?
- RQ3在未配对的帧到事件域自适应任务中,该方法相较于当前最先进UDA方法的性能如何?
- RQ4架构选择(如动量编码器与额外MLP)对模型性能有何影响?
- RQ5所提出的约束是否能通过去除帧边界等伪特征,提升生成事件数据的质量?
主要发现
- 在Caltech101→N-Caltech101基准上,该方法相比最先进方法实现了2.0%的准确率提升。
- 在CIFAR10→CIFAR10-DVS基准上观察到3.7%的性能增益,表明具有强大的泛化能力。
- 结合对比学习与不相关条件化可带来1.9%的性能提升,其中各组件分别贡献1.1%与1.2%。
- 与基线及先前方法相比,该模型生成的事件数据质量更高,伪影线(如帧边界)更少。
- UMap可视化结果表明,使用该方法时,类别聚类更清晰分离且重叠更少,表明域对齐效果更优。
- 额外的MLP层与动量组件无法提升性能,表明其可能削弱了所提两种约束的指导作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。