[论文解读] Cross-Task Consistency Learning Framework for Multi-Task Learning
本文提出了一种用于两任务多任务学习(MTL)的跨任务一致性学习框架,通过一种新颖的跨任务一致性损失和对齐损失,强制不同任务之间的预测保持一致,从而提升性能。该方法在XTasC-Net中实现,通过在特定任务的网络之间传递预测,实现了在Cityscapes和NYU数据集上的最先进结果,且参数量更少,尤其在深度估计和语义分割方面表现优异,mIoU提升,深度误差降低。
Multi-task learning (MTL) is an active field in deep learning in which we train a model to jointly learn multiple tasks by exploiting relationships between the tasks. It has been shown that MTL helps the model share the learned features between tasks and enhance predictions compared to when learning each task independently. We propose a new learning framework for 2-task MTL problem that uses the predictions of one task as inputs to another network to predict the other task. We define two new loss terms inspired by cycle-consistency loss and contrastive learning, alignment loss and cross-task consistency loss. Both losses are designed to enforce the model to align the predictions of multiple tasks so that the model predicts consistently. We theoretically prove that both losses help the model learn more efficiently and that cross-task consistency loss is better in terms of alignment with the straight-forward predictions. Experimental results also show that our proposed model achieves significant performance on the benchmark Cityscapes and NYU dataset.
研究动机与目标
- 为解决在不依赖立体视觉或专门数据采集的情况下,学习多任务学习(MTL)中有效任务关系的挑战。
- 通过强制两个相关任务(如语义分割与深度估计)的预测保持一致,提升MTL的泛化能力和效率。
- 开发一种适用于立体和单目数据集(如Cityscapes(立体)和NYU(红外))的自监督MTL框架。
- 从理论和实证上验证一种新型损失形式——跨任务一致性损失——在增强预测对齐和模型鲁棒性方面的有效性。
- 在基准数据集上展示相比现有MTL方法更高的参数效率和更优的性能。
提出的方法
- 该框架引入了两种新颖的损失项:对齐损失和跨任务一致性损失,灵感来源于循环一致性与对比学习。
- 采用双分支结构:一个用于直接预测(从输入图像生成),另一个用于任务间转移的预测(将一个任务的预测结果作为另一任务的输入)。
- 跨任务一致性损失计算一个任务的转移预测与另一任务真实标签之间的损失,以在任务间强制保持一致性。
- 对齐损失确保两个任务的预测在潜在空间中对齐,促进共享表征学习。
- 该模型命名为XTasC-Net,为两个任务均使用编码器-解码器网络,并利用交叉预测传递来挖掘任务间的关系。
- 理论分析证明,跨任务一致性损失在近似直接预测方面优于对齐损失,且其上界为一个较小的值。
实验结果
研究问题
- RQ1自监督MTL框架是否能在不依赖立体数据的情况下,提升语义分割与深度估计任务的性能?
- RQ2通过转移预测强制实现跨任务一致性,如何影响模型的泛化能力和性能表现?
- RQ3所提出的跨任务一致性损失在理论上和实证上是否优于对齐损失,能更有效地捕捉任务间关系?
- RQ4该框架是否能在使用更少参数的情况下实现最先进性能?
- RQ5该方法是否能在不同数据采集模式(如立体与红外相机)下实现良好泛化?
主要发现
- 在Cityscapes数据集上,XTasC-Net实现了30.31的mIoU和0.2235的相对深度误差,优于所有基线模型,包括AdaMT-Net在mIoU和相对误差上的表现。
- 在NYU数据集上,XTasC-Net实现了30.31的mIoU和0.5954的绝对深度误差,相较于基线ST-Net,mIoU提升了7.87个百分点,相对误差降低了0.0288。
- 该模型在Cityscapes和NYU数据集上均达到了最先进性能,显著提升了分割mIoU和深度估计精度。
- 跨任务一致性损失被证明在理论上优于对齐损失,能更准确地近似直接预测,且其值被限制在一个较小范围内。
- 该方法具有参数效率,适用于立体和单目数据集,而此前的自监督MTL方法通常需要立体图像对。
- 在Cityscapes上的定性结果表明,该模型生成的深度预测更具对比性,可能是由于从语义分割到深度预测的信息迁移所致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。