[论文解读] SeqTR: A Simple yet Universal Network for Visual Grounding
该论文提出 SeqTR,一种基于 Transformer 的简单而通用的视觉定位网络,通过使用离散坐标标记将边界框和掩码预测重新表述为序列点预测。通过使用单一交叉熵损失和共享架构统一短语定位、指代表达理解与分割任务,SeqTR 在五个基准测试中实现了最先进或具有竞争力的性能,且无需任务特定头或复杂损失函数。
In this paper, we propose a simple yet universal network termed SeqTR for visual grounding tasks, e.g., phrase localization, referring expression comprehension (REC) and segmentation (RES). The canonical paradigms for visual grounding often require substantial expertise in designing network architectures and loss functions, making them hard to generalize across tasks. To simplify and unify the modeling, we cast visual grounding as a point prediction problem conditioned on image and text inputs, where either the bounding box or binary mask is represented as a sequence of discrete coordinate tokens. Under this paradigm, visual grounding tasks are unified in our SeqTR network without task-specific branches or heads, e.g., the convolutional mask decoder for RES, which greatly reduces the complexity of multi-task modeling. In addition, SeqTR also shares the same optimization objective for all tasks with a simple cross-entropy loss, further reducing the complexity of deploying hand-crafted loss functions. Experiments on five benchmark datasets demonstrate that the proposed SeqTR outperforms (or is on par with) the existing state-of-the-arts, proving that a simple yet universal approach for visual grounding is indeed feasible. Source code is available at https://github.com/sean-zhuh/SeqTR.
研究动机与目标
- 通过消除任务特定架构和损失函数,简化视觉定位建模。
- 在单一共享网络结构下统一短语定位、指代表达理解与分割任务。
- 通过统一的优化目标,降低视觉-语言对齐中多任务学习的复杂性。
- 实现端到端训练,最大限度减少架构与损失设计。
- 证明简单通用方法可在视觉定位任务中达到或超越最先进性能。
提出的方法
- 将视觉定位重新表述为序列预测问题,其中边界框和二值掩码通过离散坐标标记表示。
- 使用标准 Transformer 编码器-解码器架构,从图像和文本输入自回归地预测坐标标记。
- 通过顺时针轮廓采样表示掩码,将像素级分割转换为 N 个点的序列。
- 使用单一交叉熵损失在所有任务上进行训练,消除对任务特定损失函数的需求。
- 在训练过程中应用点顺序打乱,以提升泛化能力和对序列顺序的鲁棒性。
- 在无需架构修改的情况下实现多任务训练,支持 REC 和 RES 的联合优化。
实验结果
研究问题
- RQ1视觉定位任务能否在无需任务特定分支的情况下,通过单一简单架构统一?
- RQ2通用交叉熵损失能否替代视觉定位中复杂的任务特定损失函数?
- RQ3通过坐标标记生成的序列点预测是否能保持边界框和掩码的空间精度?
- RQ4单一模型能否在不进行架构特化的情况下,在定位和分割基准上均实现优异性能?
- RQ5点采样策略与序列打乱对模型泛化能力和性能有何影响?
主要发现
- SeqTR 在五个基准数据集(RefCOCO、RefCOCO+、RefCOCOg、ReferItGame 和 Flickr30K Entities)上实现了最先进或具有竞争力的性能。
- 在 RefCOCO 上,SeqTR 达到 80.38% 的 REC 准确率和 78.03% 的 mIoU(RES),在 mIoU 上优于先前方法,同时保持高定位准确率。
- 通过均匀采样和 18 个点,模型实现 95.57% 的上界 mIoU,表明掩码重建具有高保真度。
- 与单任务训练相比,多任务训练性能略有下降,表明在基于序列的范式中,REC 和 RES 预测是独立的。
- 训练过程中引入点顺序打乱可提升收敛速度与鲁棒性,0.2 的打乱比例在 RefCOCO 和 RefCOCO+ 上表现最优。
- SeqTR 在显著更低的预训练成本下,优于大规模 BERT 风格模型,展现出高效与高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。