Skip to main content
QUICK REVIEW

[论文解读] Data Augmentation for Text-based Person Retrieval Using Large Language Models

Zheng Li, Lijia Si|arXiv (Cornell University)|May 20, 2024
Data Quality and Management被引用 4
一句话总结

本文提出 LLM-DA,一种即插即用的文本型行人重识别数据增强方法,利用大语言模型重写训练文本,在保持语义的同时提升多样性。文本忠实度过滤器可去除幻觉内容,平衡采样策略优化了训练数据混合比例,显著提升了多个基准测试下的检索性能。

ABSTRACT

Text-based Person Retrieval (TPR) aims to retrieve person images that match the description given a text query. The performance improvement of the TPR model relies on high-quality data for supervised training. However, it is difficult to construct a large-scale, high-quality TPR dataset due to expensive annotation and privacy protection. Recently, Large Language Models (LLMs) have approached or even surpassed human performance on many NLP tasks, creating the possibility to expand high-quality TPR datasets. This paper proposes an LLM-based Data Augmentation (LLM-DA) method for TPR. LLM-DA uses LLMs to rewrite the text in the current TPR dataset, achieving high-quality expansion of the dataset concisely and efficiently. These rewritten texts are able to increase the diversity of vocabulary and sentence structure while retaining the original key concepts and semantic information. In order to alleviate the hallucinations of LLMs, LLM-DA introduces a Text Faithfulness Filter (TFF) to filter out unfaithful rewritten text. To balance the contributions of original text and augmented text, a Balanced Sampling Strategy (BSS) is proposed to control the proportion of original text and augmented text used for training. LLM-DA is a plug-and-play method that can be easily integrated into various TPR models. Comprehensive experiments on three TPR benchmarks show that LLM-DA can improve the retrieval performance of current TPR models.

研究动机与目标

  • 解决由于隐私限制和高昂标注成本导致的大规模高质量文本型行人重识别(TPR)数据集稀缺问题。
  • 克服传统文本增强方法的局限性,这些方法常因语义扭曲或多样性降低而损害性能。
  • 利用大语言模型(LLMs)的语义生成能力,为 TPR 生成多样、忠实且高质量的文本增强样本。
  • 通过专用的文本忠实度过滤器(TFF)缓解 LLM 幻觉问题,确保增强后的文本与原始描述在语义上保持一致。
  • 通过平衡采样策略(BSS)控制训练过程中原始文本与增强文本的贡献比例,以提升模型泛化能力与性能。

提出的方法

  • 使用预训练的大语言模型(如 Vicuna)重写 TPR 数据集中原始的文本描述,生成语义等价但结构多样的变体。
  • 应用文本忠实度过滤器(TFF),利用句子编码器计算原始文本与重写文本之间的语义相似度;仅保留相似度高于阈值 α 的重写文本。
  • 引入平衡采样策略(BSS),通过采样阈值 β 控制训练过程中原始文本与增强文本的比例。
  • 将 LLM-DA 作为即插即用模块集成到现有 TPR 模型中,无需修改网络结构或损失函数。
  • 使用 CLIP(ViT-B/16)作为主干模型进行评估,采用原始文本与过滤后/增强后的文本混合进行训练。
  • 通过在 ICFG-PEDES 上的消融实验优化超参数 α(TFF 阈值)和 β(BSS 采样比例),以在降噪与数据多样性之间取得平衡。

实验结果

研究问题

  • RQ1与传统增强方法相比,基于 LLM 的文本重写是否能显著提升文本型行人重识别中的检索性能?
  • RQ2文本忠实度过滤器在 TPR 数据增强中能在多大程度上减轻 LLM 幻觉的负面影响?
  • RQ3平衡原始文本与增强文本的比例对 TPR 模型泛化能力与性能有何影响?
  • RQ4TFF 与 BSS 的最优超参数设置(α 与 β)是什么,可使检索准确率在多个基准上达到最大?
  • RQ5LLM-DA 是否可作为即插即用模块,无需架构修改,在不同 TPR 模型上有效且通用地应用?

主要发现

  • LLM-DA 在三个基准测试上显著提升了检索性能:在 ICFG-PEDES 上 Rank-1 准确率最高提升 4.2%,在 CUHK-PEDES 上提升 3.8%。
  • 文本忠实度过滤器(TFF)通过过滤语义不一致的增强文本,减少了噪声数据,当 α = 0.6 时,ICFG-PEDES 上性能提升 2.1%。
  • 平衡采样策略(BSS)提升了泛化能力,最优性能出现在 β = 0.2 时,此时增强文本的贡献显著但未淹没训练信号。
  • 超参数分析表明,当 α > 0.8 时性能下降,因文本多样性不足;当 β > 0.3 时性能下降,因噪声增加与分布偏移。
  • 定性结果表明,LLM-DA 生成的文本比传统方法(如回译或随机删除)更流畅、语义更丰富且结构更多样。
  • 结合 TFF、BSS 与 LLM 重写可获得最佳性能,表明三者在功能上具有互补优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。