Skip to main content
QUICK REVIEW

[논문 리뷰] Data Augmentation for Text-based Person Retrieval Using Large Language Models

Zheng Li, Lijia Si|arXiv (Cornell University)|2024. 05. 20.
Data Quality and Management인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models)을 사용해 텍스트 기반 인물 검색 훈련 텍스트를 재작성함으로써 다양성을 높이면서도 의미를 유지하는 플러그 앤 플레이 데이터 증강 방법인 LLM-DA를 제안한다. 의미에 어긋나는 내용을 제거하기 위해 텍스트 충실도 필터(TFF)를 적용하고, 원본 및 증강 데이터의 비율을 균형 있게 조절하기 위한 균형 잡힌 샘플링 전략(BSS)을 도입하여, 다양한 벤치마크에서 검색 성능을 크게 향상시킨다.

ABSTRACT

Text-based Person Retrieval (TPR) aims to retrieve person images that match the description given a text query. The performance improvement of the TPR model relies on high-quality data for supervised training. However, it is difficult to construct a large-scale, high-quality TPR dataset due to expensive annotation and privacy protection. Recently, Large Language Models (LLMs) have approached or even surpassed human performance on many NLP tasks, creating the possibility to expand high-quality TPR datasets. This paper proposes an LLM-based Data Augmentation (LLM-DA) method for TPR. LLM-DA uses LLMs to rewrite the text in the current TPR dataset, achieving high-quality expansion of the dataset concisely and efficiently. These rewritten texts are able to increase the diversity of vocabulary and sentence structure while retaining the original key concepts and semantic information. In order to alleviate the hallucinations of LLMs, LLM-DA introduces a Text Faithfulness Filter (TFF) to filter out unfaithful rewritten text. To balance the contributions of original text and augmented text, a Balanced Sampling Strategy (BSS) is proposed to control the proportion of original text and augmented text used for training. LLM-DA is a plug-and-play method that can be easily integrated into various TPR models. Comprehensive experiments on three TPR benchmarks show that LLM-DA can improve the retrieval performance of current TPR models.

연구 동기 및 목표

  • 개인정보 보호 제약과 높은 비용의 주석 작업으로 인해 대규모 고품질의 텍스트 기반 인물 검색(TPR) 데이터셋이 부족한 문제를 해결하기 위해.
  • 기존의 전통적 텍스트 증강 방법은 의미를 왜곡하거나 다양성을 감소시켜 성능을 떨어뜨리는 경향이 있기 때문에 이를 극복하기 위해.
  • 대규모 언어 모델(LLM)의 의미 생성 능력을 활용하여 TPR를 위한 다양하고 충실하며 고품질의 텍스트 증강을 생성하기 위해.
  • LLM의 환각 현상을 방지하기 위해 전용 텍스트 충실도 필터(TFF)를 도입하여 증강된 텍스트가 원본 기술과 의미적으로 일치하도록 보장하기 위해.
  • 원본 및 증강 텍스트의 기여도를 균형 있게 조절하기 위해 훈련 중에 균형 잡힌 샘플링 전략(BSS)을 적용하여 모델의 일반화 능력과 성능을 향상시키기 위해.

제안 방법

  • 기존의 TPR 데이터셋에 포함된 원본 텍스트 기술을 사전 학습된 LLM(예: Vicuna)을 사용해 재작성하여 의미는 유지하되 구조적으로 다양성이 있는 변형을 생성한다.
  • 원본 텍스트와 재작성된 텍스트 간의 의미 유사도를 문장 인코더를 사용해 계산하는 텍스트 충실도 필터(TFF)를 적용하며, 유사도가 임계값 α 이상인 경우에만 재작성된 텍스트를 유지한다.
  • 원본 및 증강 텍스트의 비율을 샘플링 임계값 β를 통해 제어하는 균형 잡힌 샘플링 전략(BSS)을 도입한다.
  • 기존 TPR 모델의 아키텍처나 손실 함수를 수정하지 않고도 LLM-DA를 플러그 앤 플레이 모듈로 통합할 수 있도록 한다.
  • 평가를 위해 CLIP(ViT-B/16)를 백본 모델로 사용하며, 원본 및 필터링된/증강된 텍스트를 혼합하여 훈련한다.
  • ICFG-PEDES에서의 추론 분석을 통해 TFF의 임계값 α와 BSS의 샘플링 비율 β를 최적화하여 노이즈 감소와 데이터 다양성 간의 균형을 확보한다.

실험 결과

연구 질문

  • RQ1기존의 전통적 증강 방법에 비해 LLM 기반 텍스트 재작성이 텍스트 기반 인물 검색에서 성능 향상에 크게 기여하는가?
  • RQ2텍스트 충실도 필터(TFF)는 LLM 환각 현상이 TPR의 데이터 증강에 악영향을 미치는 데 얼마나 효과적으로 기여하는가?
  • RQ3원본 텍스트와 증강 텍스트의 비율을 균형 있게 조절함으로써 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
  • RQ4모든 벤치마크에서 검색 정확도를 최대화하기 위해 TFF와 BSS에 최적의 하이퍼파라미터 설정(α 및 β)이 존재하는가?
  • RQ5LLM-DA는 아키텍처 변경 없이 다양한 TPR 모델에 효과적이고 일반적으로 적용 가능한 플러그 앤 플레이 모듈로 기능하는가?

주요 결과

  • LLM-DA는 세 가지 벤치마크에서 검색 성능을 크게 향상시켰다. ICFG-PEDES에서는 순위-1 정확도가 최대 4.2% 향상되었고, CUHK-PEDES에서는 3.8% 향상되었다.
  • 텍스트 충실도 필터(TFF)는 의미적으로 일치하지 않는 증강 텍스트를 걸러내어 노이즈 데이터를 감소시켰으며, α = 0.6일 때 ICFG-PEDES에서 2.1%의 성능 향상을 이끌어냈다.
  • 균형 잡힌 샘플링 전략(BSS)은 일반화 능력을 향상시켰고, 최적의 성능는 β = 0.2에서 관찰되었으며, 이는 증강 텍스트가 훈련 신호를 지배하지 않으면서도 의미 있는 기여를 한다는 것을 의미한다.
  • 하이퍼파라미터 분석 결과, α > 0.8일 경우 과도한 다양성 부족으로 성능 저하가 발생하고, β > 0.3일 경우 노이즈와 분포 이탈로 인해 성능이 떨어졌다.
  • 정성적 분석 결과, 전통적 방법(예: 역번역 또는 무작위 삭제)에 비해 LLM-DA는 더 유창하고 의미적으로 풍부하며 구조적으로 다양한 텍스트를 생성하는 것으로 확인되었다.
  • TFF, BSS, LLM 재작성의 조합이 가장 뛰어난 성능을 보였으며, 세 구성 요소가 상호보완적인 이점을 제공하는 것으로 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.