[논문 리뷰] Interactive Data Synthesis for Systematic Vision Adaptation via LLMs-AIGCs Collaboration
이 논문은 대규모 언어 모델(Large Language Models, LLMs)과 AIGC 모델(예: Stable Diffusion) 간의 협업 프롬프트를 활용하여 체계적인 비전 적응을 위한 고품질, 다양한, 정밀하게 애너테이션된 합성 이미지를 생성하는 새로운 상호작용식 데이터 합성 프레임워크인 ChatGenImage를 제안한다. LLM을 통한 글로벌 및 로컬 프롬프트 지도 하에 반복적으로 이미지 생성을 개선함으로써, 희귀하거나 알려지지 않은 도메인에 대해서도 제어 가능하고 비용 효율적인 데이터 증강을 가능하게 하여, 최소한의 인간 참여로 최종 모델의 일반화 성능을 크게 향상시킨다.
Recent text-to-image generation models have shown promising results in generating high-fidelity photo-realistic images. In parallel, the problem of data scarcity has brought a growing interest in employing AIGC technology for high-quality data expansion. However, this paradigm requires well-designed prompt engineering that cost-less data expansion and labeling remain under-explored. Inspired by LLM's powerful capability in task guidance, we propose a new paradigm of annotated data expansion named as ChatGenImage. The core idea behind it is to leverage the complementary strengths of diverse models to establish a highly effective and user-friendly pipeline for interactive data augmentation. In this work, we extensively study how LLMs communicate with AIGC model to achieve more controllable image generation and make the first attempt to collaborate them for automatic data augmentation for a variety of downstream tasks. Finally, we present fascinating results obtained from our ChatGenImage framework and demonstrate the powerful potential of our synthetic data for systematic vision adaptation. Our codes are available at https://github.com/Yuqifan1117/Labal-Anything-Pipeline.
연구 동기 및 목표
- 합성 데이터를 활용한 확장 가능하고 저비용의 데이터 증강을 통해 시각 작업에서의 데이터 부족과 도메인 이동 문제를 해결한다.
- 기존 AIGC 기반 데이터 합성의 한계를 극복하여, 일반적으로 단순하고 객체 중심의 이미지만 생성하며, 시나리오 복잡도와 도메인 다양성이 제한된 결과를 내는 문제를 해결한다.
- LLM의 제로샷 추론 및 지시 수행 능력을 활용하여 AIGC 모델이 복잡하고 의미적으로 풍부한 시나리오를 생성하도록 이끌며, 세밀한 애너테이션을 제공한다.
- LLM을 통한 프롬프트 엔지니어링과 AIGC를 통한 이미지 생성을 조합한 상호작용적이고 반복적인 파이프라인을 개발하여, 최종 시각 작업에 대한 제어 가능하고 확장 가능한 데이터 확장을 가능하게 한다.
제안 방법
- 입력 레이블 기반으로 글로벌 및 로컬 프롬프트를 생성하기 위해, 제로샷 프롬프팅 전략을 사용하여 gpt-3.5-turbo를 LLM로 활용한다.
- LLM이 생성한 프롬프트에서 512×512 해상도의 이미지를 생성하기 위해 Stable Diffusion v1.5를 AIGC 백본으로 사용하며, 추론 안정성을 확보하기 위해 온도를 0으로 설정한다.
- LLM이 생성된 이미지를 분석하고 누락되거나 잘못된 요소를 식별한 후, 현실감과 의미 정확도를 향상시키기 위해 정교한 로컬 편집 프롬프트를 제출하는 반복적 개선 루프를 구현한다.
- 생성된 이미지 내 객체 존재 및 공간 관계를 자동으로 탐지하고 검증하기 위해 레이블 기반 툴킷을 통합하여 의미 일관성을 확보한다.
- 오픈-보라시 객체 검출을 적용하여 원래 객체 의미나 배경 맥락을 유지하지 못하는 이미지를 걸러내며, 높은 품질의 의미적으로 일치하는 출력만 유지한다.
- 텍스트 제약 조건과 이미지 콘텐츠 간의 의미 일치 스코어를 사용하여 이미지 후보를 순위 매기며, 낮은 신뢰도 결과는 기각하여 데이터 품질을 확보한다.
실험 결과
연구 질문
- RQ1희귀하거나 낯선 개념에 대해서도 LLM이 반복적 프롬프팅을 통해 AIGC 모델이 복잡하고 다양한, 의미적으로 정확한 이미지를 생성하는 데 효과적으로 기여할 수 있는가?
- RQ2LLM과 AIGC 모델 간의 협업은 단순한 프롬프트 기반 AIGC 생성 방식에 비해 합성 데이터의 제어 가능성과 품질을 얼마나 향상시키는가?
- RQ3이 상호작용적 파이프라인을 통해 생성된 합성 데이터가, 알려지지 않은 도메인에서 최종 시각 모델의 일반화 능력과 강건성을 얼마나 향상시키는가?
- RQ4이 프레임워크는 일반적으로 표준 데이터 증강에서 간과되는 세밀한 애너테이션과 다양한 시나리오 구성(예: 야간, 눈, 숲)을 체계적으로 생성할 수 있는가?
- RQ5반복적 개선 과정이 생성된 이미지 내 환각 현상과 객체 일관성, 공간 관계를 얼마나 효과적으로 수정하는가?
주요 결과
- ChatGenImage는 표준 분류기에서 낯선 개념일 수 있는 희귀 및 멸종 위험 종에 대해 고해상도의 복잡한 시나리오 이미지와 세밀한 애너테이션을 성공적으로 생성한다.
- 반복적인 LLM-AIGC 협업은 이미지 품질과 의미 정확도를 크게 향상시켜, 일반적으로 데이터 증강에서 생략되는 다양한 시나리오(예: 산, 숲, 야간)를 생성할 수 있도록 한다.
- 텍스트 프롬프트와 생성된 이미지 간의 높은 의미 일치도를 달성하였으며, 객체 검출 및 의미 스코어 기반 필터링을 통해 오직 고품질의 출력만 유지한다.
- 전체 파이프라인이 소비자용 GPU(예: Nvidia RTX 3090) 하나에서 실행되며 인간 간섭 최소화로 비용 효율적이고 확장 가능한 데이터 증강을 실현한다.
- 정성적 결과는 LLM이 AIGC 모델이 특정 객체 관계와 공간 배치(예: 산간 풍경에서 눈 덮인 나무와 강)를 효과적으로 통합하도록 이끌 수 있음을 보여준다.
- 이 프레임워크는 알려지지 않은 도메인과 장꼬리 카테고리까지 커버하는 합성 데이터를 생성함으로써 체계적인 비전 적응 잠재력을 보이며, 실제 환경 배포에서 모델의 강건성을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.