[논문 리뷰] LAION-5B: An open large-scale dataset for training next generation image-text models
LAION-5B는 CLIP로 필터링된 5.85B 이미지-텍스트 쌍의 공개 오픈 데이터셋을 제공하여 CLIP-유사 모델과 생성 모델의 대규모 재현 및 미세조정을 가능하게 한다.
Groundbreaking language-vision architectures like CLIP and DALL-E proved the utility of training on large amounts of noisy image-text data, without relying on expensive accurate labels used in standard vision unimodal supervised learning. The resulting models showed capabilities of strong text-guided image generation and transfer to downstream tasks, while performing remarkably at zero-shot classification with noteworthy out-of-distribution robustness. Since then, large-scale language-vision models like ALIGN, BASIC, GLIDE, Flamingo and Imagen made further improvements. Studying the training and capabilities of such models requires datasets containing billions of image-text pairs. Until now, no datasets of this size have been made openly available for the broader research community. To address this problem and democratize research on large-scale multi-modal models, we present LAION-5B - a dataset consisting of 5.85 billion CLIP-filtered image-text pairs, of which 2.32B contain English language. We show successful replication and fine-tuning of foundational models like CLIP, GLIDE and Stable Diffusion using the dataset, and discuss further experiments enabled with an openly available dataset of this scale. Additionally we provide several nearest neighbor indices, an improved web-interface for dataset exploration and subset generation, and detection scores for watermark, NSFW, and toxic content detection. Announcement page https://laion.ai/laion-5b-a-new-era-of-open-large-scale-multi-modal-datasets/
연구 동기 및 목표
- 대규모의 공개 데이터셋을 공개하여 다중모달 연구를 민주화한다
- 다양한 다운스트림 태스크에서 CLIP-유사 모델의 재현 및 벤치마킹을 가능하게 한다
- 편향 및 콘텐츠 안전성을 연구하기 위해 NSFW, 워터마크, 다국어를 포함한 도구와 안전장치를 제공한다
- 데이터셋 규모가 제로샷 및 강건성 성능에 미치는 영향을 탐구한다
- 대규모 비정제 데이터셋의 윤리적 고려사항과 한계를 논의한다
제안 방법
- Common Crawl에서 세 단계 파이프라인(웹페이지 필터링, 이미지-텍스트 쌍 다운로드, 콘텐츠 필터링)을 사용하여 데이터를 수집한다
- 영어 및 다국어 변형에 대해 ViT-B/32 CLIP를 사용한 CLIP 기반 코사인 유사도로 이미지-텍스트 쌍을 필터링한다
- 텍스트 언어를 CLD3로 분류하고 언어 인식 필터링 및 메타데이터 태깅을 적용한다
- 최근접 이웃 검색 인터페이스 제공 및 하위집합 추출(예: LAION-2B-en, LAION-Aesthetic)
- 안전 태깅(NSFW, 워터마크) 및 Parquet 메타데이터를 포함한 오픈 소스 도구 및 데이터세트를 공개한다
- 제로샷 및 강건성 성능을 검증하기 위해 LAION-400M 및 LAION-2B-en에서 CLIP 재현 실험을 수행한다
실험 결과
연구 질문
- RQ1공개적이고 대규모의 이미지-텍스트 데이터셋이 업계에서 사용되는 대규모 비공개 데이터셋의 제로샷 및 강건성 성능에 맞출 수 있는가?
- RQ2오픈 CLIP-유사 학습에서 데이터 및 모델 규모를 늘리는 것이 다운스트림 제로샷 정확도와 VTAB-유사 벤치마크에 어떤 영향을 미치는가?
- RQ3정제되지 않은 웹 데이터로 다중모달 모델을 학습시킬 때의 함의, 편향, 안전성 고려사항은 무엇인가?
- RQ4클립 기반 필터링이 십억 규모의 데이터의 품질 관리를 얼마나 효과적으로 수행하는지, 그리고 이러한 필터링의 한계는 무엇인가?
주요 결과
- LAION-400M 및 2B-en에서 학습된 CLIP 모델은 OpenAI의 WIT 데이터로 학습된 CLIP과 비교하여 제로샷 ImageNet 및 강건성 성능에서 경쟁력을 보인다.
- 충분한 컴퓨팅 자원이 주어진 경우 LAION-2B-en으로의 확장은 LAION-400M 대비 여러 데이터셋과 프롬프트에서 성능을 향상시킨다.
- LAION-5B는 GLIDE와 같은 생성 모델의 재현 및 미세조정을 가능하게 하여 생성 작업으로의 이전을 입증한다.
- 저자들은 연구 및 데이터셋 탐색을 촉진하기 위해 최근접 이웃 인덱스, CLIP 검색 UI 등 여러 하위집합과 도구를 제공한다.
- 이 데이터셋은 완성된 산출물이 아니며 편향 및 안전성 영향에 대한 신중한 분석과 함께 학술 연구에 사용되어야 한다.
- 다운스트림 테스트 세트와 보조 텍스트의 품질/잡음은 일반화 평가에서 중요한 고려사항이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.