[논문 리뷰] Not Every Image is Worth a Thousand Words: Quantifying Originality in Stable Diffusion
이 논문은 텍스트-이미지 확산 모델에서 원본성(originality)을 측정하기 위해 이미지를 재구성하는 데 필요한 텍스트 역전환 토큰의 수를 측정하는 방법을 제안한다. 더 적은 토큰이 필요한 경우 모델의 익숙함이 높고, 원본성이 낮다는 것을 의미한다. 이 방법은 토큰 수와 개념적 신선도 사이의 상관관계를 보이며, 원본적인 이미지일수록 재구성에 더 많은 토큰이 필요하다는 점을 입증함으로써, 훈련 데이터 접근이 불필요하고 모델 내부에 기반한 법적 원본성 정의와 일치하는 메트릭을 제공한다.
This work addresses the challenge of quantifying originality in text-to-image (T2I) generative diffusion models, with a focus on copyright originality. We begin by evaluating T2I models' ability to innovate and generalize through controlled experiments, revealing that stable diffusion models can effectively recreate unseen elements with sufficiently diverse training data. Then, our key insight is that concepts and combinations of image elements the model is familiar with, and saw more during training, are more concisly represented in the model's latent space. We hence propose a method that leverages textual inversion to measure the originality of an image based on the number of tokens required for its reconstruction by the model. Our approach is inspired by legal definitions of originality and aims to assess whether a model can produce original content without relying on specific prompts or having the training data of the model. We demonstrate our method using both a pre-trained stable diffusion model and a synthetic dataset, showing a correlation between the number of tokens and image originality. This work contributes to the understanding of originality in generative models and has implications for copyright infringement cases.
연구 동기 및 목표
- 저작권법의 맥락에서 텍스트-이미지 확산 모델의 원본성을 정량화하는 데 어려움을 해결하기 위해.
- 훈련 데이터나 특정 프롬프트에 접근하지 않아도 원본성을 평가할 수 있는 방법을 개발하기 위해.
- 모델이 생성한 콘텐츠 평가를 창의성과 저작권자가 주도하는 요건에 맞추기 위해.
- 잠재 공간 토큰화로 측정한 모델의 익숙함이 원본성의 대체 지표가 될 수 있음을 입증하기 위해.
- 실제 및 합성 응용 분야에서 생성형 AI 출력물의 원본성과 일반성에 대한 감사를 수행할 수 있는 프레임워크를 제공하기 위해.
제안 방법
- 모델의 잠재 공간 내에서 이미지 내용을 압축된 학습 가능한 토큰 세트로 인코딩하기 위해 텍스트 역전환을 활용한다.
- 텍스트 역전환를 사용해 주어진 이미지를 재구성하는 데 필요한 토큰 수를 측정하며, 높은 토큰 수는 더 높은 원본성을 의미한다.
- 합성 데이터로 미리 훈련된 Stable Diffusion 모델과 자체 훈련된 모델을 사용해 다양한 설정에서 방법을 검증한다.
- 합성 데이터셋(형태, 색상, 크기)과 실제 이미지에서 토큰 수와 원본성 간의 상관관계를 분석한다.
- 재구성된 이미지와 원본 이미지를 비교하기 위해 DreamSim 알고리즘을 적용하여 토큰화 과정의 정밀도와 타당성을 확보한다.
- 일반적으로 훈련 데이터에서 자주 등장하는 개념은 표현에 더 적은 토큰이 필요하며, 이는 낮은 원본성을 반영한다는 가설에 기반한다.

실험 결과
연구 질문
- RQ1훈련 데이터에 접근하지 않아도 텍스트-이미지 확산 모델을 사용해 생성된 이미지의 원본성을 정량적으로 평가할 수 있는가?
- RQ2이미지를 재구성하는 데 필요한 텍스트 역전환 토큰 수가 개념적 새로움 또는 원본성과 어떻게 상관관계가 있는가?
- RQ3모델의 훈련 데이터에 대한 익숙함이 토큰 수로 나타날 때, 이미지가 일반적인지 원본적인지 예측하는 데 얼마나 유용한가?
- RQ4이 방법은 창의성과 저작권자가 주도하는 요건을 강조하는 법적 원본성 정의와 일치할 수 있는가?
- RQ5다양한 이미지 유형과 모델 아키텍처에서 토큰 수 기반 원본성 메트릭은 얼마나 견고한가?
주요 결과
- 재구성에 더 많은 텍스트 역전환 토큰이 필요한 이미지는 모델에게 낯설거나 새로운 개념을 나타내어 더 높은 원본성을 지닌다.
- 일상적인 이미지, 예를 들어 반 고헤의 '별이 빛나는 밤'은 단일 토큰으로 재구성 가능하며, 이는 모델의 높은 익숙함과 낮은 원본성을 의미한다.
- 이 방법은 합성 및 실제 이미지 데이터셋 모두에서 토큰 수와 원본성 간의 상관관계를 성공적으로 입증하며, 일관된 성능을 보였다.
- 다양하고 다양한 묘사로 프롬프트가 주어졌을 때, Stable Diffusion 모델은 새로운 요소에 대해 잘 일반화되어 있어 혁신 능력을 입증한다.
- 이 프레임워크는 훈련 데이터 접근이 불필요하고 프롬프트에 영향을 받지 않는 원본성 평가 방법을 제공하여, 법적 및 감사 응용에 적합하다.
- 결과적으로 기존의 기억 최소화를 추구하는 관념을 도전하며, 다양성과 균형을 이루는 경우 넓은 모델의 익숙함이 원본성 생성을 향상시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.