[논문 리뷰] Visual Concepts Tokenization
이 논문은 교차 attention과 새로운 개념 분리 손실을 사용하여 이미지에서 시각적 개념을 독립적이고 순서에 민감하지 않은 개념 토큰으로 분리하는 비지도 학습 기반의 트랜스포머 기반 프레임워크인 Visual Concepts Tokenization (VCT)을 제안한다. VCT는 CLEVR에서 0.923 ARI, Tetris에서 0.760 MSC를 기록하며 분리 표현 학습과 장면 분해 분야에서 최신 기준 성능을 달성하며, 언어에 정렬된 토큰 조작을 통해 제로샷 이미지 편집 및 재조합을 가능하게 한다.
Obtaining the human-like perception ability of abstracting visual concepts from concrete pixels has always been a fundamental and important target in machine learning research fields such as disentangled representation learning and scene decomposition. Towards this goal, we propose an unsupervised transformer-based Visual Concepts Tokenization framework, dubbed VCT, to perceive an image into a set of disentangled visual concept tokens, with each concept token responding to one type of independent visual concept. Particularly, to obtain these concept tokens, we only use cross-attention to extract visual information from the image tokens layer by layer without self-attention between concept tokens, preventing information leakage across concept tokens. We further propose a Concept Disentangling Loss to facilitate that different concept tokens represent independent visual concepts. The cross-attention and disentangling loss play the role of induction and mutual exclusion for the concept tokens, respectively. Extensive experiments on several popular datasets verify the effectiveness of VCT on the tasks of disentangled representation learning and scene decomposition. VCT achieves the state of the art results by a large margin.
연구 동기 및 목표
- 인간이 제공한 레이블 없이 원시 픽셀에서 분리된 시각적 개념을 학습할 수 있는 일반적이고 비지도 학습 기반의 프레임워크를 개발하는 것.
- 객체 수준과 속성 수준의 시각적 개념을 모두 포괄하는 하나의 아키텍처로 분리 표현 학습과 장면 분해를 통합하는 것.
- 개념 토큰이 상호 독립적이고 순서에 민감하지 않으며 재구성 가능하도록 보장하여 완전성, 분리성, 무질서성 성질을 만족하는 것.
- 사전 훈련된 CLIP을 사용해 언어에 정렬된 시각적 토큰을 조작함으로써 제로샷 이미지 편집 및 재조합을 가능하게 하는 것.
- 하이퍼파라미터 조정을 최소화하면서도 대규모 데이터셋에 스케일링 가능한 프레임워크를 개발하는 것.
제안 방법
- VCT는 개념 토크나이저와 개념 디토크나이저를 갖춘 트랜스포머 기반 아키텍처를 사용하며, 이미지 토큰으로부터 교차 attention을 통해 시각적 정보를 추출하기 위해 학습 가능한 개념 프로토타입을 쿼리로 사용한다.
- 개념 토큰 간에 자기 attention이 없음으로써 정보 유출이 방지되어 분리성이 유지되고 토큰 순서의 무질서성이 보장된다.
- 서로 배타적인 조건을 강제하기 위해 새로운 개념 분리 손실이 도입된다: 한 개념 토큰을 수정하면 재구성된 이미지에서 해당 시각적 변형에만 영향을 미쳐야 한다.
- 이미지 토큰은 층별로 교차 attention을 통해 처리되며, 개념 토큰에는 위치 임베딩이 적용되지 않아 무질서성과 독립성을 유지한다.
- 프레임워크는 사전 훈련된 CLIP 이미지 인코더를 토크나이저로 사용하고, CLIP의 텍스트 인코더를 활용해 언어에 정렬된 시각적 개념의 편집 및 복원을 수행한다.
- 개념 토큰은 이미지 간에 공유되며, 객체의 형태, 색상, 크기, 배경 등의 데이터 기반 시각적 개념을 표현하기 위해 엔드 투 엔드로 훈련된다.
실험 결과
연구 질문
- RQ1순수하게 비지도 학습 기반의 어텐션 기반 프레임워크가 상호 독립적이고 순서에 민감하지 않은 분리된 시각적 개념 토큰을 학습할 수 있는가?
- RQ2제안된 프레임워크가 분리 표현 학습과 장면 분해 모두에서 최신 기준 성능을 同시에 달성할 수 있는가?
- RQ3언어에 정렬된 시각적 토큰을 조작함으로써 개념 토큰을 사용해 제로샷 이미지 편집 및 재조합이 가능한가?
- RQ4명시적 감독이나 사전 정의된 템플릿에 의존하지 않고도 의미 있는 데이터 기반의 시각적 개념을 학습하는가?
- RQ5개념 분리 손실이 개념 변형 간 상호 배타성 강제에 얼마나 효과적인가?
주요 결과
- VCT는 CLEVR 데이터셋에서 0.923 ARI, Tetris 데이터셋에서 0.760 평균 세그먼테이션 커버리지(MSC)를 기록하며, COMET(0.916 ARI, 0.713 MSC), MONET(0.873 ARI, 0.701 MSC), Slot Attention(0.818 ARI, 0.750 MSC)을 모두 초월한다.
- 장면 간 개념 토큰을 교체함으로써 제로샷 이미지 재조합이 가능해져, 훈련 데이터보다 더 많은 객체를 포함한 분포 외 이미지를 생성할 수 있다.
- 단일 개념 토큰(예: 객체 크기)의 선형 보간은 부드럽고 의미적으로 유의미한 이미지 전이를 유도하여 연속적이고 분리된 제어를 보여준다.
- CLIP의 텍스트 인코더를 사용해 텍스트 프롬프트에서 디코딩할 때 VCT는 객체 유형(예: 공, 큐브, 실린더)과 속성 수준(예: 작고, 큼)을 성공적으로 구분한다.
- Objects-Room 데이터셋에서 VCT는 객체 정체성과 글로벌 요소(예: 배경 및 바닥 색상)를 모두 포착하지만, COMET은 이러한 글로벌 속성에 대해 어려움을 겪는다.
- 개념 토큰 간 자기 attention이 없고 공유된 프로토타입을 사용한 교차 attention을 적용함으로써 효율적인 추론이 가능해지며, 객체 수에 관계없이 이미지당 한 번의 순방향 전파만으로도 처리된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.