Skip to main content
QUICK REVIEW

[논문 리뷰] Retriever: Learning Content-Style Representation as a Token-Level Bipartite Graph

Dacheng Yin, Xuanchi Ren|arXiv (Cornell University)|2022. 02. 24.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

Retriever는 토큰 수준의 이분 그래프로 모델링함으로써 모odal-agnostic이고 비지도 학습 기반의 콘텐츠-스타일 분리 표현을 학습하는 프레임워크를 제안한다. 이는 스타일 검색을 위해 교차 어텐션을 사용하고, 설명 가능한 콘텐츠 토큰을 위해 맨-유도 제약 조건을 적용한 벡터 양자화(vector quantization) 및 재구성에 위해 신규 링크 어텐션 모듈을 도입한다. 이 프레임워크는 음성 변환 분야에서 최고 수준의 제로샷 성능과 이미지에서 경쟁적인 파트 발견 성능을 달성하여 강력한 분리성과 생성 잠재력을 입증한다.

ABSTRACT

This paper addresses the unsupervised learning of content-style decomposed representation. We first give a definition of style and then model the content-style representation as a token-level bipartite graph. An unsupervised framework, named Retriever, is proposed to learn such representations. First, a cross-attention module is employed to retrieve permutation invariant (P.I.) information, defined as style, from the input data. Second, a vector quantization (VQ) module is used, together with man-induced constraints, to produce interpretable content tokens. Last, an innovative link attention module serves as the decoder to reconstruct data from the decomposed content and style, with the help of the linking keys. Being modal-agnostic, the proposed Retriever is evaluated in both speech and image domains. The state-of-the-art zero-shot voice conversion performance confirms the disentangling ability of our framework. Top performance is also achieved in the part discovery task for images, verifying the interpretability of our representation. In addition, the vivid part-based style transfer quality demonstrates the potential of Retriever to support various fascinating generative tasks. Project page at https://ydcustc.github.io/retriever-demo/.

연구 동기 및 목표

  • 순열 불변성 기반으로 구조화된 데이터에서 콘텐츠와 스타일을 통합적이고 모달에 관계없이 정의하는 것.
  • 모달 특화 또는 데이터셋 특화 정의 없이 콘텐츠와 스타일을 분해할 수 있는 비지도 학습 프레임워크 개발.
  • 학습 가능한 이분 그래프 구조를 통해 콘텐츠와 스타일의 세밀하고 해석 가능한 조작을 가능하게 하는 것.
  • 음성 및 시각 작업 모두에서 고해상도 데이터 재구성 및 하류 작업 성능을 달성하는 것.

제안 방법

  • 스타일을 토큰 수준에서 순열 불변성(P.I.) 정보로 정의하고, 콘텐츠를 나머지 순서 민감성 정보로 정의한다.
  • 공유 프로토타입을 사용한 교차 어텐션 모듈을 통해 입력 데이터에서 P.I. 스타일 토큰을 검색한다.
  • 맨-유도 제약 조건을 적용한 벡터 양자화(VQ)를 통해 이산적이고 해석 가능한 콘텐츠 토큰을 생성한다.
  • 링킹 키를 사용하여 콘텐츠 쿼리 기반의 스타일 검색을 통해 콘텐츠와 스타일로부터 데이터를 재구성하는 데 사용되는 링크 어텐션 모듈을 도입한다.
  • 재구성 손실, VQ 다양성 손실, 구조적 제약 손실의 조합을 사용하여 모델을 엔드 투 엔드로 훈련한다.
  • 모달에 관계없는 성질을 확보하기 위해 모달 특화 인덕티브 바이어스 없이 토큰 수준 표현에서 작동하는 구성 요소를 설계한다.

실험 결과

연구 질문

  • RQ1음성과 이미지와 같은 다양한 모달에 걸쳐 통합적이고 순열 불변성 정의된 스타일을 적용할 수 있는가?
  • RQ2쌍화된 데이터나 모달 특화 감독 없이도 콘텐츠와 스타일을 비지도 방식으로 분리할 수 있는가?
  • RQ3토큰 수준의 이분 그래프 구조가 하류 작업을 위한 콘텐츠와 스타일에 대한 세밀하고 해석 가능한 제어를 가능하게 하는가?
  • RQ4제안된 링크 어텐션 메커니즘이 분리된 콘텐츠와 스타일 표현으로부터 효과적으로 데이터를 재구성하는가?
  • RQ5이 프레임워크는 LibriSpeech와 같이 캐리어되지 않은 벤치마크를 초월해 실제 세계의 다양한 데이터셋에 일반화 가능한가?

주요 결과

  • 10개의 타겟 발화 문장을 사용할 때, CMU Arctic 데이터셋에서 99.6%의 유사도 정확도를 기록하여 제로샷 음성 변환 성능에서 최고 수준을 달성한다.
  • LibriSpeech 데이터셋에서 60개의 스타일 토큰을 사용할 경우 98.4%의 스피커 인증 정확도와 3.13의 MOSNet 점수를 기록하여 복잡한 실제 환경에서도 뛰어난 안정성을 입증한다.
  • 절단 실험 결과에서 구조적 제약과 VQ 다양성 손실이 모두 필수적임을 확인하였으며, 이들의 결여로 인해 음성 품질이 저하되어 MOSNet 점수가 2.94로 떨어진다.
  • 모델은 하이퍼파rameter 변화에 강건하다: 손실 가중치 설정 범위가 넓은 범위에서 스피커 인증 정확도는 ±0.45% 이내, MOSNet 점수는 ±0.02 이내로 변동한다.
  • 이미지에서의 파트 수준 스타일 전이 결과는 생생하고 해석 가능한 결과를 도출하여 학습된 콘텐츠 및 스타일 표현의 해석 가능성 확인.
  • 이 프레임워크는 이미지의 파트 발견에서 경쟁적인 성능을 달성하여 맨-유도 제약 조건을 통해 유도된 콘텐츠 토큰의 해석 가능성 검증.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.