Skip to main content
QUICK REVIEW

[논문 리뷰] Emojich -- zero-shot emoji generation using Russian language: a technical report

Alex Shonenkov, Daria Bakshandaeva|arXiv (Cornell University)|2021. 12. 04.
Hand Gesture Recognition Systems인용 수 4
한 줄 요약

이 논문은 ruDALL-E Malevich (XL)에서 파생된 1.3B 파라미터 모델을 미세조정하여 러시아어 설명에서 스타일화된 러시아어 이모지 생성을 목표로 하는 Emojich를 제시한다. 8비트 Adam 최적화와 코드북 벡터에 대한 가중치가 부여된 교차 엔트로피 손실을 사용하여, 40 에포크의 미세조정 후 높은 수준의 이모지 스타일링을 달성하였으며, 사용자 맞춤 스티커 생성을 위한 공개 텔레그램 봇을 통해 결과를 제공한다.

ABSTRACT

This technical report presents a text-to-image neural network "Emojich" that generates emojis using captions in Russian language as a condition. We aim to keep the generalization ability of a pretrained big model ruDALL-E Malevich (XL) 1.3B parameters at the fine-tuning stage, while giving special style to the images generated. Here are presented some engineering methods, code realization, all hyper-parameters for reproducing results and a Telegram bot where everyone can create their own customized sets of stickers. Also, some newly generated emojis obtained by "Emojich" model are demonstrated.

연구 동기 및 목표

  • Unicode에 새로운 이모지 제안이 필요 없이 러시아어 캡션에서 스타일화된 이모지를 생성할 수 있는 제로샷 텍스트-이미지 모델을 개발하는 것.
  • 사전학습된 ruDALL-E Malevich (XL) 모델의 세계 지식을 유지하면서도 출력 스타일을 이모지 미학에 맞게 조정하는 것.
  • 미세조정된 생성과 자동 분할을 통해 공개 텔레그램 봇을 통해 사용자가 개인화된 이모지 스티커를 생성할 수 있도록 하는 것.
  • 제한된 캡션 변형에 대한 과적합을 방지하기 위해 이미지 코드북 벡터에 대한 고가중치 교차 엔트로피 손실을 적용하는 것.
  • 투명 배경을 가진 RGBA 형식으로 변환하는 데 있어 강력하고 확장 가능한 파이프라인을 개발하여 생성된 이모지 이미지를 스티커로 직접 사용할 수 있도록 하는 것.

제안 방법

  • catastrophic forgetting을 방지하기 위해 자기 어텐션 및 피드포워드 레이어를 동결하여 1.3B 파라미터 ruDALL-E Malevich (XL) 모델을 미세조정한다.
  • 스タイ링 적응을 강조하면서도 의미적 내용을 유지하기 위해 이미지 코드북 벡터에 대해 계수 10³의 가중치가 부여된 교차 엔트로피 손실을 적용한다.
  • 8비트 Adam 최적화기와 fp16 정밀도를 사용하며, 배치 크기가 2인 40 에포크 동안 일주기 학습률 스케줄러(초기 4e-7, 피크 1e-5, 최종 2e-8)를 적용한다.
  • VQ-VAE 디코더에서 잠재 벡터의 자동회귀 디코딩을 위해 nucleus 샘플링(top-p = 0.995)과 top-k = 2048, 온도 = 1.0을 사용한다.
  • MobileStyleGAN에서 유도된 역할 이산 웨이블릿 변환(IDWT) 모듈을 활용하여 이미지 해상도를 256×256에서 512×512로 증가시킨다.
  • 가짜 레이블링과 수동 보정을 통해 훈련 세트를 246,089장으로 확장한, EfficientNetB7 인코더를 갖춘 U-Net을 사용하여 생성된 이모지의 이진 세그먼테이션을 훈련한다.

실험 결과

연구 질문

  • RQ1ruDALL-E Malevich (XL)와 같은 대규모 다중모odal 사전학습 모델이 유니코드에 새로운 이모지 제안 없이도 치명적인 기억 상실 없이 러시아어에서 스타일화된 문화적으로 적절한 이모지를 효과적으로 생성할 수 있는가?
  • RQ2제한적이고 모호한 캡션 데이터를 바탕으로 하여도, 모델이 고화질 이미지 생성을 유지하면서도 이모지의 독특한 시각적 스타일에 적응할 수 있는가?
  • RQ3러시아어 이모지와 같은 저자원, 고스タイ일화된 데이터셋에 대해 대규모 시각-언어 모델을 미세조정하는 데 가장 효과적인 훈련 및 최적화 전략은 무엇인가?
  • RQ4생성된 이모지 이미지의 배경 제거를 자동으로 신뢰성 있게 달성할 수 있는가? 이를 통해 메시징 플랫폼에서 직접 사용할 수 있도록 하는가?
  • RQ5모델이 새로운, 분포 외의 프롬프트에 대해 얼마나 잘 일반화되는가? 동시에 정체성과 이모지 스타일을 유지하는가?

주요 결과

  • 2,749장의 러시아어 캡션 이모지 이미지에 대해 40 에포크의 미세조정을 거친 후, 모델은 사실적인 사진을 생성하던 방식에서 스타일화된 이모지 유사 출력으로 성공적으로 전환되었다.
  • 약 12,000개의 반복 후 모델은 인식 가능한 이모지 스타일 이미지를 생성하기 시작했으며, 56,000개의 반복 이후 일관된 스타일링이 관찰되었다.
  • 68,000개의 반복 이후 모델은 의미적 정밀도를 상실하기 시작하여, 균일하고 무명의 사람(예: '아인슈타인'이 수염을 가진 모르는 남자로 변형됨)으로 구성된 이미지를 생성하여 과적합 또는 모드 붕괴를 나타냈다.
  • U-Net 기반 분할 파이프라인은 높은 신뢰도를 보였으며, 신뢰도 임계값(≥0.99)을 통해 99%의 생성 이미지를 자동 처리할 수 있었고, 나머지 경우는 수동 윤곽 기반 방법으로 해결하였다.
  • 최종 모델은 시드=42와 프롬프트당 16개 샘플을 사용하여 스티커로 직접 사용 가능한 고품질의 이모지 이미지를 생성하였으며, 512개 샘플의 샘플링과 수동 선택을 통해 추가 품질 향상이 가능했다.
  • 공개 텔레그램 봇이 성공적으로 배포되어 사용자가 미세조정된 Emojich 모델과 분할 파이프라인을 활용해 맞춤형 이모지 스티커 세트를 생성하고 내보낼 수 있게 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.