[論文レビュー] AltDiffusion: A Multilingual Text-to-Image Diffusion Model
AltDiffusion は、18 の言語(低資源言語や文化的に繊細な言語を含む)をサポートする多言語テキスト-to-画像拡散モデルであり、多言語テキストエンコーダーの知識蒸留と、事前学習済みの英語専用拡散モデルの二段階訓練スキームによる微調整によって実現されている。これは翻訳ベースの Stable Diffusion や既存の多言語モデルよりも文化的に特化した概念を理解する点で優れており、高い画像品質を維持している。
Large Text-to-Image(T2I) diffusion models have shown a remarkable capability to produce photorealistic and diverse images based on text inputs. However, existing works only support limited language input, e.g., English, Chinese, and Japanese, leaving users beyond these languages underserved and blocking the global expansion of T2I models. Therefore, this paper presents AltDiffusion, a novel multilingual T2I diffusion model that supports eighteen different languages. Specifically, we first train a multilingual text encoder based on the knowledge distillation. Then we plug it into a pretrained English-only diffusion model and train the model with a two-stage schema to enhance the multilingual capability, including concept alignment and quality improvement stage on a large-scale multilingual dataset. Furthermore, we introduce a new benchmark, which includes Multilingual-General-18(MG-18) and Multilingual-Cultural-18(MC-18) datasets, to evaluate the capabilities of T2I diffusion models for generating high-quality images and capturing culture-specific concepts in different languages. Experimental results on both MG-18 and MC-18 demonstrate that AltDiffusion outperforms current state-of-the-art T2I models, e.g., Stable Diffusion in multilingual understanding, especially with respect to culture-specific concepts, while still having comparable capability for generating high-quality images. All source code and checkpoints could be found in https://github.com/superhero-7/AltDiffuson.
研究の動機と目的
- 既存のテキスト-to-画像拡散モデルが主に英語、中国語、日本語に限定されているという限界に対処する。
- 世界の第一言語話者 46.94% および第二言語話者 27.64% をカバーする 18 種類の多様な言語で、高品質な画像生成を可能にする。
- 文化的に特化した概念(例:人名、芸術的伝統)に関して、翻訳に起因する誤りや情報損失を回避する。
- 一般の画像品質と文化的に特化した概念の理解の両方を評価する包括的なベンチマークを開発する。
- ControlNet や LoRA などの既存の後続ツールとの互換性を確保し、実世界の応用における制御性を向上させる。
提案手法
- 18 の言語を共有の意味的空間に埋め込むために、知識蒸留を用いて多言語テキストエンコーダーを訓練する。
- 凍結された多言語テキストエンコーダーを、事前学習済みの英語専用拡散モデル(例:Stable Diffusion)のテキストエンコーダー部として統合する。
- 二段階訓練スキームを適用する:第一段階では、LAION-5B を用いて UNet のクロスアテンション層の K と V 行列のみを微調整し、クロスアテンションの整合性を向上させる。第二段階では、UNet のすべてのパラメータを解放し、LAION Aesthetics で微調整して画像品質を向上させる。
- 生成品質と多様性を向上させるために、トレーニング中に分類器フリー・ガイドランスを採用する。
- 初期の整合性を図るために多言語データセット(LAION-5B)を、最終的な精錬のために高品質サブセット(LAION Aesthetics)を用いる。
- 元のモデルアーキテクチャーや重み構造を保持することで、ControlNet や LoRA などの後続ツールとの互換性を確保する。
実験結果
リサーチクエスチョン
- RQ118 の多様な言語で高品質な画像品質と意味的整合性を維持しながら、多言語テキスト-to-画像拡散モデルを効果的に訓練できるか?
- RQ2文化的に特化した概念に関して、翻訳ベースのアプローチと比較して、モデルの多言語理解性能はどの程度優れているか?
- RQ3翻訳や再エンコーディングを必要とせずに、混合言語プロンプト(例:中国語-韓国語、タイ語-英語)に対してどの程度一般化できるか?
- RQ4二段階訓練戦略は、多言語環境下でクロスアテンションの整合性と画像品質向上を効果的にバランスさせられるか?
- RQ5伝統芸術、人名、地域的慣用句といった文化的に繊細な概念について、異なる言語でどの程度の性能を示すか?
主な発見
- MC-18 ベンチマークにおいて、AltDiffusion は翻訳ベースの Stable Diffusion よりも CLIP 類似度(CLIP Sim)が高く、平均スコア差は 0.769 対 0.231 であった。
- MC-18 ベンチマークにおいて、AltDiffusion は文化的に特化した概念理解(平均 4.125)と画像-テキスト整合性(平均 3.775)の両面で翻訳ベースの SD よりも高い人間評価スコアを達成しており、優れた多言語理解能力を示している。
- MG-18 において、AltDiffusion は FID、IS、CLIP Sim スコアで、既存の多言語モデル(Taiyi や日本語版 SD)を上回り、一般の画像品質と整合性の分野で最先端の性能を示している。
- モデルは文化的に正確な出力を生成する——例:中国伝統画や日本の桜の風景——一方で、翻訳ベースの SD は油絵や現実的画像といった不適切なスタイルを生成している。
- AltDiffusion は混合言語プロンプト(例:中国語-韓国語、タイ語-英語)を効果的に処理し、翻訳ステップなしに一貫性があり文脈的に正確な画像を生成している。
- ControlNet や LoRA と完全に互換性があり、アーキテクチャの変更なしに画像生成における高度な制御を可能としている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。