[論文レビュー] Assessing Multilingual Fairness in Pre-trained Multimodal Representations
本稿では、CLIPのような事前学習済みマルチモーダルモデルが言語をまたいでどのように評価されるかを評価するため、多言語対応の個人的公平性およびグループ公平性メトリクスを導入する。言語間で意味的類似性は保持されている(個人的公平性)ものの、特に低リソース言語において顕著な精度格差が生じており、人種、性別、年齢層ごとの予測に偏りが生じることを明らかにした。これは、多言語マルチモーダルAIにおける深刻な公平性のギャップを示している。
Recently pre-trained multimodal models, such as CLIP, have shown exceptional capabilities towards connecting images and natural language. The textual representations in English can be desirably transferred to multilingualism and support downstream multimodal tasks for different languages. Nevertheless, the principle of multilingual fairness is rarely scrutinized: do multilingual multimodal models treat languages equally? Are their performances biased towards particular languages? To answer these questions, we view language as the fairness recipient and introduce two new fairness notions, multilingual individual fairness and multilingual group fairness, for pre-trained multimodal models. Multilingual individual fairness requires that text snippets expressing similar semantics in different languages connect similarly to images, while multilingual group fairness requires equalized predictive performance across languages. We characterize the extent to which pre-trained multilingual vision-and-language representations are individually fair across languages. However, extensive experiments demonstrate that multilingual representations do not satisfy group fairness: (1) there is a severe multilingual accuracy disparity issue; (2) the errors exhibit biases across languages conditioning the group of people in the images, including race, gender and age.
研究の動機と目的
- 事前学習済み多言語マルチモーダルモデルが、公平性の観点からすべての言語を同等に扱っているかどうかを調査すること。
- 多言語マルチモーダル表現学習における体系的な公平性評価の欠如に対処すること。
- 視覚的グランドイングを基準として用いることで、多言語マルチモーダル環境における公平性の概念——個人的公平性およびグループ公平性——を形式化すること。
- 実証的に、多言語モデルが言語および交差的デモグラフィックグループごとに顕著な精度格差を示していることを示すこと。
- 視覚的表現の選択がグループ公平性メトリクスに与える影響を強調し、下流の応用において注意を喚起すること。
提案手法
- 異なる言語における類義的なテキストスニペットが、同じ画像に等しく関連づけられるべきであるという多言語個人的公平性を定義する。
- 下流タスクにおいて、すべての言語で同等の予測性能を示すべきであるという多言語グループ公平性を定義する。
- 画像と多言語テキストを共有埋め込み空間にエンコードするため、CLIPをベースモデルとして用い、類似度計算に用いる。
- 人間がアノテートした属性(人種、性別、年齢)を有するFairFaceデータセットを活用し、言語およびデモグラフィック次元におけるグループ公平性を評価する。
- 言語的バイアスと意味的変動を分離するために、同じ数値的年齢値を有する中立的で記述的なテキストプロンプトを構築する。
- 画像とテキストの埋め込み間のコサイン類似度を測定することで、モデルの整合性と公平性を評価する。
実験結果
リサーチクエスチョン
- RQ1意味的に同等のテキストが異なる言語に翻訳された場合、同じ画像に類似したアライメントを示すという多言語個人的公平性を、事前学習済み多言語マルチモーダルモデルがどの程度満たしているか?
- RQ2下流の視覚言語タスクにおいて、すべての言語で同等の性能を示すという多言語グループ公平性は成立するか?
- RQ3人種、性別、年齢などの保護対象属性を用いて評価する際、精度格差は言語ごとにどのように変動するか?
- RQ4視覚的表現の選択が、多言語環境におけるグループ公平性メトリクスにどの程度影響を及ぼすか?
- RQ5同じ数値的年齢値が異なる言語に記述されていても、年齢分類における顕著な言語間格差が生じるか?
主な発見
- 多言語個人的公平性は基本的に満たされており、意味的に同等のテキストが異なる言語で同じ画像に一貫したアライメントを示している。
- 顕著な多言語精度格差が存在する:乳児年齢分類において、英語では5.8%、ドイツ語では89.4%、日本語では91.6%の精度を示した。
- 年齢分類において、男性と女性のグループ間で顕著な言語間ジェンダー格差が生じている。
- モデルはドイツ語や日本語のような高リソース言語に対して強いバイアスを示しており、特定のデモグラフィックカテゴリにおいてはフランス語のような低リソース言語では性能が著しく劣っている。
- グループ公平性メトリクスは、視覚的表現の選択に敏感であることが判明し、モデル設計の選択が公平性の結果に影響を及ぼすことを示している。
- 同じ数値的年齢値がテキストプロンプトに記述されていても、言語ごとに精度に顕著な差が生じており、モデル内に言語的および文化的なエンコードバイアスが存在していることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。