[論文レビュー] Do All Languages Cost the Same? Tokenization in the Era of Commercial Language Models
この論文は、商用言語モデルAPIにおけるサブワードトークン化が、同等の意味的内容であるにもかかわらず、非ラテン文字を使用する言語において不均等なトークン数と高コストを引き起こす要因となっていることを調査している。非代表的言語話者は、トークン化における言語的・符号化的バイアスに起因する、より高い経済的コストと低いモデルパフォーマンスに直面しており、ベンダーに対してより公平な価格設定と透明性を求めるべきであると主張している。
Language models have graduated from being research prototypes to commercialized products offered as web APIs, and recent works have highlighted the multilingual capabilities of these products. The API vendors charge their users based on usage, more specifically on the number of ``tokens'' processed or generated by the underlying language models. What constitutes a token, however, is training data and model dependent with a large variance in the number of tokens required to convey the same information in different languages. In this work, we analyze the effect of this non-uniformity on the fairness of an API's pricing policy across languages. We conduct a systematic analysis of the cost and utility of OpenAI's language model API on multilingual benchmarks in 22 typologically diverse languages. We show evidence that speakers of a large number of the supported languages are overcharged while obtaining poorer results. These speakers tend to also come from regions where the APIs are less affordable to begin with. Through these analyses, we aim to increase transparency around language model APIs' pricing policies and encourage the vendors to make them more equitable.
研究の動機と目的
- 商用言語モデルAPIにおけるトークン化が、サブワード断片化の要因により、言語ごとに不均等なコストを生じるかどうかを調査すること。
- トークン化の格差が、異なる言語における経済的コストとモデルの有用性にどのように影響するかを検討すること。
- これらの格差が、NLP技術へのアクセスにおける既存の社会的・経済的不平等を悪化させているかどうかを評価すること。
- トークナイザーが、商用LLMの公平性においてしばしば見過ごされがちな重要な要因である役割を浮き彫りにすること。
- 多言語ユーザーを対象としたAPI価格設定とモデル設計における、より高い透明性と公平性を提言すること。
提案手法
- FLORES-200ベンチマークから得た22の言語的多様性を持つ言語の並列テキストを、OpenAIのAPIおよびトークナイザーを用いて処理した。
- 入力テキスト長(文字数)と出力トークン数の比較により、言語ごとのトークン化断片化率を測定した。
- 同じ意味的内容を処理するために必要なトークン数を計算することで、異なる言語におけるコスト格差を定量化した。
- インライン学習パフォーマンスを多言語ベンチマークで評価し、トークン数および言語タイプと照らし合わせてモデルの有用性を分析した。
- 高コストなトークン化、パフォーマンスの低さ、および地域の購買力といった社会的・経済的要因との相関を分析した。
- 訓練データの分布を推定するため、言語表現バイアスをモデルの事前学習データに内在するものとみなして、CC100を代理として用いた。

実験結果
リサーチクエスチョン
- RQ1異なる書記体系を持つ言語におけるサブワードトークン化の違いは何か。その結果、トークン数にどのような影響が生じるか。
- RQ2トークン化の違いが、代表されていない言語話者に対して、どの程度不均等なAPIコストを引き起こすか。
- RQ3高水準のトークン化断片化は、インライン学習タスクにおけるモデルの有用性の低下と相関するか。
- RQ4高コスト・低パフォーマンスの言語は、API利用における平均購買力が低い地域で話されている言語と一致するか。
- RQ5言語的および符号化的特性(例:書記体系、Unicode表現)が、トークン化バイアスに果たす役割は何か。
主な発見
- ラテン文字を除く非ラテン文字を使用する言語、特にCJK、アラビア文字、およびその他の複雑な書記体系を用いる言語は、ラテン文字ベースの言語と比較して顕著に高いトークン化断片化を経験している。
- 同じ意味的内容を処理する場合、日本語や中国語では英語と比較して最大2.5倍のトークンが必要となり、直接的にAPIコストが増加している。
- 高トークン数の言語では、インライン学習ベンチマークでのパフォーマンスが低く、入力コンテンツが同一であってもモデルの有用性が低下していることが示された。
- 過度に断片化された言語を使用する人々は、一般的に低所得地域に住んでおり、高コストなAPI利用がより大きな負担となり、デジタル格差を悪化させている。
- コスト格差は、単にデータの不足に起因するのではなく、Unicode書記体系の複雑さや文字頻度パターンといった、言語的・符号化的特性に根ざしている。
- 本研究は、同じ情報を伝えているにもかかわらず、現在のAPI価格モデルが非ラテン文字利用者に対して根本的に不公平であることを明らかにした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。