Skip to main content
QUICK REVIEW

[論文レビュー] Skill-Mix: a Flexible and Expandable Family of Evaluations for AI models

Dingli Yu, Simran Kaur|arXiv (Cornell University)|Oct 26, 2023
Scientific Computing and Data Management被引用数 6
ひとこと要約

本論文では、ランダムなトピック・スキルの組み合わせに基づいてテキストを生成することで、大規模言語モデル(LLM)が複数の言語的および推論スキルを新しい方法で統合できる能力を評価する、柔軟でスケーラブルな評価フレームワーク「Skill-Mix」を紹介する。この手法は、訓練データを超えた合成を要するため、汚染や「 cramming 」(順位上位獲得のための記憶)を回避する。結果から、k=5の組み合わせにおいてGPT-4が優れたパフォーマンスを示したことは、GPT-4が「確率的パペット」(stochastic parrot)の行動を超えており、真の一般化能力を有している可能性を示唆している。

ABSTRACT

With LLMs shifting their role from statistical modeling of language to serving as general-purpose AI agents, how should LLM evaluations change? Arguably, a key ability of an AI agent is to flexibly combine, as needed, the basic skills it has learned. The capability to combine skills plays an important role in (human) pedagogy and also in a paper on emergence phenomena (Arora & Goyal, 2023). This work introduces Skill-Mix, a new evaluation to measure ability to combine skills. Using a list of $N$ skills the evaluator repeatedly picks random subsets of $k$ skills and asks the LLM to produce text combining that subset of skills. Since the number of subsets grows like $N^k$, for even modest $k$ this evaluation will, with high probability, require the LLM to produce text significantly different from any text in the training set. The paper develops a methodology for (a) designing and administering such an evaluation, and (b) automatic grading (plus spot-checking by humans) of the results using GPT-4 as well as the open LLaMA-2 70B model. Administering a version of to popular chatbots gave results that, while generally in line with prior expectations, contained surprises. Sizeable differences exist among model capabilities that are not captured by their ranking on popular LLM leaderboards ("cramming for the leaderboard"). Furthermore, simple probability calculations indicate that GPT-4's reasonable performance on $k=5$ is suggestive of going beyond "stochastic parrot" behavior (Bender et al., 2021), i.e., it combines skills in ways that it had not seen during training. We sketch how the methodology can lead to a Skill-Mix based eco-system of open evaluations for AI capabilities of future models.

研究の動機と目的

  • 現在のLLM評価には、訓練データの汚染や順位上位獲得のための「cramming」(記憶)に対する脆弱性があるという課題を解決すること。
  • モデルが訓練中に見られなかった新しい組み合わせのスキルを柔軟に統合できる能力を測定する評価を開発すること。
  • 将来のAI能力のベンチマークに適応可能な、スケーラブルでオープンかつアップグレード可能な評価フレームワークを構築すること。
  • 統計的模倣を超えた真の一般化や新しい推論能力を検出できること。
  • 人間によるスポットチェックを併用した自動採点手法を提供することで、信頼性とスケーラビリティを確保すること。

提案手法

  • 明確な定義と例を伴うN個のコアスキル(例:隠喩、誤解を招く表現、モードゥス・ポンエンス)を定義する。
  • 訓練データに低頻度だが無視できない頻度で出現するT個のトピックを選択する(例:「デュエル」、「庭いじり」)。
  • 各評価インスタンスにおいて、N個のスキルからk個のサブセットをランダムに抽出し、T個のトピックから1つを抽出する。
  • LLMに、選択されたトピックの文脈で、k個のスキルをすべて示す3文のテキストを生成させる。
  • GPT-4またはLLaMA-2 70Bを用いて、スキルの実装状況に基づき出力内容を自動採点し、検証のための人的スポットチェックを実施する。
  • kを増加させることで評価をスケーリングし、N choose kの組み合わせ数が指数関数的に増加するため、記憶の可能性が著しく低下する。

実験結果

リサーチクエスチョン

  • RQ1LLMは、訓練中に見られなかったスキルとトピックの新しい組み合わせについて、整合的でスキルを統合したテキストを生成できるか?
  • RQ2現在のLLMは、スキルの組み合わせ性能によって測定した場合、記憶を超えた一般化をどの程度示しているか?
  • RQ3標準のリーダーボード順位と比較して、最先端のLLMがスキルの組み合わせにおいてどの程度のパフォーマンスを示すか?
  • RQ4GPT-4による自動採点は、最小限の人的監視で、スキル統合出力の質を信頼性高く評価できるか?
  • RQ5k=5のスキルの組み合わせで強いパフォーマンスを示すことは、GPT-4のようなモデルが「確率的パペット」(stochastic parrot)の行動を超えており、真の一般化能力を有していることを示唆するか?

主な発見

  • GPT-4はk=5のスキルの組み合わせにおいて一貫性があり、訓練中に直接観察されなかった方法でスキルを統合できる能力を示した。
  • Skill-Mixにおけるパフォーマンスは、標準のリーダーボード順位では顕在しなかったモデルの能力差を明らかにした。これは、「リーダーボードのためのcramming」(記憶)が実在の問題であることを示唆している。
  • N choose kのスキルの組み合わせ数の指数的増加により、記憶の可能性は極めて低くなり、標準的な評価と比較して汚染リスクが著しく低下した。
  • k=4のSkill-Mixで人間が生成した回答には平均して7分以上を要したため、スキルの統合には顕著な認知的負荷が伴い、パターンマッチングでは容易に再現できないことが示された。
  • GPT-4による自動採点は高い信頼性を示し、スポットチェックにより自動採点と人間の判断が良好に一致していることが確認された。
  • この手法により、モデルの能力の進化に応じて拡張可能なオープンで拡張可能な評価エコシステムの構築が可能となり、将来的なAI一般化能力のベンチマークに貢献できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。