[論文レビュー] Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark
本稿では、5つの社会的知識カテゴリー(ユーモア・皮肉、攻撃的表現、感情・感情、信頼性、その他の社会的要因)にまたがる58のNLPタスクを有する理論に基づいたベンチマーク、SocKETを紹介する。大規模言語モデル(LLMs)の社会的対応性を評価することを目的としている。ベンチマーク上で中程度のパフォーマンスを示すものの、特に相関の強いタスクで学習した場合、タスク間の転移が顕著に見られ、社会的認識を持つLLMsの構築における改善の余地が示唆される。
Large language models (LLMs) have been shown to perform well at a variety of syntactic, discourse, and reasoning tasks. While LLMs are increasingly deployed in many forms including conversational agents that interact with humans, we lack a grounded benchmark to measure how well LLMs understand extit{social} language. Here, we introduce a new theory-driven benchmark, SocKET, that contains 58 NLP tasks testing social knowledge which we group into five categories: humor & sarcasm, offensiveness, sentiment & emotion, and trustworthiness. In tests on the benchmark, we demonstrate that current models attain only moderate performance but reveal significant potential for task transfer among different types and categories of tasks, which were predicted from theory. Through zero-shot evaluations, we show that pretrained models already possess some innate but limited capabilities of social language understanding and training on one category of tasks can improve zero-shot testing on others. Our benchmark provides a systematic way to analyze model performance on an important dimension of language and points to clear room for improvement to build more socially-aware LLMs. The associated resources are released at https://github.com/minjechoi/SOCKET.
研究の動機と目的
- 大規模言語モデル(LLMs)における社会的知識を評価する包括的で理論的根拠を持つベンチマークの不足に対処すること。
- 言語学的および心理的理論に基づき、社会的言語理解タスクを5つのカテゴリーに体系的に分類すること。
- ゼロショットおよび微調整済み評価を通じて、LLMsがさまざまなタイプの社会的言語タスクにどの程度一般化できるかを評価すること。
- 特にマルチタスク学習環境において、社会的に関連するNLPタスク間でのタスク転移の可能性を調査すること。
- 今後の研究を支援するため、公開可能なベンチマークおよびデータセットをリリースすること。
提案手法
- 58のタスクを5つのカテゴリー(ユーモア・皮肉、攻撃的表現、感情・感情、信頼性、その他の社会的要因)に分類したベンチマークであるSocKETの設計。
- 分類、回帰、ペairwise比較、スパン特定の4つのタスク形式を統合し、モデルのタスクタイプにわたる柔軟性を評価。
- システム的機能的文法学および社会的認知の理論に基づいたタスク選定を採用し、概念的整合性を確保。
- ゼロショットおよび微調整済みLLMsをベンチマークで評価し、初期能力と転移可能性を評価。
- 相関の強いタスクカテゴリーでマルチタスク学習を実施し、パフォーマンスの向上や弱い相関のタスクでの悪化(負の転移)の可能性を検証。
- GitHubおよびHugging Faceを通じてベンチマークとデータセットをリリースし、再現可能性とコミュニティへのアクセスを確保。

実験結果
リサーチクエスチョン
- RQ1現在のLLMsは、多様な社会的言語タスクをどの程度理解し、一般化できるか?
- RQ2微調整なしで、事前学習済みLLMsは社会的言語理解において、先天的だが限定的な能力を示せるか?
- RQ3特にタスクが相関している場合、異なる社会的知識カテゴリー間でのタスク転移はどの程度効果的か?
- RQ41つの社会的カテゴリーでマルチタスク学習をしても、関連はするが異なるカテゴリーのタスクのパフォーマンスが向上するか?
- RQ5弱い相関のタスクで学習した場合、負の転移のリスクはどの程度か?
主な発見
- 現在のLLMsはSocKETベンチマークで中程度のパフォーマンスにとどまっているため、社会的言語理解におけるさらなる改善の余地が大きいことが示された。
- ゼロショット評価から、事前学習モデルが社会的知識の理解においてある程度の先天的だが限定的な能力を既に持っていることが明らかになった。
- 特にカテゴリー間で強い相関があるタスクで学習した場合、モデルは顕著なタスク転移の可能性を示した。
- 相関の強いタスクでマルチタスク学習をすると、下流タスクのパフォーマンスが維持され、場合によっては向上することから、効果的な知識の抽出が可能であると示唆された。
- 逆に、弱い相関のタスクで学習すると、全体のパフォーマンスが低下する傾向があり、マルチタスク学習における負の転移のリスクが示された。
- ベンチマークから、LLMsが社会的知識を均一に捉えているわけではないことが明らかになった。特にユーモア、皮肉、攻撃的表現といったカテゴリーではパフォーマンスに顕著な差が見られた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。