[論文レビュー] Large Language Models show both individual and collective creativity comparable to humans
本研究では、アイデーション、問題解決、クリエイティブライティングの分野にまたがる13のタスクを通じて、大規模言語モデル(LLMs)の創造的能力を、個人および集団の両方の観点から人間と比較して評価している。その結果、上位のLLMs(ClaudeとGPT-4)は発散的思考および問題解決において人間並みの創造性を達成しており、集団としてのLLM出力は8〜10人の人間共同作業者と同等であることが判明した。これは、将来的な業務環境においてLLMsが小規模な人間チームと競合可能である可能性を示唆している。
Artificial intelligence has, so far, largely automated routine tasks, but what does it mean for the future of work if Large Language Models (LLMs) show creativity comparable to humans? To measure the creativity of LLMs holistically, the current study uses 13 creative tasks spanning three domains. We benchmark the LLMs against individual humans, and also take a novel approach by comparing them to the collective creativity of groups of humans. We find that the best LLMs (Claude and GPT-4) rank in the 52nd percentile against humans, and overall LLMs excel in divergent thinking and problem solving but lag in creative writing. When questioned 10 times, an LLM's collective creativity is equivalent to 8-10 humans. When more responses are requested, two additional responses of LLMs equal one extra human. Ultimately, LLMs, when optimally applied, may compete with a small group of humans in the future of work.
研究の動機と目的
- 大規模言語モデル(LLMs)が多様な分野において人間と同等の創造性を示すかどうかを評価すること。
- LLMsの評価を個人的側面にとどまらず、チームのようなパフォーマンスを模倣する集団的側面にも拡大すること。
- 広範な創造的タスクにおいて、LLMsを個人の人間および人間グループと比較してベンチマークすること。
- 複数の応答を集約することで得られるLLMの創造性のスケーラビリティを理解すること。
- LLMsが将来的な仕事のあり方、特に創造的かつ協働的な役割に与える影響を検討すること。
提案手法
- 本研究では、3つの分野(アイデーション、問題解決、クリエイティブライティング)にまたがる13の創造的タスクを採用している。
- LLMsは個人的およびアンサンブル(集団)の両方で評価され、各タスクに対して10件の応答を生成することで集団的出力を模倣している。
- 人間のパフォーマンスは、個人およびグループの応答によって測定されており、グループは8〜10名の参加者で構成されている。
- 創造性は、原発性、多様性、実現可能性といった標準化された指標を用いて、タスクごとに評価されている。
- 統計的ベンチマークにより、LLMのパフォーマンスが個人の人間および人間グループと比較され、パーセンタイルを用いてパフォーマンスの順位付けがなされている。
- 本研究ではGPT-4とClaudeを代表とする最先端のLLMsを用い、一貫性およびスケーラビリティの観点から結果が分析されている。
実験結果
リサーチクエスチョン
- RQ1LLMsは多様な創造的タスクにおいて、人間の個人と同等の創造性に到達できるか?
- RQ2複数の応答を生成することで得られるLLMの集団的創造性は、人間グループのそれと比べてどうか?
- RQ3どの創造的分野においてLLMsは人間を上回り、あるいは下回るか?
- RQ4集約されたLLMの出力は、創造的作業における人間チームの協働にどの程度置き換え可能か?
- RQ5生成応答数の増加に伴い、LLMの創造性のスケーラビリティはどの程度向上するか?
主な発見
- 最高のLLMs(ClaudeとGPT-4)は、個人の人間と比較して52番目のパーセンタイルに位置づけられており、人間並みの創造性を示している。
- LLMsは発散的思考および問題解決タスクにおいて優れたパフォーマンスを発揮し、多様で実現可能な解決策を生成する点で人間を上回っている。
- クリエイティブライティングタスクではLLMsが劣位にあり、人間の独創性および物語の深さが依然として優れている。
- 10回のクエリを実行した場合、LLMの集団的出力は8〜10人の人間共同作業者の創造性と同等である。
- LLMの応答を2件追加するごとに、集団的出力に1人の追加の人間貢献者に相当する創造性が加わる。
- 最適に適用されたLLMsは、将来的な創造的かつ協働的な業務環境において、小規模な人間チームと競合可能である可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。