[論文レビュー] StateFlow: Enhancing LLM Task-Solving through State-Driven Workflows
StateFlowは、LLMのタスク解決を有限状態機械としてモデル化することで、プロセスの根拠付けとサブタスク実行を分離し、制御性と解釈可能性を向上させる状態駆動型ワークフローのパラダイムを導入する。InterCode SQLおよびALFWorldベンチマークにおいて、それぞれReActよりも13%および28%高い成功率を達成しており、推論コストは3–5倍低減されている。また、Reflexionのような反復的改善手法とも効果的に統合可能である。
It is a notable trend to use Large Language Models (LLMs) to tackle complex tasks, e.g., tasks that require a sequence of actions and dynamic interaction with tools and external environments. In this paper, we propose StateFlow, a novel LLM-based task-solving paradigm that conceptualizes complex task-solving processes as state machines. In StateFlow, we distinguish between "process grounding" (via state and state transitions) and "sub-task solving" (through actions within a state), enhancing control and interpretability of the task-solving procedure. A state represents the status of a running process. The transitions between states are controlled by heuristic rules or decisions made by the LLM, allowing for a dynamic and adaptive progression. Upon entering a state, a series of actions is executed, involving not only calling LLMs guided by different prompts, but also the utilization of external tools as needed. Our results show that StateFlow significantly enhances LLMs' efficiency. For instance, StateFlow achieves 13% and 28% higher success rates compared to ReAct in InterCode SQL and ALFWorld benchmark, with 5x and 3x less cost respectively. We also show that StateFlow can be combined with iterative refining methods like Reflexion to further improve performance.
研究の動機と目的
- LLM駆動のタスク解決ワークフローにおける正確な制御性と解釈可能性の欠如を是正すること。
- ツールの使用や環境との相互作用を伴う複雑なマルチステップタスクにおける効率性と信頼性の向上。
- タスク解決を有限状態機械としてモデル化し、状態遷移とアクション実行を分離すること。
- 動的かつヒューリスティック的またはLLM制御の進行を可能にし、適応的問題解決を実現すること。
- 反復的改善技術(例:Reflexion)との互換性を実証することによるさらなるパフォーマンス向上の可能性の提示。
提案手法
- StateFlowは、タスク解決を有限状態機械(FSM)としてモデル化し、各状態がプロセスの別々の段階を表す。
- 各状態は、文脈履歴に基づいたタスク固有のプロンプトを伴うLLM呼び出し、または外部ツールの呼び出しを含む出力関数のシーケンスをトリガーする。
- 状態遷移はヒューリスティックルールまたはLLMの意思決定によって制御され、ワークフローを通じる動的進行が可能になる。
- フレームワークは「プロセスの根拠付け」(状態管理)と「サブタスク解決」(状態内でのアクション実行)を明確に分離し、モジュラリティと制御性を向上させる。
- 外部ツール(例:SQLエグゼキューター、シェルコマンド)は、状態の進入時に発火するアクション関数を介して統合される。
- 最終的な「End」状態に到達した時点でシステムは終了し、成功基準やエラーハンドリングによって検証される。

実験結果
リサーチクエスチョン
- RQ1LLMのタスク解決を有限状態機械としてモデル化することで、複雑なマルチステップタスクにおける制御性、解釈可能性、効率性を向上させられるか?
- RQ2多様なベンチマークにおいて、StateFlowはReActと比較してどの程度の成功率と推論コストの違いを示すか?
- RQ3StateFlowはどの程度、Reflexionのような反復的改善手法と組み合わせてさらにパフォーマンスを向上させられるか?
- RQ4特定の状態(例:Observe、Verify、Error)が全体のタスク解決効果性に果たす役割は何か?
- RQ5ヒューリスティックルールとLLM駆動の意思決定が、状態遷移の正確性とワークフローの耐障害性にどのように寄与するか?
主な発見
- InterCode SQLベンチマークでは、StateFlowはReActよりも13%高い成功率を達成し、LLM推論コストは5倍低減された。
- ALFWorldベンチマークでは、StateFlowはReActよりも28%高い成功率を示し、コストは3倍低減された。
- 反復的改善との統合において強い相性を示し、6回の反復を経てReflexionと組み合わせることで、ALFWorldの成功率は84.3%から94.8%に向上した。
- アブレーションスタディの結果、Observe、Solve、Verifyなどの状態が性能向上に顕著な寄与をしていることが確認され、状態固有のアクションシーケンスがタスク完了の正確性を向上させた。
- StateFlowの分離設計により、タスク進行状況や意思決定ロジックの追跡が明確になり、エンドツーエンドプロンプティングに比べて解釈可能性が向上した。
- ヒューリスティックベースの遷移とLLM駆動の意思決定を併用することで、多様なタスクタイプにわたる耐障害的かつ適応的なワークフロー進行が実現された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。