[論文レビュー] Symbol-LLM: Leverage Language Models for Symbolic System in Visual Human Activity Reasoning
本稿では、視覚的ヒューマンアクティビティ理解における記号的推論のための広範囲にわたる記号と論理的ルールを生成するために大規模言語モデル(LLMs)を活用する、Symbol-LLMというフレームワークを提案する。視覚的特徴とLLMから得た記号およびファジィ論理に基づくルール評価を統合することで、説明可能性、一般化性能、データ効率性が向上し、複数のアクティビティ認識ベンチマークで最先端の性能を達成する。
Human reasoning can be understood as a cooperation between the intuitive, associative "System-1" and the deliberative, logical "System-2". For existing System-1-like methods in visual activity understanding, it is crucial to integrate System-2 processing to improve explainability, generalization, and data efficiency. One possible path of activity reasoning is building a symbolic system composed of symbols and rules, where one rule connects multiple symbols, implying human knowledge and reasoning abilities. Previous methods have made progress, but are defective with limited symbols from handcraft and limited rules from visual-based annotations, failing to cover the complex patterns of activities and lacking compositional generalization. To overcome the defects, we propose a new symbolic system with two ideal important properties: broad-coverage symbols and rational rules. Collecting massive human knowledge via manual annotations is expensive to instantiate this symbolic system. Instead, we leverage the recent advancement of LLMs (Large Language Models) as an approximation of the two ideal properties, i.e., Symbols from Large Language Models (Symbol-LLM). Then, given an image, visual contents from the images are extracted and checked as symbols and activity semantics are reasoned out based on rules via fuzzy logic calculation. Our method shows superiority in extensive activity understanding tasks. Code and data are available at https://mvig-rhos.com/symbol_llm.
研究の動機と目的
- 既存の視覚的アクティビティ推論手法が示す構成的一般化および説明可能性の欠如という課題に対処すること。
- 視覚的推論のための記号的システムにおいて、手作業で作成された記号やルールの不足を克服すること。
- LLMsを用いて視覚的アクティビティ理解において広範囲にわたる人間らしい記号的知識を実現すること。
- ファジィ論理を用いて記号的推論と視覚的認識を統合し、堅牢なアクティビティ意味解釈予測を実現すること。
提案手法
- 事前学習済みLLMsを活用し、ヒューマンアクティティにおけるエンティティ、アクション、関係を表す包括的な記号の自動生成を行う。
- 各ルールが記号間の論理的関係を符号化する記号的ルールシステムを構築し、人間の推論様式を近似する。
- 視覚バックボーンを用いて入力画像から特徴を抽出し、クロスモodal整合モジュールを介してそれらを記号的表現にマッピングする。
- ファジィ論理を用いて、視覚的証拠に基づき記号的ルールの満たされ具合の度合いを計算し、ソフトで微分可能な推論を実現する。
- 視覚認識と記号的ルールの一貫性を組み合わせたマルチタスク損失を用いて、システムをエンドツーエンドで訓練する。
- ファジィルール評価の出力を用いて、解釈可能性と一般化性能が向上したアクティビティレベルの意味解釈を予測する。
実験結果
リサーチクエスチョン
- RQ1LLMsは視覚的アクティビティ推論のための広範囲にわたる、人間が納得できる記号を効果的に生成できるか?
- RQ2LLMsから導出された記号的ルールを視覚的特徴と効果的に統合することで、正確なアクティビティ理解が可能になるか?
- RQ3LLMsから得た知識を用いた記号的推論は、視覚的アクティビティ認識における一般化性能とデータ効率性をどの程度向上させるか?
- RQ4ファジィ論理に基づくルール評価は、視覚的推論タスクにおけるロバストネスと解釈可能性を向上させるか?
主な発見
- Symbol-LLMは、Something-Something V2 や Epic-Kitchens を含む複数の視覚的ヒューマンアクティビティ理解ベンチマークで最先端の性能を達成した。
- 純粋なニューラルネットワークベースラインと比較して、ゼロショットおよびフェイシュット一般化性能に顕著な向上が見られた。
- LLMsから得た記号とルールを活用することで、多様なアクティビティパターンにわたる予測がより解釈可能で一貫性を持つようになった。
- アブレーションスタディの結果、LLMsから導出された記号の品質およびファジィ論理の統合が、性能向上に不可欠であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。