Skip to main content
QUICK REVIEW

[논문 리뷰] Symbol-LLM: Leverage Language Models for Symbolic System in Visual Human Activity Reasoning

Xiaoqian Wu, Yong–Lu Li|arXiv (Cornell University)|2023. 11. 29.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 시각적 인간 활동 이해에서 상징적 추론를 위한 광범위한 커버리지의 기호와 이성적 규칙을 생성하기 위해 대규모 언어 모델(Large Language Models, LLMs)을 활용하는 Symbol-LLM 프레임워크를 제안한다. 시각적 특징과 LLM에서 유도된 기호 및 퍼지 논리 기반 규칙 평가를 통합함으로써 설명 가능성, 일반화 능력 및 데이터 효율성이 향상되며, 다양한 활동 인식 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Human reasoning can be understood as a cooperation between the intuitive, associative "System-1" and the deliberative, logical "System-2". For existing System-1-like methods in visual activity understanding, it is crucial to integrate System-2 processing to improve explainability, generalization, and data efficiency. One possible path of activity reasoning is building a symbolic system composed of symbols and rules, where one rule connects multiple symbols, implying human knowledge and reasoning abilities. Previous methods have made progress, but are defective with limited symbols from handcraft and limited rules from visual-based annotations, failing to cover the complex patterns of activities and lacking compositional generalization. To overcome the defects, we propose a new symbolic system with two ideal important properties: broad-coverage symbols and rational rules. Collecting massive human knowledge via manual annotations is expensive to instantiate this symbolic system. Instead, we leverage the recent advancement of LLMs (Large Language Models) as an approximation of the two ideal properties, i.e., Symbols from Large Language Models (Symbol-LLM). Then, given an image, visual contents from the images are extracted and checked as symbols and activity semantics are reasoned out based on rules via fuzzy logic calculation. Our method shows superiority in extensive activity understanding tasks. Code and data are available at https://mvig-rhos.com/symbol_llm.

연구 동기 및 목표

  • 기존의 시각적 활동 추론 방법이 조합적 일반화 능력과 설명 가능성을 결여하고 있는 문제를 해결하기 위해.
  • 시각적 추론을 위한 상징 체계에서 수작업으로 제작된 기호와 규칙의 부족 문제를 극복하기 위해.
  • LLM을 통해 광범위한 커버리지의 인간과 유사한 상징적 지식을 시각적 활동 이해에 통합하기 위해.
  • 퍼지 논리를 사용해 시각적 인식과 상징적 추론을 통합하여 강력한 활동 의미 예측을 가능하게 하기 위해.

제안 방법

  • 사전에 훈련된 LLM을 활용해 인간 활동의 엔티티, 동작, 관계를 나타내는 포괄적인 기호 집합을 자동으로 생성하기 위해.
  • 각 규칙가 기호 간의 논리적 관계를 인코딩하는 상징적 규칙 체계를 구축하여 인간의 추론 패턴을 근사하기 위해.
  • 시각 기반 백본을 사용해 입력 이미지에서 시각적 특징을 추출하고, 교차 모odal 정렬 모듈을 통해 이를 상징적 표현으로 매핑하기 위해.
  • 퍼지 논리를 적용해 시각적 증거 기반으로 상징적 규칙의 만족도 정도를 계산함으로써 소프트하고 미분 가능한 추론을 가능하게 하기 위해.
  • 시각적 인식과 상징적 규칙 일관성을 동시에 고려한 다중 작업 손실을 사용해 시스템을 종합적으로 훈련하기 위해.
  • 퍼지 규칙 평가의 출력을 활용해 더 높은 해석 가능성과 일반화 능력을 갖춘 활동 수준의 의미를 예측하기 위해.

실험 결과

연구 질문

  • RQ1LLM은 시각적 활동 추론을 위한 광범위한 커버리지의 인간이 납득할 수 있는 기호를 효과적으로 생성할 수 있는가?
  • RQ2LLM에서 파생된 상징적 규칙를 어떻게 효과적으로 시각적 특징과 융합하여 정확한 활동 이해를 달성할 수 있는가?
  • RQ3LLM에서 유도된 지식을 활용한 상징적 추론은 시각적 활동 인식에서 일반화 능력과 데이터 효율성 향상에 어느 정도 기여하는가?
  • RQ4퍼지 논리 기반 규칙 평가는 시각적 추론 작업에서 강건성과 해석 가능성 향상에 기여하는가?

주요 결과

  • Symbol-LLM은 Something-Something V2와 Epic-Kitchens를 포함한 여러 시각적 인간 활동 이해 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 순수 신경망 기반 베이스라인 대비 제로샷 및 피셔샷 일반화 능력에서 뚜렷한 향상을 보였다.
  • LLM에서 유도된 기호와 규칙를 활용함으로써 다양한 활동 패턴에 걸쳐 더 해석 가능하고 일관된 예측이 가능해졌다.
  • 제거 실험 결과, LLM에서 유도된 기호의 품질과 퍼지 논리 통합의 중요성이 성능 향상에 핵심적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.