Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Agents as Fast and Slow Thinkers

Guangyan Sun, Mingyu Jin|arXiv (Cornell University)|2024. 08. 16.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

FaST는 시각적 작업에서 추론 성능을 향상시키기 위해 스위치 어댑터를 사용해 빠른(시스템 1) 및 느린(시스템 2) 사고 방식을 동적으로 전환하는 시각 에이전트 프레임워크를 도입한다. 제안 및 세그멘테이션 어댑터를 통합함으로써 정확도와 해석 가능성은 향상되며, VQA 정확도 80.8%와 ReasonSeg에서 GIoU 48.7%를 달성하여 강력한 베이스라인을 능가하며, 강인성은 향상되고 환각 현상은 감소시킨다.

ABSTRACT

Achieving human-level intelligence requires refining cognitive distinctions between System 1 and System 2 thinking. While contemporary AI, driven by large language models, demonstrates human-like traits, it falls short of genuine cognition. Transitioning from structured benchmarks to real-world scenarios presents challenges for visual agents, often leading to inaccurate and overly confident responses. To address the challenge, we introduce FaST, which incorporates the Fast and Slow Thinking mechanism into visual agents. FaST employs a switch adapter to dynamically select between System 1/2 modes, tailoring the problem-solving approach to different task complexity. It tackles uncertain and unseen objects by adjusting model confidence and integrating new contextual data. With this novel design, we advocate a flexible system, hierarchical reasoning capabilities, and a transparent decision-making pipeline, all of which contribute to its ability to emulate human-like cognitive processes in visual intelligence. Empirical results demonstrate that FaST outperforms various well-known baselines, achieving 80.8% accuracy over VQA^{v2} for visual question answering and 48.7% GIoU score over ReasonSeg for reasoning segmentation, demonstrate FaST's superior performance. Extensive testing validates the efficacy and robustness of FaST's core components, showcasing its potential to advance the development of cognitive visual agents in AI systems. The code is available at ttps://github.com/GuangyanS/Sys2-LLaVA.

연구 동기 및 목표

  • 현실 환경에서 모델이 과신하고 환각적인 응답을 생성하는 경향이 있는 현재의 시각 에이전트의 한계를 해결하기 위해.
  • 명시적으로 시스템 1(빠르고 직관적인)과 시스템 2(느리고 사색적인) 사고를 모델링하여 인공지능과 인간 수준의 인지 능력 간 격차를 메우기 위해.
  • 불확실성, 보이지 않는 물체 또는 복잡한 질의를 포함한 시각 작업에서 추론의 강인성을 향상시키기 위해.
  • 해석 가능한 중간 출력을 제공하는 투명하고 계층적인 추론 파이프라인을 개발하여 설명 가능성 향상시키기 위해.

제안 방법

  • 스위치 어댑터는 작업의 복잡도와 모델의 자신감에 따라 시스템 1과 시스템 2 모드 간 동적으로 전환한다.
  • 간단한 작업에서 높은 자신감을 보일 경우 시스템 1이 활성화되어 빠른 추론을 가능하게 한다.
  • 불확실성 또는 보이지 않는 물체가 감지될 경우—예를 들어 모호한 질의나 작은 물체일 경우—음성 맥락 데이터를 사용해 자신감을 재보정함으로써 시스템 2가 활성화된다.
  • 제안 어댑터는 분석을 안내하기 위한 관심 영역(ROI) 후보를 생성한다.
  • 세그멘테이션 어댑터는 복잡한 인스턴스에서 세분화된 추론을 위한 픽셀 수준의 마스크를 생성한다.
  • 프레임워크는 세계 지식과 맥락적 단서를 통합하여 증거의 사슬을 구축함으로써 해석 가능성 향상과 환각 감소를 도모한다.

실험 결과

연구 질문

  • RQ1시각 에이전트는 작업의 복잡도와 불확실성에 따라 추론 방식을 어떻게 동적으로 적응시킬 수 있는가?
  • RQ2하이브리드 빠른/느린 사고 메커니즘은 시각적 질의 응답 및 세그멘테이션에서 환각 현상을 어느 정도 줄일 수 있는가?
  • RQ3맥락적 단서와 픽셀 수준의 어댑터는 보이지 않거나 모호한 시각 입력에 대해 추론 강인성을 향상시키는 데 어떤 역할을 하는가?
  • RQ4투명하고 신경-기호적 추론 파이프라인을 통합함으로써 모델의 설명 가능성과 성능은 어떻게 향상되는가?

주요 결과

  • FaST는 VQA-v2에서 80.8%의 정확도를 달성하여 기존 베이스라인 모델을 뚜렷이 앞서간다.
  • ReasonSeg 벤치마크에서 FaST는 48.7%의 GIoU 점수를 기록하여 인스턴스 수준의 추론과 세그멘테이션 정확도가 뛰어나다는 것을 입증한다.
  • 제거 실험 결과, 제안 어댑터와 세그멘테이션 어댑터 모두 성능 향상에 기여하며, 둘을 함께 사용할 경우 최고의 성능을 기록한다.
  • 스위치 어댑터에 빠진 물체와 맥락적 단서를 통합함으로써 MME와 refCOCOg에서 성능이 최대 5.6점 향상된다.
  • MME에서는 순수한 시스템 2 추론 대비 약 31% 빠르게 작동하고, GQA에서는 50% 더 빠르게 작동하면서도 높은 성능를 유지한다.
  • 정성적 결과는 FaST가 LLaVA-v1.5와 LISA-7B보다 더 정확하고 국소화된, 설명 가능한 예측을 생성하며, 특히 복잡하거나 모호한 상황에서 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.