Skip to main content
QUICK REVIEW

[논문 리뷰] Language Models as Knowledge Bases for Visual Word Sense Disambiguation

Anastasia Kritharoula, Maria Lymperaiou|arXiv (Cornell University)|2023. 10. 03.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 LLM을 지식 기반으로 활용하여, 제로샷 및 희소 few-shot 프롬프팅을 통해 지식을 주입함으로써 시각적 어휘의 뜻풀이 분류(VWSD)를 향상시키는 방법을 제안한다. LLM에 저장된 지식을 활용해 이미지 캡션을 다중 선택지로 사용하는 새로운 텍스트 기반 QA 재구성 방식을 도입하며, Chain-of-Thought 프롬프팅을 통해 해석 가능한 추론 과정을 가능하게 하고 기존의 시각-언어 모델 대비 검색 성능 향상을 입증한다.

ABSTRACT

Visual Word Sense Disambiguation (VWSD) is a novel challenging task that lies between linguistic sense disambiguation and fine-grained multimodal retrieval. The recent advancements in the development of visiolinguistic (VL) transformers suggest some off-the-self implementations with encouraging results, which however we argue that can be further improved. To this end, we propose some knowledge-enhancement techniques towards improving the retrieval performance of VL transformers via the usage of Large Language Models (LLMs) as Knowledge Bases. More specifically, knowledge stored in LLMs is retrieved with the help of appropriate prompts in a zero-shot manner, achieving performance advancements. Moreover, we convert VWSD to a purely textual question-answering (QA) problem by considering generated image captions as multiple-choice candidate answers. Zero-shot and few-shot prompting strategies are leveraged to explore the potential of such a transformation, while Chain-of-Thought (CoT) prompting in the zero-shot setting is able to reveal the internal reasoning steps an LLM follows to select the appropriate candidate. In total, our presented approach is the first one to analyze the merits of exploiting knowledge stored in LLMs in different ways to solve WVSD.

연구 동기 및 목표

  • 피팅 튜닝 없이 LLM에 저장된 지식을 활용하여 시각적 어휘의 뜻풀이 분류(VWSD)의 다중모달 검색 성능 향상
  • 생성된 이미지 캡션을 다중선택지 답변으로 사용하여 VWSD를 텍스트 기반 질문-답변 문제로 재구성하는 것이 가능한지 탐색
  • LLM을 사용한 정확한 이미지 의미 검색을 위한 제로샷 및 희소 프롬프팅 전략의 효과성 평가
  • Chain-of-Thought (CoT) 프롬프팅을 통해 LLM 기반 VWSD 결정의 내부 추론 단계를 노출시키는 방법 탐색
  • 다중모달, 제로샷 설정에서 LLM을 지식 기반으로 사용하는 접근법의 확장성과 일반화 성능 평가

제안 방법

  • 정교하게 설계된 프롬프팅을 통해 제로샷 방식으로 LLM에서 지식을 추출하여 모호한 어휘에 맥락적 언어 지식을 부여
  • VWSD를 다중선택지 QA 작업으로 재구성하며, 이미지 캡션을 질문에 대한 후보 답변으로 사용
  • LLM에 제로샷 및 희소 프롬프팅 전략을 적용하여 후보 목록에서 가장 적절한 캡션을 선택
  • Chain-of-Thought (CoT) 프롬프팅을 사용해 단계별 추론 추적을 생성하여 LLM 결정의 해석 가능성 향상
  • LLM에서 유도된 지식 주입을 통해 사전 학습된 시각-언어 모델을 검색 백본으로 활용
  • 표준 VWSD 벤치마크에서 LLM 강화 검색 성능을 기존의 시각-언어 모델과 비교 평가

실험 결과

연구 질문

  • RQ1LLM은 제로샷 설정에서 시각적 어휘의 뜻풀이 분류에 효과적인 지식 기반으로 기능할 수 있는가?
  • RQ2이미지 캡션을 답변 선택지로 사용하여 VWSD를 텍스트 기반 QA 문제로 재구성할 경우 검색 성능에 어떤 영향을 미치는가?
  • RQ3제로샷 및 희소 프롬프팅 전략이 LLM을 활용한 의미 분류 정확도 향상에 어느 정도 기여하는가?
  • RQ4Chain-of-Thought 프롬프팅은 LLM 기반 VWSD 결정에 대해 인간이 이해할 수 있는 의미 있는 추론 추적을 제공할 수 있는가?
  • RQ5LLM의 규모와 내부 지식 표현 능력은 다중모달, 지식 증강 검색 작업에서 성능에 어떤 영향을 미치는가?

주요 결과

  • LLM을 지식 기반으로 활용한 접근법은 기존의 시각-언어 모델 대비 검색 성능을 크게 향상시켜 외부 지식 주입의 가치를 입증한다.
  • 이미지 캡션을 답변 선택지로 사용하는 텍스트 기반 QA 문제로 VWSD를 재구성함으로써 LLM을 다중모달 분류에 효과적으로 활용할 수 있다.
  • Chain-of-Thought를 사용한 제로샷 프롬프팅은 해석 가능한 추론 추적을 생성하여 LLM이 의미 선택을 어떻게 정당화하는지 노출시킨다.
  • 희소 프롬프팅은 성능을 추가로 향상시켜, 조그만 맥락 예시조차도 LLM이 정확한 분류로 이끌 수 있음을 시사한다.
  • 이 연구는 LLM이 다중모달 작업에서 확장 가능하고 제로샷 지식 기반으로 기능할 수 있음을 입증하며, 기존 지식 그래프의 한계를 극복한다.
  • 결과적으로 LLM의 모델 규모와 내부 지식 표현 방식이 시각-언어 작업에서 지식 기반 분류에 있어 핵심 요소임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.