Skip to main content
QUICK REVIEW

[논문 리뷰] Palm: Predicting Actions through Language Models @ Ego4D Long-Term Action Anticipation Challenge 2023

Daoji Huang, Otmar Hilliges|arXiv (Cornell University)|2023. 06. 28.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

Palm은 시각-언어 모델과 대규모 언어 모델을 기반으로 한 프레임워크를 제안하여 일기적 영상에서 장기적인 행동 예측을 수행한다. 이미지 캡션 생성과 행동 인식을 활용해 LLM에 자연어 프롬프트를 생성한다. 이는 Ego4D LTA 챌린지에서 최고 성능을 기록하여 테스트 세트에서 행동 편집 거리 0.8856으로 1위를 차지했다.

ABSTRACT

We present Palm, a solution to the Long-Term Action Anticipation (LTA) task utilizing vision-language and large language models. Given an input video with annotated action periods, the LTA task aims to predict possible future actions. We hypothesize that an optimal solution should capture the interdependency between past and future actions, and be able to infer future actions based on the structure and dependency encoded in the past actions. Large language models have demonstrated remarkable commonsense-based reasoning ability. Inspired by that, Palm chains an image captioning model and a large language model. It predicts future actions based on frame descriptions and action labels extracted from the input videos. Our method outperforms other participants in the EGO4D LTA challenge and achieves the best performance in terms of action prediction. Our code is available at https://github.com/DanDoge/Palm

연구 동기 및 목표

  • 장기적인 행동 예측 문제를 해결하기 위해, 미래 행동이 불확실하고 다수의 타당한 시퀀스가 존재하는 일기적 영상 환경에서의 도전에 대응한다.
  • 이전 모델들이 공유된 특징에만 의존하고 동사/명사 분류를 독립적으로 수행하는 데서 비롯하는 한계를 극복한다.
  • 대규모 언어 모델에서 유추하는 일반 지식을 활용하기 위해 과거 행동과 시각적 맥락을 자연어로 인코딩한다.
  • 과거와 미래 행동 간의 종속성을 자연어 프롬프트를 통해 모델링하여 예측 성능을 향상시킨다.
  • MMR 기반 예시 선택을 통한 few-shot 프롬프팅을 활용해 강건하고 다양한 행동 예측을 실현한다.

제안 방법

  • 이 방법은 과거 행동 세그먼트의 중간 프레임에서 이미지 캡션 모델을 사용해 'A person is'로 시작하는 묘사적 서술문을 생성한다.
  • EgoVLP 기반의 트랜스포머를 활용한 행동 인식 모델이 영상 클립에서 (동사, 명사) 쌍을 추출한다.
  • 과거 행동 서술문과 레이블을 자연어 프롬프트로 통합하여 LLM에 대한 문장 완성 작업 형식으로 구성한다.
  • few-shot 프롬프트 템플릿은 지시어, 과거 행동과 미래 시퀀스를 포함한 예시들, 그리고 과거 행동만 포함한 질의로 구성된다.
  • MMR 기반 전략을 사용해 질의에 대한 의미적 유사성과 다양성을 균형 잡고, MPNet 임베딩과 코사인 유사도를 활용해 예시를 선별한다.
  • LLM 출력에서 다수의 미래 행동 시퀀스를 샘플링하고, 실제 값과의 최소 편집 거리 기반으로 최상의 시퀀스를 선택한다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델이 행동 시퀀스의 구조적 종속성과 일반 지식을 활용함으로써 장기적인 행동 예측 성능을 향상시킬 수 있는가?
  • RQ2이미지 캡션과 행동 레이블에서 파생된 자연어 프롬프트가 LLM 기반 행동 예측에 얼마나 효과적인가?
  • RQ3프롬프트 설계, 특히 예시 선택 및 모델 크기의 영향이 예측 정확도와 다양성에 미치는 영향은 어떠한가?
  • RQ4시각적 맥락(캡션)과 행동 레이블이 각각 예측 성능에 미치는 기여도는 어떠한가?
  • RQ5과거 행동 인식 모듈의 정확도가 모델 성능에 얼마나 제한적인가?

주요 결과

  • Palm은 Ego4D 2023 장기 행동 예측 챌린지에서 테스트 세트에서 행동 편집 거리 0.8856으로 최고 성능을 기록했다.
  • BLIP2를 사용한 캡션 생성이 vit-gpt2보다 우수했으며, 특히 명사 예측에서 성능 향상을 보여 명사 편집 거리가 0.6767로 감소했다.
  • MMR 기반 예시 선택을 통합함으로써 무작위 선택 대비 성능 향상을 이뤘고, 행동 편집 거리가 0.8934로 감소했다.
  • 서술문과 행동 레이블을 모두 프롬프트에 포함시킬 경우 최고의 성능을 기록했으며, 행동 편집 거리는 0.8934로 나타났다. 단일 모odal보다 우수했다.
  • 더 큰 컨텍스트 창을 가진 더 큰 언어 모델인 GPT-Neo-1.3B는 더 작은 GPT-2 버전보다 낮은 편집 거리로 더 우수한 성능을 보였다.
  • 과거 행동 인식 정확도와 편집 거리 사이에 강한 음의 상관관계가 존재하여, 모델 성능이 인식 품질에 매우 민감하게 영향을 받는다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.