[논문 리뷰] Induce, Edit, Retrieve: Language Grounded Multimodal Schema for Instructional Video Retrieval
이 논문은 지침 영상에서 명시적이고 언어 기반의 체계를 유도하고, BERT 기반 텍스트 편집을 통해 새로운 작업으로 일반화하는 새로운 프레임워크인 Induce, Edit, Retrieve (IER)를 제안한다. 유도된 체계를 활용해 짧은 질의를 확장함으로써 IER는 제로샷 지침 영상 검색 성능을 크게 향상시켰으며, 벤치마크 데이터셋에서 기존 방법 대비 상위 1위 정밀도에서 약 10% 향상되었다.
Schemata are structured representations of complex tasks that can aid artificial intelligence by allowing models to break down complex tasks into intermediate steps. We propose a novel system that induces schemata from web videos and generalizes them to capture unseen tasks with the goal of improving video retrieval performance. Our system proceeds in three major phases: (1) Given a task with related videos, we construct an initial schema for a task using a joint video-text model to match video segments with text representing steps from wikiHow; (2) We generalize schemata to unseen tasks by leveraging language models to edit the text within existing schemata. Through generalization, we can allow our schemata to cover a more extensive range of tasks with a small amount of learning data; (3) We conduct zero-shot instructional video retrieval with the unseen task names as the queries. Our schema-guided approach outperforms existing methods for video retrieval, and we demonstrate that the schemata induced by our system are better than those generated by other models.
연구 동기 및 목표
- 영상-텍스트 데이터로부터 명시적이고 해석 가능한 체계를 학습하여 제로샷 지침 영상 검색 성능을 향상시키는 것.
- 기존 체계를 언어 모델 기반 편집을 통해 최소한의 데이터로도 새로운 작업으로 일반화할 수 있도록 하는 것.
- 유도된 체계가 GPT-3와 같은 대규모 언어 모델이 생성한 체계보다 검색 작업에서 더 우수한 성능을 보임을 입증하는 것.
- CLIP 및 MIL-NCE와 같은 다양한 영상-텍스트 매칭 모델 간에 체계의 이식 가능성(transferability)을 검증하는 것.
- 영상 길이가 증가함에 따라 체계가 검색 성능에 미치는 영향을 조사하는 것.
제안 방법
- 공동 영상-텍스트 매칭 모델을 사용해 영상 세그먼트를 wikiHow 단계 기술과 매칭함으로써 체계를 유도하고, 높은 점수를 받은 문장-영상 쌍을 유지한다.
- 각 작업 전용 체계를 자연어 단계의 집합으로 구성하며, 작업당 50개의 영상만을 사용하여 고품질의 체계 유도를 달성한다.
- 세 가지 편집 루틴을 통해 체계를 새로운 작업으로 일반화한다: 작업 이름 일치를 통한 객체 교체, 낮은 관련도 점수 기반 단계 삭제, 그리고 낮은 확률을 가진 토큰에 대한 BERT 기반 토큰 교체.
- 편집된 체계를 사용해 짧은 질의어(예: '생선 굽기')를 다중 문장 기반 기술로 확장하여 영상 클립과 매칭한다.
- 확장된 체계를 영상 클립 전체에 걸쳐 일치시키는 매칭 함수 F를 사용해 영상을 검색하며, MIL-NCE 또는 CLIP 기반 특징을 활용한다.
- Howto100M, COIN, YouCook2 데이터셋에서 표준 메트릭(P@1, R@5, R@10, Med r, MRR)을 사용해 검색 성능을 평가한다.
실험 결과
연구 질문
- RQ1영상과 텍스트에서 유도된 체계가 새로운 작업에 대해 제로샷 영상 검색 성능을 향상시킬 수 있는가?
- RQ2언어 모델 기반 편집을 통해 기존 체계를 수정함으로써 최소한의 데이터로도 효과적인 새로운 작업 일반화가 가능한가?
- RQ3IER의 성능는 체계를 사용하지 않거나 LLM 기반 체계를 사용하는 검색 방법과 비교해 어떻게 되는가?
- RQ4유도된 체계는 다양한 영상-텍스트 매칭 모델 간에 얼마나 잘 이식되는가?
- RQ5영상 길이가 증가함에 따라 체계의 이점이 증가하는가?
주요 결과
- IER는 체계를 사용하지 않는 기준 방법 대비 상위 1위 정밀도를 약 10% 향상시켰으며, COIN에서 P@1이 57.2%에 도달했다.
- IER에서 편집된 체계는 GPT-3가 생성한 체계보다 검색 성능에서 뛰어나, 영상 기반으로 유도된 체계의 우수성을 입증했다.
- 제거 실험 결과, 세 가지 편집 모듈(객체 교체, 단계 삭제, 토큰 교체) 모두 검색 성능 향상에 기여했으며, 특히 Howto-GEN 및 COIN에서 작업 유사도가 낮을 경우에 두드러진 효과를 보였다.
- YouCook2에서는 작업 유사도가 높아 평균 0.97이기 때문에 편집 모듈의 효과가 떨어지며, 이는 원천 작업과 대상 작업이 상이할 때 편집이 가장 유익함을 시사한다.
- 체계는 CLIP 기반 매칭 모델로도 효과적으로 이식 가능하며, CLIP와 조합했을 때 COIN에서 P@1이 58.9%에서 65.0%로 향상되었다.
- 영상 길이가 증가할수록 체계의 이점이 증가하며, 더 많은 클립을 매칭 대상으로 삼을 수 있고, 장기간 영상에 걸쳐도 검색 신뢰도가 향상됨을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.