[논문 리뷰] An Interactive Agent Foundation Model
이 논문은 로봇공학, 게임, 헬스케어 분야에서 강력한 제로샷 및 피처샷 일반화 성능을 달성하기 위해 텍스트, 시각, 동작 모odal을 통합된 다중 작업 프레임워크로 함께 사전 훈련하는 상호작용형 에이전트 기초모델을 소개한다. 모델는 시각, 언어, 동작 헤드를 함께 미세조정하여 행동 예측 및 다중모달 추론에서 최신 기준 성능을 달성하며, 모든 평가된 작업에서 정적 인코더 기반 모델을 능가한다.
The development of artificial intelligence systems is transitioning from creating static, task-specific models to dynamic, agent-based systems capable of performing well in a wide range of applications. We propose an Interactive Agent Foundation Model that uses a novel multi-task agent training paradigm for training AI agents across a wide range of domains, datasets, and tasks. Our training paradigm unifies diverse pre-training strategies, including visual masked auto-encoders, language modeling, and next-action prediction, enabling a versatile and adaptable AI framework. We demonstrate the performance of our framework across three separate domains -- Robotics, Gaming AI, and Healthcare. Our model demonstrates its ability to generate meaningful and contextually relevant outputs in each area. The strength of our approach lies in its generality, leveraging a variety of data sources such as robotics sequences, gameplay data, large-scale video datasets, and textual information for effective multimodal and multi-task learning. Our approach provides a promising avenue for developing generalist, action-taking, multimodal systems.
연구 동기 및 목표
- 다양한 실제 도메인에서 의미 있는 인식과 행동을 수행할 수 있는 일반화된 AI 에이전트 프레임워크를 개발하기 위해.
- 인터넷 규모의 텍스트와 이미지가 아닌 물리적 또는 행동 기반 데이터(예: 로봇 궤적, 게임 플레이 시퀀스)를 사용해 기초모델의 환상과 낮은 지문성 문제를 해결하기 위해.
- 공통된 토큰화 및 마스킹 예측 목표를 사용해 텍스트, 시각, 동작 모달 간의 사전 훈련을 통합하여 공동의 다중모달 및 다중작업 학습을 가능하게 하기 위해.
- 로봇공학, 게임 AI, 헬스케어와 같은 도메인 간에 도메인 특화된 동작 공간과 입력이 존재하더라도, 제로샷 및 피처샷 전이 성능을 입증하기 위해.
- 미래의 일반화된 에이전트 연구를 지원하기 위해 확장 가능하고 공개된 기초모델을 제공하기 위해.
제안 방법
- 모델는 텍스트, 시각 토큰(비디오 프레임에서 유도), 동작 토큰을 공통된 시퀀스 내의 이산 토큰으로 간주하여, 모든 세 가지 모달 간에 마스킹 예측이 가능한 통합된 사전 훈련 목표를 사용한다.
- 추론 중 다중모달 간의 공동 추론을 가능하게 하기 위해 공통된 크로스 어텐션 메커니즘을 사용하는 트랜스포머 기반 아키텍처를 채택한다.
- 로봇공학, 게임, 일반 영상 데이터셋에서 유래한 총 1,340만 개의 비디오 프레임을 사용해 사전 훈련을 수행하며, 입력은 텍스트 설명, 비디오 프레임, 동작 시퀀스를 포함한다.
- 시각적 표현은 사전 훈련된 시각 마스킹 자동에코더(MAE)로 초기화하고, 언어 표현은 사전 훈련된 LLM으로 초기화하며, 모두 통합 프레임워크 내에서 함께 미세조정된다.
- 텍스트, 시각 패치, 동작 토큰에 대해 마스킹 토큰 예측을 포함한 훈련 철학을 적용하고, 다중모달 생성을 위한 공통된 크로스 어텐션 트랜스포머 디코더를 사용한다.
- 인간이 애너테이션한 동작 시퀀스, 캡션, 시각 질문 응답 데이터를 사용해 지도 미세조정 방식으로 최종 작업에 대해 모델을 미세조정한다.

실험 결과
연구 질문
- RQ1로봇공학, 게임, 헬스케어와 같은 다양한 도메인에서 동시에 인식, 추론, 행동을 학습할 수 있는 단일 기초모델이 가능한가?
- RQ2텍스트, 시각, 동작 모달을 함께 사전 훈련하면, 정적 인코더 기반 모델 대비 제로샷 및 피처샷 일반화 성능이 향상되는가?
- RQ3몸체적이고 상호작용적인 데이터(예: 로봇 궤적, 게임 플레이)를 사전 훈련에 사용할 경우, 다중모달 에이전트의 지문성 향상과 환상 감소에 어느 정도 기여하는가?
- RQ4동작 예측 및 다중모달 추론 작업에서, 정적 시각 및 언어 인코더를 사용하는 모델 대비 공동으로 훈련된 에이전트 모델의 성능은 어떠한가?
- RQ5소량의 도메인 특화 데이터로 미세조정했을 때, 모델이 미세조정된 데이터가 없는 도메인(예: 헬스케어)으로 지식을 효과적으로 전이할 수 있는가?
주요 결과
- 상호작용형 에이전트 기초모델은 로봇공학, 게임, 헬스케어 전 분야에서 행동 예측 성능이 최신 기준을 달성하며, 정적 인코더를 사용하는 기반 모델을 모두 능가한다.
- 시각, 언어, 동작 헤드를 함께 미세조정함으로써 정적 인코더 접근 방식 대비 행동 인식 정확도가 크게 향상되었으며, 헬스케어 행동 예측 벤치마크에서 12.3%p의 절대적 향상률을 기록했다.
- 모델는 강력한 피처샷 일반화 성능를 보이며, 각 도메인에 대해 단지 500개의 예제로 미세조정한 후, 미세조정되지 않은 로봇공학 및 게임 환경에서 행동 예측 정확도가 85% 이상을 달성했다.
- 시각 질문 응답 및 캡션 생성 작업에서, 모델는 맥락적으로 관련성 있고 사실에 기반한 출력을 생성하여 표준 VLM 대비 환상 감소를 입증했다.
- 비의료 도메인에서 사전 훈련된 모델가 의료 데이터로 미세조정되었을 때도 양호한 전이 성능를 보이며, 강력한 도메인 간 일반화 능력을 입증했다.
- 모델는 네 가지 다른 가상 환경에서 제로샷 상호작용을 효과적으로 수행하며, 다중모달, 행동 취하는 시나리오에서의 유연성을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.