[論文レビュー] Hulk: A Universal Knowledge Translator for Human-Centric Tasks
Hulkは、タスク固有の微調整を必要とせずに、2D視覚、3D視覚、スケルトンベース、視覚言語タスクを統合する最初のマルチモーダルで人間中心の汎用モデルである。これは、タスク固有のヘッドを離散的(例:言語)および連続的(例:座標)の2つの一般化ヘッドに集約することで達成され、モダリティに依存しない知識の転送と、12のベンチマークで最先端のパフォーマンスを実現する。
Human-centric perception tasks, e.g., pedestrian detection, skeleton-based action recognition, and pose estimation, have wide industrial applications, such as metaverse and sports analysis. There is a recent surge to develop human-centric foundation models that can benefit a broad range of human-centric perception tasks. While many human-centric foundation models have achieved success, they did not explore 3D and vision-language tasks for human-centric and required task-specific finetuning. These limitations restrict their application to more downstream tasks and situations. To tackle these problems, we present Hulk, the first multimodal human-centric generalist model, capable of addressing 2D vision, 3D vision, skeleton-based, and vision-language tasks without task-specific finetuning. The key to achieving this is condensing various task-specific heads into two general heads, one for discrete representations, \emph{e.g.,} languages, and the other for continuous representations, \emph{e.g.,} location coordinates. The outputs of two heads can be further stacked into four distinct input and output modalities. This uniform representation enables Hulk to treat diverse human-centric tasks as modality translation, integrating knowledge across a wide range of tasks. Comprehensive evaluations of Hulk on 12 benchmarks covering 8 human-centric tasks demonstrate the superiority of our proposed method, achieving state-of-the-art performance in 11 benchmarks. The code will be available on https://github.com/OpenGVLab/Hulk.
研究の動機と目的
- 2D/3D視覚、スケルトンベース、視覚言語タスクを含む、多様な人間中心の認識タスクに対する統合モデルの欠如に対処する。
- 既存の基盤モデルが各下流タスクに対してタスク固有の微調整を必要としているという制限を克服する。
- 画像、テキスト、キーポイント座標、セグメンテーションマップなどの異種の入出力に対応できる、共有パラメータを用いた汎用アーキテクチャを開発する。
- 再トレーニングやプロンプトチューニングなしに、複数の人の中心のタスク間でゼロショットまたはフェイントショット転送を可能にする。
- すべての人間中心のタスクをモダリティ変換として扱う統一されたフレームワークを確立し、モダリティやタスク間で知識を統合する。
提案手法
- 2つの一般化ヘッド(離散的表現:例としてトークン、分類ラベル;連続的表現:例として2D/3D座標、埋め込み)を持つ二重ヘッドアーキテクチャを設計する。
- すべての入出力モダリティを2つの一般化ヘッドの4つの異なる組み合わせにマッピングし、タスク間で統一された処理を可能にする。
- 8つの人の中心のタスクをカバーする170万~3000万サンプルにわたる大規模なマルチタスクデータセット上で、モデルをエンドツーエンドにトレーニングする。
- セグメンテーション、検出、キャプション生成、ポーズ推定を含む、多様なタスクタイプを同時に最適化できる統一された損失関数を用いる。
- 一般化を向上させ、ドメインシフトの影響を軽減するために、多様な人間中心のデータで事前学習を行う。
- 特化した人間中心の事前学習モデル(例:HAP, PATH)を用いたパラメータ効率の良い初期化を適用し、公平な比較を損なわずにパフォーマンスを向上させる。
実験結果
リサーチクエスチョン
- RQ1タスク固有の微調整なしに、2D/3D視覚、スケルトンベース、視覚言語タスクを含む多様な人間中心のタスクを1つの統合モデルが処理できるか?
- RQ2離散的および連続的の2つのヘッドを持つ二重ヘッドアーキテクチャは、マルチモーダルな人間中心のタスクにおいて、異種の入出力を統合するのにどの程度有効か?
- RQ3トレーニングデータのスケーリングが、一般化モデルの文脈で多様な人間中心のタスクのパフォーマンスにどの程度向上効果をもたらすか?
- RQ4専門的な人間中心の事前学習モデルからの初期化が、Hulkのような一般化モデルのパフォーマンスに与える影響はいかほどか?
- RQ5タスク固有の適応なしに、一般化モデルが複数のベンチマークで最先端のパフォーマンスを達成できるか?
主な発見
- Hulkは、8つの人の中心のタスクをカバーする12のベンチマークのうち11で最先端のパフォーマンスを達成し、強力な一般化能力とゼロショット転送能力を示した。
- トレーニングデータを170万から3000万サンプルにスケーリングしたことで、平均パフォーマンスが7.1ポイント向上(mIoU/APで48.9から56.0に)、2Dポーズ推定(+2.3% AP)および歩行者検出(+1.6% AP)で顕著な向上を示した。
- HAPおよびPATHからの事前学習重みを組み込むことで、Hulkの精度が向上し、MAE初期化と比較して平均パフォーマンスが+5.0ポイント向上(52.2 vs. 47.2)した。
- より大きなデータセットでトレーニングした場合、3Dメッシュ回復で26.0のMPVPE低下、3Dポーズ推定で24.5のMPJPE低下を達成し、強力な3D一般化能力を示した。
- 二重ヘッド設計により、モダリティ間で効果的なゼロショット転送が可能となり、画像キャプション生成(+2.1 B@4)やスケルトンベースの行動認識(93.8%の正確度)を含む、あらゆるタスクで一貫したパフォーマンス向上が見られた。
- Kinetcs-400などの拡張データセットでドメインギャップが存在しても、パフォーマンスは安定しており、多様なデータでトレーニングされた場合に分布シフトに対して頑健であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。