[論文レビュー] Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos
Colon-Bench は、病変検出・分割・VQA を対象とする最新のマルチモーダル大規模言語モデルを評価するための、病変検出・セグメンテーション・VQA を含む大規模で多タスクのベンチマークを密にアノテーションする多段階のエージェント作動ワークフローを導入します。さらに MLLM の性能を分析し、ゼロショット結果を向上させるプロンプティング戦略を提案します。
Early screening via colonoscopy is critical for colon cancer prevention, yet developing robust AI systems for this domain is hindered by the lack of densely annotated, long-sequence video datasets. Existing datasets predominantly focus on single-class polyp detection and lack the rich spatial, temporal, and linguistic annotations required to evaluate modern Multimodal Large Language Models (MLLMs). To address this critical gap, we introduce Colon-Bench, generated via a novel multi-stage agentic workflow. Our pipeline seamlessly integrates temporal proposals, bounding-box tracking, AI-driven visual confirmation, and human-in-the-loop review to scalably annotate full-procedure videos. The resulting verified benchmark is unprecedented in scope, encompassing 528 videos, 14 distinct lesion categories (including polyps, ulcers, and bleeding), over 300,000 bounding boxes, 213,000 segmentation masks, and 133,000 words of clinical descriptions. We utilize Colon-Bench to rigorously evaluate state-of-the-art MLLMs across lesion classification, Open-Vocabulary Video Object Segmentation (OV-VOS), and video Visual Question Answering (VQA). The MLLM results demonstrate surprisingly high localization performance in medical domains compared to SAM-3. Finally, we analyze common VQA errors from MLLMs to introduce a novel "colon-skill" prompting strategy, improving zero-shot MLLM performance by up to 9.7% across most MLLMs. The dataset and the code are available at https://abdullahamdi.com/colon-bench .
研究の動機と目的
- 密に注釈された長大なシーケンスの結腸鏡動画データセットの欠如に対処する。
- 視覚-言語モデル、追跡、AI 確認、そして人間によるレビューを組み合わせたスケーラブルな注釈パイプラインを作成する。
- 結腸内視鏡における病変検出、分割、言語ベースの理解のための総合的なベンチマークを提供する。
- 医療動画文脈での Open-Vocabulary Video Segmentation (OV-VOS) および VQA の評価を可能にする。
提案手法
- 新規の多段階エージェント作動ワークフロー(提案生成、検証、喚起されたAI確認、そして人間によるレビュー)を開発し、高品質で密な注釈を生み出す。
- EdgeTAM/SAM ベースの追跡を用いて空間注釈をフレーム間に伝搬する。
- AI 主導の確認オーバーレイと臨床医のレビューを最終的な品質ゲートとして組み込む。
- Colon-Bench を 14 種類の病変カテゴリ、バウンディングボックス、セグメンテーションマスク、そして 133k 語の臨床テキストとともに構築する。
- 4つのタスク(2値病変分類、OV-VOS、2つの難易度のVQA)で最新の複数の MLLM を評価する。
- クロスモデルの誤差分析に基づく Colon-Skill プロンプティング戦略を導入し、ゼロショット VQA の性能を向上させる。

実験結果
リサーチクエスチョン
- RQ1エージェント作動ワークフローは、密で高品質な結腸内視鏡アノテーションを大規模に生産するのにどれほど効果的か。
- RQ2Colon-Bench を用いた現在の MLLMs の結腸内視鏡特有のタスク(分類、OV-VOS、VQA)にどれほど適用できるか。
- RQ3構造化されたドメイン知識プロンプティングは、結腸内視鏡データセットにおける医療 VQA の MLLM パフォーマンスを改善するか。
- RQ4長大な結腸内視鏡動画における時間的文脈が分割と VQA の性能に与える影響はどの程度か。
主な発見
- Colon-Bench パイプラインは 464,035 フレーム全体で 528 ウィンドウをアノテーションし、300,132 バウンディングボックス、213,067 セグメンテーションマスク、133,289 語の臨床テキストを生成した。
- Colon-Bench は4つの評価タスクを提供する:二値分類、OV-VOS、そして2つのVQA難易度(プロンプトあり・なし)。
- Seed 1.6 や Gemini 3 などのオープンウェイト MLLMs は、タスク全般で高い性能を示し、Gemini 3 Pro/Flash が VQA および分割指標をリードした。
- Open-vocabulary なセグメンテーションは GPT-5.4 + EdgeTAM が SAM-3 より 32.0% の mIoU を上回る動画分割を実現した。
- 新規の Colon-Skill プロンプティング戦略は、ほとんどのモデルでゼロショット MLLM の VQA 性能を最大で 9.7% 向上させた。
- アブレーションにより、3フレーム検出を用いることが分割品質と計算量の良いバランスをもたらすことが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。