[論文レビュー] Interactive Multi-fidelity Learning for Cost-effective Adaptation of Language Model with Sparse Human Supervision
本稿では、低精度のLLMによるアノテーションと高精度の人間によるアノテーションを戦略的に組み合わせることで、コスト効率の高い小規模なドメイン特化言語モデルのファインチューニングフレームワーク「インタラクティブマルチフィデリティ学習(IMFL)」を提案する。プロンプトリtrieバルと可変バッチサイズを用いた探索・活用型クエリ戦略を採用することで、IMFLは金融および医療タスクにおいて、人間によるアノテーションの5倍の性能を達成しつつ、人間のラベリング予算を1/3にまで削減する。
Large language models (LLMs) have demonstrated remarkable capabilities in various tasks. However, their suitability for domain-specific tasks, is limited due to their immense scale at deployment, susceptibility to misinformation, and more importantly, high data annotation costs. We propose a novel Interactive Multi-Fidelity Learning (IMFL) framework for the cost-effective development of small domain-specific LMs under limited annotation budgets. Our approach formulates the domain-specific fine-tuning process as a multi-fidelity learning problem, focusing on identifying the optimal acquisition strategy that balances between low-fidelity automatic LLM annotations and high-fidelity human annotations to maximize model performance. We further propose an exploration-exploitation query strategy that enhances annotation diversity and informativeness, incorporating two innovative designs: 1) prompt retrieval that selects in-context examples from human-annotated samples to improve LLM annotation, and 2) variable batch size that controls the order for choosing each fidelity to facilitate knowledge distillation, ultimately enhancing annotation quality. Extensive experiments on financial and medical tasks demonstrate that IMFL achieves superior performance compared with single fidelity annotations. Given a limited budget of human annotation, IMFL significantly outperforms the human annotation baselines in all four tasks and achieves very close performance as human annotations on two of the tasks. These promising results suggest that the high human annotation costs in domain-specific tasks can be significantly reduced by employing IMFL, which utilizes fewer human annotations, supplemented with cheaper and faster LLM (e.g., GPT-3.5) annotations to achieve comparable performance.
研究の動機と目的
- 専門知識が求められるドメイン特化言語モデルのファインチューニングにおいて、人間によるアノテーションの高コストを解消すること。
- 高リスク分野では幻覚や誤情報が生じる可能性がある単一のLLMによるアノテーションに依存するのを回避すること。
- 厳密なアノテーション予算のもとで、低精度のLLMアノテーションと高精度の人間アノテーションを最適にバランスさせるコスト効率の高いファインチューニングフレームワークの開発。
- 文脈内学習と動的バッチスケジューリングを活用して、マルチフィデリティ学習設定においてアノテーション品質とモデル性能を向上させること。
提案手法
- LLMと人間を異なるフィデリティを持つアノテーションソースとして扱い、ドメイン特化ファインチューニングをインタラクティブマルチフィデリティ学習問題として定式化する。
- 探索・活用型クエリ戦略を設計:LLMは多様性を探索し、人間のアノテーションは情報量を活用する。
- 人間がアノテートしたデータから文脈内例を選択するプロンプトリtrieバルを導入し、LLMによるアノテーションの正確性を向上させる。
- 可変バッチサイズを実装してアノテーション取得の順序を制御し、LLMと人間のアノテーション間での知識蒸留を効果的に実現する。
- 反復的アクティブラーニングを適用して、人間によるアノテーションに最も不確実性が高く情報量の多いサンプルを選択し、重複作業を最小限に抑える。
- 最終モデルからLLM-アノテーターへの知識蒸留を実施し、将来のLLM予測の精度を向上させる。

実験結果
リサーチクエスチョン
- RQ1マルチフィデリティ学習フレームワークは、ドメイン特化言語モデルのファインチューニングにおいて、パフォーマンスを損なわせることなく人間によるアノテーションコストを削減できるか?
- RQ2低精度のLLMアノテーションとスパースな高精度の人間アノテーションを組み合わせた場合、単一フィデリティベースラインと比較してモデル性能はどのように変化するか?
- RQ3プロンプトリtrieバルと可変バッチサイズは、リソースが限られた高リスク分野におけるLLM生成アノテーションの品質をどの程度向上できるか?
- RQ4提案されたフレームワークは、人間によるラベリング作業を1/3に抑えながら、5倍の人間アノテーション予算に近い性能を達成できるか?
- RQ5LLMと人間のアノテーターの相互作用は、金融および医療NLPタスクにおけるモデルの汎化性能と耐性にどのように影響を与えるか?
主な発見
- IMFLは、4つの評価タスク(金融および医療NLP)すべてにおいて、3倍の人間アノテーションベースラインを顕著に上回り、優れたコストパフォーマンスのトレードオフを示している。
- 4つのタスクのうち2つにおいて、IMFLは5倍の人間アノテーションの上限性能に非常に近い水準に達しており、顕著な効率性の向上が確認された。
- プロンプトリtrieバルの統合により、人間がアノテートしたデータから関連する文脈内例を選択することで、LLMアノテーションの正確性が向上した。
- 可変バッチサイズは知識蒸留を強化し、LLMと人間のアノテーションの整合性を高め、モデルの汎化性能を改善した。
- フレームワークは人間のアノテーションコストを最大66%削減しながら、完全な人間アノテーションベースラインと同等またはそれ以上のパフォーマンスを維持した。
- IMFLは多様なドメインにわたり強固であり、限られたアノテーション予算のもとで、金融および医療NLPタスクの両方で一貫した向上を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。