Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Structure Search for Parameter-Efficient Tuning

Shengding Hu, Zhen Zhang|arXiv (Cornell University)|Jun 15, 2022
Modular Robots and Swarm Intelligence被引用数 6
ひとこと要約

S3 PET は、トレーニング可能なパラメータ数を明示的に制御するシフトされたグローバルシグモイドを用いて、事前学習モデル内のスパースでパラメータ効率の良いチューニング(PET)構造を自動的に探索する微分可能で二段階最適化フレームワークを提案する。わずか 0.01% のトレーニング可能なパラメータでフル微調整性能の 99% 以上を達成し、手動で設計された構造を上回りながら、さまざまなタスクにわたって転送可能である。

ABSTRACT

Adapting large pre-trained models (PTMs) through fine-tuning imposes prohibitive computational and storage burdens. Recent studies of parameter-efficient tuning (PET) find that only optimizing a small portion of parameters conditioned on PTMs could yield on-par performance compared to conventional fine-tuning. Generally, PET methods exquisitely design parameter-efficient modules (PET modules) which could be applied to arbitrary fine-grained positions inside PTMs. However, the effectiveness of these fine-grained positions largely relies on sophisticated manual designation, thereby usually producing sub-optimal results. In contrast to the manual designation, we explore constructing PET modules in an automatic manner. We automatically extbf{S}earch for the extbf{S}parse extbf{S}tructure of extbf{P}arameter- extbf{E}fficient extbf{T}uning (S$^3$PET). Based on a unified framework of various PET methods, S$^3$PET conducts the differentiable PET structure search through bi-level optimization and proposes shifted global sigmoid method to explicitly control the number of trainable parameters. Extensive experiments show that S$^3$PET surpasses manual and random structures with less trainable parameters. The searched structures preserve more than 99\% fine-tuning performance with 0.01\% trainable parameters. Moreover, the advantage of S$^3$PET is amplified with extremely low trainable parameters budgets (0.0009\%$\sim$0.01\%). The searched structures are transferable and explainable, providing suggestions and guidance for the future design of PET methods.

研究の動機と目的

  • パラメータ効率の良い微調整における手動で設計された PET モジュールの非効率性と最適性の欠如に対処すること。
  • 厳密なパラメータ予算下でパフォーマンスを最大化する最適なスパースな PET モジュール構造を自動で発見すること。
  • 構造探索中にトレーニング可能なパラメータ数を明示的に制御する手法を開発すること。
  • 下流タスクに一般化可能な転送性と説明可能性を備えた PET 構造を作成すること。

提案手法

  • 事前学習モデルの各層および位置におけるすべての潜在的 PET モジュールに構造的パラメータを用いた確率的ゲーティングを適用することで、統一された探索空間を構築する。
  • 二段階最適化を採用し、アーキテクチャ(構造的パラメータ)とモデル重みを同時に最適化することで、微分可能な構造探索を可能にする。
  • スパースネスを明示的に制御し、探索中にターゲットのトレーニング可能な PET モジュール数を満たすために、シフトされたグローバルシグモイド関数を導入する。
  • PET 構造探索を制約付きニューラルアーキテクチャ探索問題として扱い、パフォーマンスフィードバックを用いて構造選択をガイドする。
  • 1 つの柔軟な探索空間内でさまざまな PET モジュール(例:アダプタ、LoRA、BitFit)を統合し、エンドツーエンド最適化を可能にする。
  • 学習から再び開始するのを避けるために、事前学習バックボーンモデルを基盤とし、効率的な構造探索に集中する。

実験結果

リサーチクエスチョン

  • RQ1厳密なパラメータ予算下で、人間が設計したものよりも効果的な PET モジュール構造を自動的かつ微分可能な手法が発見できるか?
  • RQ2パラメータ効率要件を満たすために、構造探索中にスパースネスをどのように明示的に制御できるか?
  • RQ3探索された PET 構造は、さまざまな下流 NLP タスクにどの程度一般化可能か?
  • RQ4最適な PET モジュールの配置にどのようなパターンが現れ、それらは解釈可能で一貫性があるか?
  • RQ5トレーニング可能なパラメータ数が極めて少ない場合(例:0.0009%〜0.01%)に、探索された構造のパフォーマンスはベースラインと比べてどうか?

主な発見

  • S3 PET は、GLUE でトレーニング可能なパラメータがたった 0.01% の状態で、フル微調整性能の 99% を達成し、手動で設計された構造を著しく上回った。
  • SuperGLUE でも、同じ 0.01% のパラメータ予算下で、フル微調整性能の 98% を回復した。
  • 性能を維持または向上させながら、約 1/5 のトレーニング可能なパラメータで人間が設計した構造を上回った。
  • 探索された構造は非常に高い転送性を示した:ソースデータセットで探索した後、ターゲットタスクで微調整した場合、直接ターゲットで探索した構造を上回ることが多かった。
  • 特に超低パラメータ予算下では、$L_0$ 正則化よりもシフトされたグローバルシグモイド法がスパースネス制御およびパフォーマンスで優れていた。
  • 可視化により、高層層の自己注意およびクロス注意モジュールに BitFit モジュールが強く好まれることが明らかになったほか、エンコーダーおよびデコーダーの最終層が一貫して強調されていることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。