[論文レビュー] Never Train from Scratch: Fair Comparison of Long-Sequence Models Requires Data-Driven Priors
この論文は、ランダムな重み初期化の代わりに自己自己事前学習(SPT)によるデータ駆動型事前分布を用いることで、長文系列モデルの公平な評価が可能になると主張している。自己事前学習により、下流タスクのデータ上でモデルを事前学習することで、変換器と状態空間モデル(SSM)の両方の性能が向上し、vanilla変換器がS4のLRA性能に並ぶようになり、PathX-256ではSSMの性能が20ポイント向上する。これにより、多くのアーキテクチャ的バイアスが不要になる。
Modeling long-range dependencies across sequences is a longstanding goal in machine learning and has led to architectures, such as state space models, that dramatically outperform Transformers on long sequences. However, these impressive empirical gains have been by and large demonstrated on benchmarks (e.g. Long Range Arena), where models are randomly initialized and trained to predict a target label from an input sequence. In this work, we show that random initialization leads to gross overestimation of the differences between architectures and that pretraining with standard denoising objectives, using $ extit{only the downstream task data}$, leads to dramatic gains across multiple architectures and to very small gaps between Transformers and state space models (SSMs). In stark contrast to prior works, we find vanilla Transformers to match the performance of S4 on Long Range Arena when properly pretrained, and we improve the best reported results of SSMs on the PathX-256 task by 20 absolute points. Subsequently, we analyze the utility of previously-proposed structured parameterizations for SSMs and show they become mostly redundant in the presence of data-driven initialization obtained through pretraining. Our work shows that, when evaluating different architectures on supervised tasks, incorporation of data-driven priors via pretraining is essential for reliable performance estimation, and can be done efficiently.
研究の動機と目的
- ランダムな重み初期化による長文系列モデル間の性能比較の不平等を是正すること。
- 下流タスクのデータでの事前学習のみが、長距離モデリングに有効なインダクティブバイアスを提供できるかを調査すること。
- モデルが適切に事前学習されている場合、SSMにおけるアーキテクチャ的革新が依然として必要かどうかを評価すること。
- 自己事前学習(SPT)が一般化性能を著しく向上させ、アーキテクチャ間の性能格差を縮小することを実証すること。
提案手法
- 外部コーパスを用いずに、下流タスクのデータのみを用いてマスク付きノイズ除去目的による自己事前学習(SPT)を適用する。
- Long Range Arena(LRA)およびPathX-256ベンチマークにおいて、スクラッチから訓練するモデルとSPT微調整済みモデルを比較する。
- 2段階の訓練プロトコルを用いる:まずノイズ除去タスクで事前学習し、その後下流分類タスクで微調整する。
- ランダム初期化とSPTの両方の条件下で、標準的な変換器とS4状態空間モデルの性能を比較する。
- SPTの利得が追加の計算量に起因するのかを隔離するため、計算量に見合ったアブレーションスタディを実施する。
- モデルサイズを4桁のスケールにわたって変化させ、SPTのスケーラビリティを評価する。
実験結果
リサーチクエスチョン
- RQ1ランダムな重み初期化は、長文系列アーキテクチャ間の性能比較を歪める要因となるか?
- RQ2下流タスクのデータでの自己事前学習のみで、変換器とSSMの性能格差を埋めるのに十分なインダクティブバイアスを提供できるか?
- RQ3モデルがデータ駆動型事前分布で事前学習された場合、SSMに手作業で組み込まれたアーキテクチャ的バイアスはどの程度不要になるか?
- RQ4SPTは追加の計算量のみを増加させるのと比べて、一般化性能をより著しく向上させるか?
- RQ5SPTの性能は、さまざまなモデルサイズとシーケンス長にわたってどのようにスケーリングするか?
主な発見
- SPTによる事前学習を経たvanilla変換器は、アーキテクチャの変更なしにLong Range Arena(LRA)で最先端の性能を達成し、S4の報告された結果に並ぶ。
- S4は、スクラッチからの訓練に比べてSPTを用いることでPathX-256タスクで20ポイントの絶対的向上を達成した。
- SPTにより、LRAにおける変換器とSSMの性能格差はほぼゼロにまで縮小され、適切な事前分布が用いられた場合、アーキテクチャの違いがそれほど重要でないことが示された。
- SPTは、10万から1000万パラメータの全モデルサイズで一貫して性能を向上させ、スケールに対して強いロバストネスを示した。
- SPTの利得は、追加の計算量だけでは説明できない。計算量に見合った実験では、SPTが固定された総トレーニング予算のもとでスクラッチからの訓練を上回ることが確認された。
- SPTと組み合わせた場合、SSMにおける構造化パラメータ化はほとんど不要になることが示され、データ駆動型事前分布が手作業で設計されたアーキテクチャ的バイアスの多くを代替していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。