[論文レビュー] On the Replicability and Reproducibility of Deep Learning in Software Engineering
本稿は、ソフトウェア工学(SE)における深層学習(DL)の再現可能性と再現可能性の課題を調査し、93件のレビュー対象DL研究のうちわずか10.8%がこれらの問題に対処しており、74.2%はコードやデータを共有していないことを明らかにした。代表的な4つのモデルを再実行した結果、最適化のランダムネス、収束問題、語彙およびテストデータサイズへの感受性により、性能の不安定さが生じた。これは、SE分野のDL研究において、共有可能な再現パッケージ、安定した学習、強固な評価の実施が急務であることを示している。
Deep learning (DL) techniques have gained significant popularity among software engineering (SE) researchers in recent years. This is because they can often solve many SE challenges without enormous manual feature engineering effort and complex domain knowledge. Although many DL studies have reported substantial advantages over other state-of-the-art models on effectiveness, they often ignore two factors: (1) replicability - whether the reported experimental result can be approximately reproduced in high probability with the same DL model and the same data; and (2) reproducibility - whether one reported experimental findings can be reproduced by new experiments with the same experimental protocol and DL model, but different sampled real-world data. Unlike traditional machine learning (ML) models, DL studies commonly overlook these two factors and declare them as minor threats or leave them for future work. This is mainly due to high model complexity with many manually set parameters and the time-consuming optimization process. In this study, we conducted a literature review on 93 DL studies recently published in twenty SE journals or conferences. Our statistics show the urgency of investigating these two factors in SE. Moreover, we re-ran four representative DL models in SE. Experimental results show the importance of replicability and reproducibility, where the reported performance of a DL model could not be replicated for an unstable optimization process. Reproducibility could be substantially compromised if the model training is not convergent, or if performance is sensitive to the size of vocabulary and testing data. It is therefore urgent for the SE community to provide a long-lasting link to a replication package, enhance DL-based solution stability and convergence, and avoid performance sensitivity on different sampled data.
研究の動機と目的
- ソフトウェア工学(SE)分野における深層学習(DL)研究における再現可能性と再現可能性の問題の広がりを調査すること。
- DLベースのSE研究が、再現に不可欠なソースコードとデータをどれだけ共有しているかを評価すること。
- モデルの不安定さ、収束性、語彙サイズ、テストデータの変動が、DLベースのSE研究における再現性に与える影響を評価すること。
- 今後のDLベースのSE研究における再現可能性と再現性を改善するための実行可能な提言を提供すること。
提案手法
- 過去5年間で発表された20本のSE関連ジャーネルおよび会議で発表された93件のDL研究を対象に、体系的文献レビューを実施した。
- 再現パッケージ(ソースコードとデータ)の可用性、および研究が再現可能性・再現可能性の懸念をどれほど言及しているかを分析した。
- 同じプロトコルを用いて、トップSE会議から抽出した4つの代表的DLモデルを再実装・再評価し、異なる乱数シードとデータ分割を用いた。
- 複数回の実行におけるモデル性能の安定性を測定して再現可能性を評価し、語彙サイズおよびテストデータサイズへの感受性を再現性の観点から評価した。
- 人為的バイアスを最小限に抑えるために自動評価を用い、一貫性のある性能測定を確保した。
- 収束に基づく学習を固定反復回数の学習に置き換えるなど、緩和戦略を提言した。また、抽象構文木のような強固な特徴を組み込むことで、データ感受性を低減する手法も提案した。
実験結果
リサーチクエスチョン
- RQ1近年のDLベースのSE研究は、どの程度再現可能性・再現可能性の問題について報告しているか?
- RQ2DLベースのSE研究では、ソースコードとデータはどの程度共有されており、それが再現性にどのような影響を与えているか?
- RQ3ランダム初期化および最適化によるモデルの不安定さが、報告された結果の再現性にどのように影響しているか?
- RQ4語彙サイズとテストデータサイズは、SEタスクにおけるDLモデル性能の再現性にどのように影響するか?
- RQ5DLベースのSE研究の再現可能性と再現性を向上させるために、どのような実用的措置が取れるか?
主な発見
- レビュー対象の93件のDLベースのSE研究のうち、わずか10.8%が再現可能性または再現可能性の問題に対処しており、科学的原則の無視が広がっていることが示された。
- 74.2%の研究がソースコードやデータを共有しておらず、再現可能性の可能性が著しく損なわれていた。
- 4つの代表的DLモデルを再実行した結果、ランダムネスに起因する最適化の影響により、実行間での性能に顕著な不安定さが生じ、再現性が低いことが判明した。
- モデル性能は語彙サイズおよびテストデータサイズに強く感受され、異なるデータ分割でも性能に顕著なばらつきが見られ、再現性が損なわれた。
- 学習中の収束レベルが低く、性能が不安定で揺らぎやすい状態にあり、再現性がさらに損なわれた。
- 本研究は、共有可能な再現パッケージ、収束状態の監視、強固な評価手法の導入が、DLベースのSE研究の科学的妥当性を高めるために不可欠であると結論づけた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。