Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement One-Shot Learning for Artificially Intelligent Classification Systems

Anton Puzanov, Kobi Cohen|arXiv (Cornell University)|Aug 4, 2018
Anomaly Detection Techniques and Applications参考文献 34被引用数 15
ひとこと要約

本論文は、リソース制約下でのシステム全体のパフォーマンス最適化を目的として、レアイベントを自動で分類するか、人間のアナリストにルーティングするかを動的に意思決定する、新しい深層強化学習フレームワークであるDeep Reinforcement One-shot Learning (DeROL)を提案する。従来のしきい値ベース手法およびLeast Confidenceアクティブラーニングベースラインを上回り、遅延とアナリストの作業負荷を最小限に抑えながら累積報酬を最大化する適応的ポリシーを学習する。

ABSTRACT

In recent years there has been a sharp rise in networking applications, in which significant events need to be classified but only a few training instances are available. These are known as cases of one-shot learning. Examples include analyzing network traffic under zero-day attacks, and computer vision tasks by sensor networks deployed in the field. To handle this challenging task, organizations often use human analysts to classify events under high uncertainty. Existing algorithms use a threshold-based mechanism to decide whether to classify an object automatically or send it to an analyst for deeper inspection. However, this approach leads to a significant waste of resources since it does not take the practical temporal constraints of system resources into account. Our contribution is threefold. First, we develop a novel Deep Reinforcement One-shot Learning (DeROL) framework to address this challenge. The basic idea of the DeROL algorithm is to train a deep-Q network to obtain a policy which is oblivious to the unseen classes in the testing data. Then, in real-time, DeROL maps the current state of the one-shot learning process to operational actions based on the trained deep-Q network, to maximize the objective function. Second, we develop the first open-source software for practical artificially intelligent one-shot classification systems with limited resources for the benefit of researchers in related fields. Third, we present an extensive experimental study using the OMNIGLOT dataset for computer vision tasks and the UNSW-NB15 dataset for intrusion detection tasks that demonstrates the versatility and efficiency of the DeROL framework.

研究の動機と目的

  • 新規クラスのトレーニングインスタンスがわずかまたは存在しないリアルワールドシステムにおけるワンショットラーニングの課題に対処すること。
  • 時間的・リソース的制約を考慮しない従来のしきい値ベースのルーティング機構が人間アナリストの時間を無駄にしているという非効率性を克服すること。
  • リアルタイムで人間アナリストのフィードバックから学習し、手動でのハイパーパrameterチューニングなしに分類意思決定を改善する、適応的かつ自己調整可能なAIシステムを開発すること。
  • コンピュータビジョン(OMNIGLOT)およびネットワークインシデント検出(UNSW-NB15)を含む多様な分野への汎用性を実証すること。

提案手法

  • エージェントが現在の状態に基づいて(自動分類またはアナリストに送信)のアクションを選択するマルコフ決定過程(MDP)としてワンショット分類意思決定プロセスを定式化する。
  • 入力状態(例:特徴埋め込み、クラスメモリ、アナリスト負荷)からアクションにマッピングするポリシーを学習するため、深層Qネットワーク(DQN)を訓練する。
  • 誤った分類(例:悪意あるものを正常と誤分類した場合に-30)、遅延(RD = -2TD/10)、アナリスト負荷(RA = -0.5·LA(t))に対してペナルティを課し、正しい意思決定には報酬を与えるカスタム報酬関数を設計する。
  • UNSW-NB15タスクでは類似度比較にユークリッド距離を用い、OMNIGLOTで使用された画像固有の指標(例:修正ハウスドルフ距離)とは異なる。
  • ワンショットラーニングの条件を再現するため、1クラスあたり最大20件のサンプルを保存する動的メモリ機構を実装する(正常と悪意あるの両方をバランスさせる)。
  • 高次元状態空間における学習の安定化と収束の向上を図るため、経験再生とターゲットネットワークをDQN訓練プロセスに適用する。

実験結果

リサーチクエスチョン

  • RQ1手動でのハイパーパrameterチューニングなしに、深層強化学習エージェントはワンショットラーニング状況下で最適なルーティング意思決定(自動分類対アナリスト分類)を学習できるか?
  • RQ2限られたアナリストの可用性と時間的制約下で、DeROLフレームワークは従来のしきい値ベース手法およびLeast Confidenceアクティブラーニング手法と比較してどのように性能を発揮するか?
  • RQ3DeROLフレームワークは、画像認識やネットワークインシデント検出といった異なるワンショット分類タスクにどの程度一般化可能か?
  • RQ4アナリスト負荷の変動やイベント処理の遅延といった変化する環境要因に、システムはどのように適応するか?
  • RQ5報酬関数の設計は、実世界の展開環境におけるポリシー収束と分類精度にどのような影響を及えるか?

主な発見

  • DeROLアルゴリズムは、OMNIGLOTおよびUNSW-NB15データセットの両方で累積報酬の観点でLeast Confidenceアクティブラーニングベースラインを著しく上回る安定したポリシーに収束する。
  • 分類精度が99%以上((#正しく分類されたサンプル + #ラベルリクエスト数) / 総サンプル数で定義)を達成しており、ワンショット条件下でも高い信頼性を示している。
  • 遅延に対する報酬が線形に減少する(RD = -2TD/10)ことから、サンプルの遅延を効果的に回避していることが示され、迅速な意思決定を促進するインcentiveが働いている。
  • アナリスト負荷に応じた動的報酬メカニズム(RA = -0.5·LA(t))により、アナリストが忙しい場合には人間依存度を低下させるなど、システムは負荷変動に適応している。
  • 構造的変更を最小限に抑えながら、画像ベース(OMNIGLOT)およびネットワークベース(UNSW-NB15)の両方の分類タスクを効果的に処理でき、その汎用性を実証した。
  • 図7(b)の実証的アクション確率から、ポリシーが必要に応じて分類を遅延させるのみであり、自己判断とシステム状態に基づいた知的なルーティングを学習していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。