Skip to main content
QUICK REVIEW

[論文レビュー] Enriching Location Representation with Detailed Semantic Information

Muehlburger, Herbert, Wotawa, Franz|arXiv (Cornell University)|Jan 1, 2024
Natural Language Processing Techniques被引用数 329
ひとこと要約

Llama 3 は、8B、70B、405Bパラメータバージョンを含む多言語基盤言語モデルの新世代であり、15Tの多言語トークンと3.8×10²⁵ FLOPsで学習された。MMLU、GSM8K、HumanEvalなどのベンチマークで最先端の性能を達成し、GPT-4 や他の優れたモデルと同等またはそれを上回り、Llama 3 Community License の下で公開されている。

ABSTRACT

Cyber-physical systems (CPS) are critical to modern infrastructure, but are vulnerable to faults and anomalies that threaten their operational safety. In this work, we evaluate the use of open-source Large Language Models (LLMs), such as Mistral 7B, Llama3.1:8b-instruct-fp16, and others to detect anomalies in two distinct datasets: battery management and powertrain systems. Our methodology utilises retrieval-augmented generation (RAG) techniques, incorporating a novel two-step process where LLMs first infer operational rules from normal behavior before applying these rules for fault detection. During the experiments, we found that the original prompt design yielded strong results for the battery dataset but required modification for the powertrain dataset to improve performance. The adjusted prompt, which emphasises rule inference, significantly improved anomaly detection for the powertrain dataset. Experimental results show that models like Mistral 7B achieved F1-scores up to 0.99, while Llama3.1:8b-instruct-fp16 and Gemma 2 reached perfect F1-scores of 1.0 in complex scenarios. These findings demonstrate the impact of effective prompt design and rule inference in improving LLM-based fault detection for CPS, contributing to increased operational resilience.

研究の動機と目的

  • 多様なNLPタスクにおいて最先端の性能を達成するか、それを上回る高品質な多言語基盤モデルの開発。
  • データの厳密な選別と収集、スケーリング(15Tトークン、3.8×10²⁵ FLOPs)、およびより優れた学習プロセスによるモデル品質の向上。
  • 推論コストを抑えた小規模モデルでも、推論能力、コーディング、ツール利用、長文脈理解の強化を実現。
  • 教師強化学習(SFT)、拒否サンプリング(RS)、直接的好み最適化(DPO)を用いた微調整による安全性と整合性の確保。
  • 研究の促進と責任あるAI開発を支援するため、最大のモデル(405Bパラメータ)を公開すること。

提案手法

  • 128Kのコンテキスト長まで対応する密度型Transformerアーキテクチャを用いて、15Tトークンの多言語コーパス上でLlama 3を事前学習。
  • 事前学習および微調整段階で、データ品質の向上を目的とした厳密なデータ選別およびフィルタリングパイプラインの適用。
  • 最大モデルを405Bパラメータおよび3.8×10²⁵ FLOPsまでスケーリングし、小規模モデルに対しては計算最適性能を超えるよう長期間の学習を実施。
  • 教師強化学習(SFT)、拒否サンプリング(RS)、直接的好み最適化(DPO)を組み合わせた簡素化された微調整パイプラインを採用し、整合性を向上。
  • マルチモーダル機能(画像、動画、音声)を組み合わせるアプローチにより統合を図ったが、これらはまだ公開されていない。
  • 微調整段階で405Bモデルを活用し、品質改善を小規模モデルに蒸留することで、推論コストを抑えた高い性能を実現。

実験結果

リサーチクエスチョン

  • RQ1高品質で選別されたデータで学習された大規模な多言語基盤モデルは、GPT-4などの先端モデルと同等の性能を達成できるか?
  • RQ2モデルスケールの拡大とデータ品質の向上が、推論、コーディング、多言語理解タスクのパフォーマンスに与える影響は何か?
  • RQ3複雑な強化学習を用いずに、SFT + RS + DPOという簡素な微調整パイプラインで、強力な整合性と有用性を達成できるか?
  • RQ4405Bパラメータの大型モデルが、微調整段階での蒸留によって小規模モデル(8B、70B)の性能をどの程度向上できるか?
  • RQ5組み合わせ的マルチモーダル統合アプローチが、画像・動画・音声認識ベンチマークで最先端の性能を発揮するか?

主な発見

  • Llama 3 405Bモデルは、MMLU(5ショット)で87.3%、IFEvalで88.6%を達成し、GPT-3.5 Turbo や Gemma 2 9B を上回り、GPT-4の性能に近づいた。
  • HumanEval(0ショット)では、Llama 3 405Bが89.0%の正確性を達成し、GPT-3.5 Turbo(68.0%)を上回り、GPT-4(86.6%)および GPT-4o(90.2%)に近い水準に到達した。
  • GSM8K(8ショット、CoT)では、Llama 3 405Bが96.8%の正確性を達成し、GPT-3.5 Turbo(81.6%)を上回り、SOTAの96.4%(Claude 3.5 Sonnet)に近い水準に達した。
  • Llama 3 70Bモデルは、MMLU(0ショット、CoT)で86.0%を達成し、Mistral 7B(60.5%)や Mixtral 8x22B(79.9%)を上回り、優れた推論力と知識保持能力を示した。
  • 長文脈タスクでは、Llama 3 405BがZeroSCROLLS/QuALITYで95.2%、NIH/Multi-needleで98.1%を達成し、長文脈推論および検索タスクでの優れた性能を示した。
  • MGSM(0ショット、CoT)では、Llama 3 405Bが91.6%を達成し、Mistral 7B(29.9%) や Gemma 2 9B(53.2%)を大きく上回り、優れた多言語一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。