混合专家模型

term_id: moe

Category: basic_concepts

Definition

混合专家(MoE)是一种旨在提高效率和可扩展性的机器学习架构。MoE 不使用单个大型模型处理所有任务,而是采用多个较小的“专家”网络。

Summary

一种架构模式,通过门控机制结合多个专用神经网络(专家)来处理输入。

Key Concepts

  • 稀疏激活
  • 门控网络
  • 专家专业化
  • 可扩展性

Use Cases

  • 高效训练大型语言模型
  • 降低大型模型的推理延迟
  • 在多模态系统中处理多样化的输入类型