混合专家模型Mixture of Experts

Mixture of Experts是一种神经网络架构,会针对每次输入只启用部分专家网络,以减少计算量。

3篇文章
最近提及

Mixture of Experts(MoE)是一种AI模型架构:对于每个输入token,路由器只选择多个专家子网络中的一部分参与计算。与对每个token使用全部参数的稠密模型不同,它相对于总参数量所需的单token计算量更少,但未被启用的专家权重仍需载入内存。

这一思路于1991年提出,Mixtral、DeepSeek-V3等大型语言模型采用了该架构。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

Mistral Large 4:一款开放权重模型,即公开训练好的权重供他人运行;它采用混合专家架构,每个token只激活网络的一部分。

26B (26B-A4B) 混合专家 单张GPU

专家混合架构(Mixture of Experts,MoE)是另一种值得了解的模型设计。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。