首页 / AI 百科 / 混合专家模型(MoE)

混合专家模型(MoE)Mixture of Experts (MoE)

模型架构

把一个大网络拆成许多专精的小网络,每次只叫其中几个来处理当前内容,于是总参数量很大、实际计算量却不高。

稠密模型有个尴尬:想让能力更强,就得把参数做大,但每次回答都用上全部参数,计算量随之等比例上涨。MoE 的目标是打破这个绑定——让「有多少参数」和「每次用多少参数」分开。

核心思想

想象一家大医院。病人不需要见所有科室的医生,而是先到分诊台,由分诊护士判断该挂哪几个科,只看对应专家。医院里医生总数可以很多,但每个病人实际动用的只有少数几位。 - 专家:把网络中的某层替换成若干并行的前馈子网络,每个都可以看成一个小专家。 - 门控与路由:一个很小的网络根据当前输入,算出该把这份输入交给哪几个专家(常见是少数几个,而不是全部)。 - 加权合并:被选中的专家各自处理,输出按门控给出的权重相加。 由于每个 Token 只走其中少数专家,单次计算量只与「激活的那部分」有关,于是模型的总参数量可以做得很大,而计算开销保持在可接受范围。

为什么重要

它让「参数规模」和「推理成本」第一次可以分开谈:总容量上去了,运行费用却不必同比例增加。这是近年大模型能在有限算力预算下继续扩大的重要手段之一。

常见误区

相关词条
Transformer 量化与模型蒸馏 大语言模型(LLM)
本词条为原创科普整理,用于帮助理解,不替代论文与官方文档。如有技术性错漏,欢迎指正。
← 返回 AI 百科 · 返回首页