Also known as: MOE
Mixture of Experts (MOE) — архитектура модели, которая направляет inputs к выбранным специализированным подмоделям, или experts, вместо использования всей модели для каждого input. Это может увеличивать ёмкость модели при контроле вычислений, поскольку для конкретного примера активируется только часть экспертов.
A scheme to increase neural network efficiency by using only a subset of its parameters (known as an expert ) to process a given input token or example. A gating network routes each input token or example to the proper expert(s). For details, see either of the following papers: - Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer - Mixture-of-Experts with Expert Choice Routing